/v1/messages を呼び出します。
ツール呼び出し
tools(それぞれ name、description、input_schema を含む)でツールを宣言し、
tool_choice で選択を制御します。複数ターンの tool_use / tool_result
コンテンツブロックに対応しています。
ストリーミング
stream: true を設定すると Anthropic の SSE イベントストリームで返ります:
message_start、content_block_start、content_block_delta、
content_block_stop、message_delta、message_stop。
パラメータ
対応:model、messages、max_tokens(必須)、system、temperature、
top_p、top_k、stop_sequences、tools、tool_choice、stream。
推論強度
対応する Claude モデルではネイティブのoutput_config.effort を使用します。対応値はバージョンに依存します。モデル別の推論制御を参照してください。ネイティブの thinking は独立しており、effort は思考を有効化せず、トークン予算も設定しません。必要に応じてモデルの要件に合わせて thinking を別途設定してください。
max_completion_tokens、max_output_tokens およびネイティブの対応フィールドは、推論と最終回答の合計トークン数を制限します。effort 自体は出力トークン上限ではありません。予算を使い切ると(Chat Completions の finish_reason: "length")、最終回答が不完全または空になる場合があります。