/v1/responses を使用します。
Reasoning の制御
gpt-5.5 と gpt-5.4 は Responses の reasoning 制御に対応しています。
reasoning.effort を使って思考の強度を設定します:
gpt-5.5 と gpt-5.4 は none、low、medium、high、xhigh に対応し、minimal と max には対応しません。トップレベルの reasoning_effort も互換エイリアスとして使用できます。両方を指定する場合は同じ値にしてください。不一致は 400 になります。
対応値はモデルごとに異なり、省略時は既定動作を維持します。モデル別の推論制御を参照してください。
各モデルが受け付ける強度、既定値、思考を無効化できるかどうかは GET /v1/models の capability_metadata.reasoning に公開されているため、クライアントは表をハードコードせずにモデルを設定できます。
max_completion_tokens、max_output_tokens およびネイティブの対応フィールドは、推論と最終回答の合計トークン数を制限します。effort 自体は出力トークン上限ではありません。予算を使い切ると(Chat Completions の finish_reason: "length")、最終回答が不完全または空になる場合があります。
Web 検索
OpenAI Responses の tools をそのまま渡せます。Web に接続した回答が必要な場合は、tools に
Web 検索ツールを含めます:
ストリーミング
stream: true を設定すると Responses の SSE イベントストリームを受け取れます。イベントは OpenAI
Responses 形式に従い、例えば response.created、response.output_text.delta、
ツールイベント、response.completed などがあります。
補足
modelは APIAny.AI の公開モデル ID です。max_output_tokensは Responses スタイルの出力トークン上限です。reasoning、text、tools、tool_choice、include、previous_response_id、storeなどの Responses ネイティブフィールドは、選択したモデルが 対応している場合に転送されます。
GPT-6 の出力とストリームの終了
gpt-6-astra では、認識可能な先頭の思考ブロックを最終回答から分離します。回答は content / output_text、思考内容は独立した reasoning フィールドまたは summary イベントから読み取ってください。明示的なタグの例や曖昧な記述は保持されます。推論強度や出力 Token 上限は変更しません。
ストリームの HTTP 200 だけでは生成成功を意味しません。エラーイベントを処理し、途中までの回答は未完了と表示してください。Chat では [DONE] 前の最後の usage を読み取り、Responses では response.completed、response.incomplete、response.failed / error を区別してください。