Skip to main content
クライアントが既に OpenAI Responses API 形式を使用している場合や、reasoning 強度の制御、 Web 検索ツール、公式の Responses Server-Sent Events といった Responses ネイティブ機能が必要な場合は、 /v1/responses を使用します。

Reasoning の制御

gpt-5.5 と gpt-5.4 は Responses の reasoning 制御に対応しています。 reasoning.effort を使って思考の強度を設定します:
gpt-5.5 と gpt-5.4 は none、low、medium、high、xhigh に対応し、minimal と max には対応しません。トップレベルの reasoning_effort も互換エイリアスとして使用できます。両方を指定する場合は同じ値にしてください。不一致は 400 になります。 対応値はモデルごとに異なり、省略時は既定動作を維持します。モデル別の推論制御を参照してください。 各モデルが受け付ける強度、既定値、思考を無効化できるかどうかは GET /v1/models の capability_metadata.reasoning に公開されているため、クライアントは表をハードコードせずにモデルを設定できます。 max_completion_tokens、max_output_tokens およびネイティブの対応フィールドは、推論と最終回答の合計トークン数を制限します。effort 自体は出力トークン上限ではありません。予算を使い切ると(Chat Completions の finish_reason: "length")、最終回答が不完全または空になる場合があります。

Web 検索

OpenAI Responses の tools をそのまま渡せます。Web に接続した回答が必要な場合は、tools に Web 検索ツールを含めます:
APIAny.AI は Responses ネイティブのツールを、それらに対応する互換モデルへ転送します。Function tools にも対応しています。

ストリーミング

stream: true を設定すると Responses の SSE イベントストリームを受け取れます。イベントは OpenAI Responses 形式に従い、例えば response.created、response.output_text.delta、 ツールイベント、response.completed などがあります。

補足

  • model は APIAny.AI の公開モデル ID です。
  • max_output_tokens は Responses スタイルの出力トークン上限です。
  • reasoning、text、tools、tool_choice、include、 previous_response_id、store などの Responses ネイティブフィールドは、選択したモデルが 対応している場合に転送されます。

GPT-6 の出力とストリームの終了

gpt-6-astra では、認識可能な先頭の思考ブロックを最終回答から分離します。回答は content / output_text、思考内容は独立した reasoning フィールドまたは summary イベントから読み取ってください。明示的なタグの例や曖昧な記述は保持されます。推論強度や出力 Token 上限は変更しません。 ストリームの HTTP 200 だけでは生成成功を意味しません。エラーイベントを処理し、途中までの回答は未完了と表示してください。Chat では [DONE] 前の最後の usage を読み取り、Responses では response.completed、response.incomplete、response.failed / error を区別してください。