/v1/responses。
Reasoning 控制
gpt-5.5 和 gpt-5.4 支持 Responses reasoning 控制。使用
reasoning.effort 设置思考强度:
gpt-5.5 和 gpt-5.4 支持 none、low、medium、high、xhigh,不支持 minimal 或 max。顶层 reasoning_effort 可作为兼容别名;同时提供两种写法时,值必须一致,否则返回 400。
支持值因模型而异;省略时保持原有默认行为。详见各模型思考控制。
每个模型接受的档位、默认档位,以及是否可以关闭思考,都发布在 GET /v1/models 的
capability_metadata.reasoning 中,客户端无需硬编码档位对照表即可配置模型。
max_completion_tokens、max_output_tokens 及原生对应字段限制的是思考与最终答案共用的 token 总量。effort 不是输出 token 上限;请求仍可能耗尽预算(Chat Completions 返回 finish_reason: "length"),导致最终答案不完整或为空。
联网搜索
可以直接传 OpenAI Responses tools。需要联网答案时,在tools 中加入
web search 工具:
流式
设置stream: true 后会收到 Responses SSE 事件流。事件遵循 OpenAI
Responses 格式,例如 response.created、response.output_text.delta、
工具事件和 response.completed。
说明
model使用 APIAny.AI 的公开模型 ID。max_output_tokens是 Responses 风格的输出 token 上限。reasoning、text、tools、tool_choice、include、previous_response_id、store等 Responses 原生字段会在所选模型支持时转发。
GPT-6 输出与流式结束
使用gpt-6-astra 时,可识别的前置思考包装会与最终答案分离。最终答案读取 content / output_text,思考内容读取独立 reasoning 字段或 summary 事件;明确的标签示例和有歧义的标记保留原样。这种格式整理不会修改推理强度或输出 Token 上限。
流式 HTTP 200 不代表生成成功。请处理错误事件,并将出错前收到的部分答案明确标为不完整,等待协议终态再判断结果。Chat 应在 [DONE] 前读取末尾 usage;Responses 应区分 response.completed、response.incomplete 与 response.failed / error。