Skip to main content
当客户端已经使用 OpenAI Responses API 格式,或需要 reasoning 强度控制、 联网搜索工具、官方 Responses SSE 事件时,使用 /v1/responses。

Reasoning 控制

gpt-5.5 和 gpt-5.4 支持 Responses reasoning 控制。使用 reasoning.effort 设置思考强度:
gpt-5.5 和 gpt-5.4 支持 none、low、medium、high、xhigh,不支持 minimal 或 max。顶层 reasoning_effort 可作为兼容别名;同时提供两种写法时,值必须一致,否则返回 400。 支持值因模型而异;省略时保持原有默认行为。详见各模型思考控制。 每个模型接受的档位、默认档位,以及是否可以关闭思考,都发布在 GET /v1/models 的 capability_metadata.reasoning 中,客户端无需硬编码档位对照表即可配置模型。 max_completion_tokens、max_output_tokens 及原生对应字段限制的是思考与最终答案共用的 token 总量。effort 不是输出 token 上限;请求仍可能耗尽预算(Chat Completions 返回 finish_reason: "length"),导致最终答案不完整或为空。

联网搜索

可以直接传 OpenAI Responses tools。需要联网答案时,在 tools 中加入 web search 工具:
APIAny.AI 会把 Responses 原生工具转发给支持这些能力的兼容模型。Function tools 也支持。

流式

设置 stream: true 后会收到 Responses SSE 事件流。事件遵循 OpenAI Responses 格式,例如 response.created、response.output_text.delta、 工具事件和 response.completed。

说明

  • model 使用 APIAny.AI 的公开模型 ID。
  • max_output_tokens 是 Responses 风格的输出 token 上限。
  • reasoning、text、tools、tool_choice、include、 previous_response_id、store 等 Responses 原生字段会在所选模型支持时转发。

GPT-6 输出与流式结束

使用 gpt-6-astra 时,可识别的前置思考包装会与最终答案分离。最终答案读取 content / output_text,思考内容读取独立 reasoning 字段或 summary 事件;明确的标签示例和有歧义的标记保留原样。这种格式整理不会修改推理强度或输出 Token 上限。 流式 HTTP 200 不代表生成成功。请处理错误事件,并将出错前收到的部分答案明确标为不完整,等待协议终态再判断结果。Chat 应在 [DONE] 前读取末尾 usage;Responses 应区分 response.completed、response.incomplete 与 response.failed / error。