Skip to main content

Grok 4.7

使用独立模型 ID grok-4.7 调用 /v1/chat/completions,Grok 4.6 保持独立,不会自动升级到 4.7。上线售价沿用 4.6:输入及缓存输入每千 Token 1.2 积分,输出每千 Token 2.4 积分,原有积分套餐折扣不变。
当前接入仅声明文本输入和文本输出;视觉、文档、上下文上限及思考控制尚未验证。当前可用状态及售价以 /v1/models 为准。 上线测试发现:部分无害的“逐字返回固定短语”请求会被模型拒绝,普通问答和代码生成可正常返回。请勿依赖固定短语回声作为可用性探测。这是已观察到的模型限制,不代表所有指令都能稳定遵循。 对话模型可以通过以下接口暴露:
  • /v1/chat/completions
  • /v1/responses
  • /v1/messages
  • /v1beta/models/{model}:generateContent
价格可以包含:
  • 输入 token。
  • 输出 token。
  • 缓存输入 token。
  • 最低请求积分。
上下文窗口和最大输出长度因模型而异。

可用模型

思考强度

DeepSeek Flash 与 GLM 5.3 Flash

deepseek-v4-flash 与 deepseek-v4.1-flash 是两个独立模型,不是别名。V4 Flash 接收文本;V4.1 Flash 接收文本和图片。二者的上下文为 1,048,576 Token,最大输出为 393,216 Token。GLM 5.3 Flash 上下文同为 1,048,576 Token,最大输出为 131,072 Token。实时可用状态与积分价以 /v1/models 为准。glm-5.2 不再接受新请求,历史使用记录保留。 DeepSeek Flash 支持 none、low、high、max;兼容值 minimal 按 low 处理,medium 和 xhigh 按 high 处理。Chat Completions 可使用 thinking: { "type": "disabled" } 或 effort none 关闭思考,两种设置不能互相矛盾。 deepseek-v4.1-flash 的 Chat Completions 默认开启思考。强制工具调用(tool_choice: "required" 或指定函数)需设置 reasoning_effort: "none" 或 thinking: { "type": "disabled" },否则返回 HTTP 400,错误码为 invalid_tool_choice。如需保留思考,请使用 tool_choice: "auto";APIAny.AI 不会为您静默关闭思考。 GLM 5.3 Flash 始终思考,仅支持 low、high、max(模型默认),关闭思考返回 400。快速验证建议选 low。思考与最终答案共享输出预算,例如设置 max_tokens: 32768;明确传入的限制不会被静默增大。max_completion_tokens 可作为别名,同时提供不一致的输出上限会返回 400。 工具调用续接时,请保留助手消息中的 reasoning_content、tool_calls 及对应工具结果。缓存命中 Token 已包含在输入 Token 总数内,不重复叠加。图片使用 Chat 的 image_url 或 Responses 的 input_image;本次接入不接受通用文档、音频及 DeepSeek 视频 URL 输入。
GLM 可将示例模型改成 glm-5.3-flash。Responses 使用 input、max_output_tokens 和 reasoning: { "effort": "low" }。 Responses 工具续接时,把完整返回的 output(包含推理项和函数调用)及配对的 function_call_output 追加到下一轮 input,不要删除推理项。DeepSeek Responses 是无状态接口,需回传对话历史,不能依赖 previous_response_id。图片用 Chat 的 image_url 或 Responses 的 input_image 提交。glm-5.3-flash 额外支持文档(file / input_file)与视频;deepseek-v4.1-flash、deepseek-v4-flash 不接受文档、音频与视频。

官方模型 ID

deepseek-flash 与 deepseek-v4-pro 可作为 deepseek-v4.1-flash 与 deepseek-v4 的等价 ID 直接使用,按官方名称编写的客户端无需改动。用量与计费统一记在 APIAny.AI 模型 ID 下。GET /v1/models 会同时列出两个 ID,并用 alias_of 标出等价条目。 Chat Completions 使用 reasoning_effort,Responses 使用 reasoning: { "effort": "high" }。两个接口也接受另一种写法作为兼容别名;同时提供时值必须一致,冲突返回 400。省略 effort 时保持模型原有默认行为。 语法允许 none、minimal、low、medium、high、xhigh、max、ultra,但不代表每个模型都支持全部值。非法值,以及超出已声明模型支持范围的值,返回 400。 kimi-k3、glm-5.3-flash、gpt-6-astra、Grok 4.5 系列与 Gemini 3 系列始终开启思考,传入关闭思考的值会返回 400。gpt-5.4 及其 mini、nano 版本默认不思考,需要显式传 low 或更高档位。minimax-m3 与 gpt-4o-mini 不接受任何 effort 参数;minimax-m3 改用 thinking 对象控制。 部分模型还接受旧版集成曾使用的兼容写法:grok-4.5、grok-4.5-latest、grok-4.6 与 grok-4.7 接受 max(按 xhigh 执行)与 minimal(按 low 执行),gemini-3.1-pro 接受 minimal(按 low 执行)。这些写法会在请求执行前被归一为官方档位,因此模型收到的始终是官方取值。映射关系公布在 capability_metadata.reasoning.compatEfforts 中;新集成请使用 efforts 中的取值。 Anthropic Messages 使用 output_config.effort。原生 thinking 独立保留:effort 不会自动开启思考,也不会设置 budget_tokens。 Gemini 3 原生请求使用 generationConfig.thinkingConfig.thinkingLevel,支持级别因模型而异。Gemini 2.5 使用 thinkingBudget。在 OpenAI 兼容格式中,Gemini 2.5 将 minimal/low 映射为 1024、medium 映射为 8192、high 映射为 24576、none 映射为 0(Pro 除外)。显式 effort 与原生 thinkingLevel 或 thinkingBudget 不可同时指定,即使设置等价也返回 400。仅包含 includeThoughts 时可与 effort 一起使用。 其他 OpenAI 兼容模型可以提交语法有效的 effort,但这不构成模型支持承诺。依赖特定值前,请先确认模型能力。 max_completion_tokens、max_output_tokens 及原生对应字段限制的是思考与最终答案共用的 token 总量。effort 不是输出 token 上限;请求仍可能耗尽预算(Chat Completions 返回 finish_reason: "length"),导致最终答案不完整或为空。

模型能力元数据

GET /v1/models 会为每个已声明能力的模型返回 capability_metadata,可以先读它再配置模型,不必猜测:
  • input 列出支持的输入类型:text、image、video、audio、file。
  • output 列出输出类型。
  • features 说明是否支持 stream、tools、vision、jsonMode,以及模型是否具备思考能力(thinking)。
  • reasoning 描述思考控制方式:mode(always-on、optional 或 none)、支持的 efforts、省略 effort 时生效的 defaultEffort,以及可关闭思考的模型的 disableWith。
  • limits 给出 contextWindow 与 maxOutputTokens。
提交 effort 之前先看 reasoning.mode:always-on 表示无法关闭思考,optional 表示适用 disableWith,none 表示该模型没有思考模式。
API 格式参考: OpenAI, Anthropic Messages, Gemini, Gemini OpenAI.