Skip to main content
使用 /v1beta/models/{model}:generateContent 调用 Gemini 兼容接口。
路径中的 model 是 APIAny.AI 的公开模型 ID。

流式

把路径里的 :generateContent 换成 :streamGenerateContent,即可获得 Gemini SSE 流(逐块返回增量 candidates)。

结构化输出

用 generationConfig.responseMimeType: "application/json" 配合 responseSchema 得到 JSON 输出:

参数

支持 generationConfig:temperature、topP、topK、maxOutputTokens、 stopSequences、responseMimeType、responseSchema、responseModalities (含 IMAGE 时返回图片)。另支持顶层 tools(functionDeclarations)与 systemInstruction。

思考强度

Gemini 3 使用 generationConfig.thinkingConfig.thinkingLevel;Gemini 2.5 使用 generationConfig.thinkingConfig.thinkingBudget。支持级别和预算因模型而异。Gemini 3 不支持 none,Gemini 2.5 Pro 无法关闭思考。
OpenAI 兼容请求中,Gemini 2.5 将 minimal/low 映射为 1024 个思考 token、medium 映射为 8192、high 映射为 24576;支持关闭思考的模型将 none 映射为 0。显式 effort 与原生 thinkingLevel 或 thinkingBudget 不可同时指定,即使设置等价也返回 400。仅包含 includeThoughts 时可与 effort 一起使用。详见各模型思考控制。 max_completion_tokens、max_output_tokens 及原生对应字段限制的是思考与最终答案共用的 token 总量。effort 不是输出 token 上限;请求仍可能耗尽预算(Chat Completions 返回 finish_reason: "length"),导致最终答案不完整或为空。