/v1beta/models/{model}:generateContent 调用 Gemini 兼容接口。
model 是 APIAny.AI 的公开模型 ID。
流式
把路径里的:generateContent 换成 :streamGenerateContent,即可获得
Gemini SSE 流(逐块返回增量 candidates)。
结构化输出
用generationConfig.responseMimeType: "application/json" 配合 responseSchema
得到 JSON 输出:
参数
支持generationConfig:temperature、topP、topK、maxOutputTokens、
stopSequences、responseMimeType、responseSchema、responseModalities
(含 IMAGE 时返回图片)。另支持顶层 tools(functionDeclarations)与
systemInstruction。
思考强度
Gemini 3 使用generationConfig.thinkingConfig.thinkingLevel;Gemini 2.5 使用 generationConfig.thinkingConfig.thinkingBudget。支持级别和预算因模型而异。Gemini 3 不支持 none,Gemini 2.5 Pro 无法关闭思考。
minimal/low 映射为 1024 个思考 token、medium 映射为 8192、high 映射为 24576;支持关闭思考的模型将 none 映射为 0。显式 effort 与原生 thinkingLevel 或 thinkingBudget 不可同时指定,即使设置等价也返回 400。仅包含 includeThoughts 时可与 effort 一起使用。详见各模型思考控制。
max_completion_tokens、max_output_tokens 及原生对应字段限制的是思考与最终答案共用的 token 总量。effort 不是输出 token 上限;请求仍可能耗尽预算(Chat Completions 返回 finish_reason: "length"),导致最终答案不完整或为空。