Skip to main content
Verwende /v1beta/models/{model}:generateContent für Gemini-kompatible Integrationen.
Das Modell im Pfad ist eine öffentliche APIAny.AI-Modell-ID.

Streaming

Rufe :streamGenerateContent statt :generateContent auf, um einen Gemini-Server-Sent-Eventstream mit inkrementellen candidates-Chunks zu empfangen.

Strukturierte Ausgabe

Verwende generationConfig.responseMimeType: "application/json" zusammen mit responseSchema für JSON-Ausgabe:

Parameter

Unterstützte generationConfig: temperature, topP, topK, maxOutputTokens, stopSequences, responseMimeType, responseSchema, responseModalities (füge IMAGE für Bildausgabe hinzu). Außerdem auf oberster Ebene tools (functionDeclarations) und systemInstruction.

Reasoning-Stärke

Gemini 3 verwendet generationConfig.thinkingConfig.thinkingLevel, Gemini 2.5 verwendet generationConfig.thinkingConfig.thinkingBudget. Unterstützte Level und Budgets hängen vom Modell ab. Gemini 3 akzeptiert kein none, und Gemini 2.5 Pro erlaubt keine Deaktivierung von Thinking.
Bei OpenAI-kompatiblen Anfragen setzt Gemini 2.5 minimal/low auf ein Thinking-Budget von 1024 Tokens, medium auf 8192, high auf 24576 und none auf 0, sofern unterstützt. Expliziter effort darf nicht zusammen mit nativem thinkingLevel oder thinkingBudget angegeben werden: Auch bei gleichwertigen Einstellungen wird 400 zurückgegeben. includeThoughts allein kann mit effort kombiniert werden. Siehe modellabhängige Reasoning-Steuerung. Ausgabelimits wie max_completion_tokens, max_output_tokens und native Entsprechungen zählen Reasoning- und Antwort-Tokens gemeinsam. Effort ist kein Ausgabetokenlimit. Das Budget kann weiterhin erschöpft werden (finish_reason: "length" in Chat Completions), sodass die endgültige Antwort unvollständig oder leer bleibt.