/v1beta/models/{model}:generateContent für Gemini-kompatible Integrationen.
Streaming
Rufe:streamGenerateContent statt :generateContent auf, um einen
Gemini-Server-Sent-Eventstream mit inkrementellen candidates-Chunks zu empfangen.
Strukturierte Ausgabe
VerwendegenerationConfig.responseMimeType: "application/json" zusammen mit
responseSchema für JSON-Ausgabe:
Parameter
UnterstütztegenerationConfig: temperature, topP, topK, maxOutputTokens,
stopSequences, responseMimeType, responseSchema, responseModalities
(füge IMAGE für Bildausgabe hinzu). Außerdem auf oberster Ebene tools (functionDeclarations)
und systemInstruction.
Reasoning-Stärke
Gemini 3 verwendetgenerationConfig.thinkingConfig.thinkingLevel, Gemini 2.5 verwendet generationConfig.thinkingConfig.thinkingBudget. Unterstützte Level und Budgets hängen vom Modell ab. Gemini 3 akzeptiert kein none, und Gemini 2.5 Pro erlaubt keine Deaktivierung von Thinking.
minimal/low auf ein Thinking-Budget von 1024 Tokens, medium auf 8192, high auf 24576 und none auf 0, sofern unterstützt. Expliziter effort darf nicht zusammen mit nativem thinkingLevel oder thinkingBudget angegeben werden: Auch bei gleichwertigen Einstellungen wird 400 zurückgegeben. includeThoughts allein kann mit effort kombiniert werden. Siehe modellabhängige Reasoning-Steuerung.
Ausgabelimits wie max_completion_tokens, max_output_tokens und native Entsprechungen zählen Reasoning- und Antwort-Tokens gemeinsam. Effort ist kein Ausgabetokenlimit. Das Budget kann weiterhin erschöpft werden (finish_reason: "length" in Chat Completions), sodass die endgültige Antwort unvollständig oder leer bleibt.