/v1beta/models/{model}:generateContent pour les intégrations compatibles Gemini.
model dans le chemin est un ID de modèle public APIAny.AI.
Streaming
Appelez:streamGenerateContent au lieu de :generateContent pour recevoir un
flux de server-sent events Gemini avec des morceaux incrémentaux de candidates.
Sortie structurée
UtilisezgenerationConfig.responseMimeType: "application/json" avec
responseSchema pour une sortie JSON :
Paramètres
generationConfig pris en charge : temperature, topP, topK, maxOutputTokens,
stopSequences, responseMimeType, responseSchema, responseModalities
(incluez IMAGE pour une sortie image). Également tools au niveau racine (functionDeclarations)
et systemInstruction.
Intensité du raisonnement
Gemini 3 utilisegenerationConfig.thinkingConfig.thinkingLevel ; Gemini 2.5 utilise generationConfig.thinkingConfig.thinkingBudget. Les niveaux et budgets acceptés dépendent du modèle. Gemini 3 n’accepte pas none et Gemini 2.5 Pro ne permet pas de désactiver la réflexion.
minimal/low à un budget de 1024 tokens de réflexion, medium à 8192, high à 24576 et none à 0 si le modèle le permet. Ne combinez pas un effort explicite avec thinkingLevel ou thinkingBudget natif : la requête renvoie 400 même si les réglages sont équivalents. includeThoughts seul peut être associé à effort. Voir les contrôles de raisonnement par modèle.
Les limites comme max_completion_tokens, max_output_tokens et leurs équivalents natifs comptent à la fois les tokens de raisonnement et de réponse finale. effort n’est pas une limite de tokens de sortie. Le budget peut toujours être épuisé (finish_reason: "length" dans Chat Completions), laissant une réponse finale incomplète ou vide.