Skip to main content
Utilisez /v1beta/models/{model}:generateContent pour les intégrations compatibles Gemini.
Le model dans le chemin est un ID de modèle public APIAny.AI.

Streaming

Appelez :streamGenerateContent au lieu de :generateContent pour recevoir un flux de server-sent events Gemini avec des morceaux incrémentaux de candidates.

Sortie structurée

Utilisez generationConfig.responseMimeType: "application/json" avec responseSchema pour une sortie JSON :

Paramètres

generationConfig pris en charge : temperature, topP, topK, maxOutputTokens, stopSequences, responseMimeType, responseSchema, responseModalities (incluez IMAGE pour une sortie image). Également tools au niveau racine (functionDeclarations) et systemInstruction.

Intensité du raisonnement

Gemini 3 utilise generationConfig.thinkingConfig.thinkingLevel ; Gemini 2.5 utilise generationConfig.thinkingConfig.thinkingBudget. Les niveaux et budgets acceptés dépendent du modèle. Gemini 3 n’accepte pas none et Gemini 2.5 Pro ne permet pas de désactiver la réflexion.
Pour les requêtes compatibles OpenAI, Gemini 2.5 associe minimal/low à un budget de 1024 tokens de réflexion, medium à 8192, high à 24576 et none à 0 si le modèle le permet. Ne combinez pas un effort explicite avec thinkingLevel ou thinkingBudget natif : la requête renvoie 400 même si les réglages sont équivalents. includeThoughts seul peut être associé à effort. Voir les contrôles de raisonnement par modèle. Les limites comme max_completion_tokens, max_output_tokens et leurs équivalents natifs comptent à la fois les tokens de raisonnement et de réponse finale. effort n’est pas une limite de tokens de sortie. Le budget peut toujours être épuisé (finish_reason: "length" dans Chat Completions), laissant une réponse finale incomplète ou vide.