/v1/chat/completions/v1/messages/v1beta/models/{model}:generateContent
- Les tokens d’entrée.
- Les tokens de sortie.
- Les tokens d’entrée mis en cache.
- Un minimum de crédits par requête.
Modèles disponibles
Intensité du raisonnement
Utilisezreasoning_effort dans Chat Completions et reasoning: { "effort": "high" } dans Responses. Chaque endpoint accepte également l’autre forme comme alias de compatibilité. Si les deux sont présentes, leurs valeurs doivent être identiques ; des valeurs contradictoires renvoient 400. Omettre effort conserve la valeur par défaut du modèle.
La syntaxe accepte none, minimal, low, medium, high, xhigh, max et ultra. Cela ne garantit pas que chaque modèle accepte toutes ces valeurs. Les valeurs invalides et celles situées hors de l’ensemble documenté pour un modèle renvoient 400.
Le raisonnement est toujours actif pour
kimi-k3, glm-5.3-flash, gpt-6-astra, la famille Grok 4.5 et la famille Gemini 3 ; une valeur qui désactive le raisonnement renvoie 400. gpt-5.4 et ses variantes mini et nano ne raisonnent que si vous demandez low ou plus. minimax-m3 et gpt-4o-mini n’acceptent aucun paramètre effort ; minimax-m3 expose à la place l’objet thinking.
Certains modèles acceptent aussi les orthographes de compatibilité utilisées par les intégrations plus anciennes : grok-4.5, grok-4.5-latest, grok-4.6 et grok-4.7 acceptent max (exécuté comme xhigh) et minimal (exécuté comme low), et gemini-3.1-pro accepte minimal (exécuté comme low). Elles sont normalisées avant l’exécution de la requête, de sorte que le modèle reçoit toujours un niveau officiel. capability_metadata.reasoning.compatEfforts publie ces correspondances ; les nouvelles intégrations doivent utiliser les valeurs de efforts.
Avec Anthropic Messages, utilisez output_config.effort. Le réglage natif thinking reste indépendant : effort n’active pas le raisonnement et ne sélectionne pas budget_tokens.
Pour Gemini 3, les requêtes natives utilisent generationConfig.thinkingConfig.thinkingLevel ; les niveaux acceptés dépendent du modèle. Gemini 2.5 utilise thinkingBudget. Au format compatible OpenAI, Gemini 2.5 associe minimal/low à 1024, medium à 8192, high à 24576 et none à 0 (sauf Pro). Ne combinez pas un effort explicite avec thinkingLevel ou thinkingBudget natif : cela renvoie 400 même si les réglages sont équivalents. includeThoughts seul peut être combiné avec effort.
Pour les autres modèles compatibles OpenAI, les efforts syntaxiquement valides sont acceptés pour l’exécution du modèle, sans garantie de prise en charge déclarée. Consultez les capacités du modèle avant de vous appuyer sur une valeur d’effort.
Les limites de sortie telles que max_completion_tokens, max_output_tokens et les équivalents natifs incluent les tokens de raisonnement et de réponse finale. Effort n’est pas une limite de tokens de sortie. Une requête peut toujours épuiser son budget (finish_reason: "length" dans Chat Completions) et renvoyer une réponse finale incomplète ou vide.
Envoyez les images avec Chat image_url ou Responses input_image. glm-5.3-flash accepte en plus les documents (file / input_file) et la vidéo ; les documents, l’audio et la vidéo ne sont pas acceptés pour deepseek-v4.1-flash ni deepseek-v4-flash.
ID de modèles officiels
deepseek-flash et deepseek-v4-pro sont acceptés comme ID équivalents de deepseek-v4.1-flash et deepseek-v4 : un client écrit pour ces noms officiels fonctionne sans modification. L’usage et la facturation sont enregistrés une seule fois sous l’ID de modèle APIAny.AI. GET /v1/models liste les deux ID et marque l’entrée équivalente avec alias_of.
Métadonnées de capacités du modèle
GET /v1/models renvoie un objet capability_metadata pour chaque modèle qui déclare ses capacités. Lisez-le pour configurer un modèle sans deviner :
inputliste les types d’entrée acceptés :text,image,video,audio,file.outputliste les types produits.featuresindiquestream,tools,vision,jsonMode, ainsi que la présence d’un raisonnement au niveau du modèle (thinking).reasoningdécrit les contrôles de raisonnement :mode(always-on,optionalounone), leseffortsacceptés, ledefaultEffortappliqué lorsque vous omettez effort, etdisableWithpour les modèles dont le raisonnement peut être désactivé.limitsindiquecontextWindowetmaxOutputTokens.
reasoning.mode est le champ à vérifier avant d’envoyer une valeur d’effort : always-on signifie que le raisonnement ne peut pas être désactivé, optional que disableWith s’applique, et none que le modèle n’a pas de mode de raisonnement.