/v1/chat/completions/v1/messages/v1beta/models/{model}:generateContent
- Tokens de entrada.
- Tokens de salida.
- Tokens de entrada en caché.
- Créditos mínimos por solicitud.
Modelos disponibles
Intensidad del razonamiento
Usareasoning_effort en Chat Completions y reasoning: { "effort": "high" } en Responses. Cada endpoint también admite la otra forma como alias de compatibilidad. Si se indican ambas, sus valores deben coincidir; los conflictos devuelven 400. Si se omite effort, se conserva el comportamiento predeterminado del modelo.
La sintaxis acepta none, minimal, low, medium, high, xhigh, max y ultra. Esto no significa que todos los modelos admitan todos los valores. Los valores inválidos y los que queden fuera del conjunto documentado del modelo devuelven 400.
El razonamiento está siempre activo en
kimi-k3, glm-5.3-flash, gpt-6-astra, la familia Grok 4.5 y la familia Gemini 3; un valor que desactive el razonamiento devuelve 400. gpt-5.4 y sus variantes mini y nano solo razonan cuando solicitas low o un valor superior. minimax-m3 y gpt-4o-mini no aceptan ningún parámetro effort; minimax-m3 expone en su lugar el objeto thinking.
Algunos modelos también aceptan las grafías de compatibilidad que usaban las integraciones anteriores: grok-4.5, grok-4.5-latest, grok-4.6 y grok-4.7 aceptan max (se ejecuta como xhigh) y minimal (se ejecuta como low), y gemini-3.1-pro acepta minimal (se ejecuta como low). Se normalizan antes de ejecutar la solicitud, por lo que el modelo siempre recibe un nivel oficial. capability_metadata.reasoning.compatEfforts publica estas correspondencias; las integraciones nuevas deberían usar los valores de efforts.
En Anthropic Messages, usa output_config.effort. La configuración nativa thinking sigue siendo independiente: effort no activa el pensamiento ni establece budget_tokens.
Las solicitudes nativas de Gemini 3 usan generationConfig.thinkingConfig.thinkingLevel; los niveles admitidos dependen del modelo. Gemini 2.5 usa thinkingBudget. En el formato compatible con OpenAI, Gemini 2.5 asigna minimal/low a 1024, medium a 8192, high a 24576 y none a 0 (excepto Pro). No combines effort explícito con thinkingLevel o thinkingBudget nativos: se devuelve 400 incluso si los ajustes son equivalentes. includeThoughts por sí solo puede combinarse con effort.
Otros modelos compatibles con OpenAI aceptan valores de effort sintácticamente válidos para ejecutar el modelo, sin garantía declarada de compatibilidad. Consulta las capacidades del modelo antes de depender de un valor.
Los límites como max_completion_tokens, max_output_tokens y sus equivalentes nativos incluyen tokens de razonamiento y de respuesta final. effort no es un límite de tokens de salida. El presupuesto puede agotarse (finish_reason: "length" en Chat Completions) y dejar la respuesta final incompleta o vacía.
Envía las imágenes con image_url en Chat Completions o input_image en Responses. glm-5.3-flash además acepta documentos (file / input_file) y vídeo; deepseek-v4.1-flash y deepseek-v4-flash no aceptan documentos, audio ni vídeo.
IDs oficiales de modelos
deepseek-flash y deepseek-v4-pro se aceptan como IDs equivalentes de deepseek-v4.1-flash y deepseek-v4, así que un cliente escrito con esos nombres oficiales funciona sin cambios. El uso y la facturación se registran una sola vez bajo el ID de modelo de APIAny.AI. GET /v1/models lista ambos IDs y marca la entrada equivalente con alias_of.
Metadatos de capacidades del modelo
GET /v1/models devuelve un objeto capability_metadata para cada modelo que declara sus capacidades. Léelo para configurar un modelo sin adivinar:
inputlista los tipos de entrada admitidos:text,image,video,audio,file.outputlista los tipos producidos.featuresinforma destream,tools,vision,jsonModey de si el modelo razona o no (thinking).reasoningdescribe los controles de razonamiento:mode(always-on,optionalonone), loseffortsadmitidos, eldefaultEffortque se aplica cuando omites effort ydisableWithpara los modelos cuyo razonamiento se puede desactivar.limitsinforma decontextWindowymaxOutputTokens.
reasoning.mode es el campo que debes consultar antes de enviar un valor de effort: always-on significa que el razonamiento no se puede desactivar, optional significa que se aplica disableWith y none significa que el modelo no tiene modo de razonamiento.