Skip to main content
Usa /v1/responses cuando tu cliente ya utiliza el formato de la OpenAI Responses API, o cuando necesitas funciones nativas de Responses como los controles de reasoning, las herramientas de búsqueda web y los server-sent events oficiales de Responses.

Controles de reasoning

gpt-5.5 y gpt-5.4 aceptan los controles de reasoning de Responses. Usa reasoning.effort para establecer la intensidad del reasoning:
gpt-5.5 y gpt-5.4 admiten none, low, medium, high y xhigh, pero no minimal ni max. Se acepta reasoning_effort de nivel superior como alias. Si se indican ambas formas, sus valores deben coincidir; los conflictos devuelven 400. Los valores admitidos dependen del modelo. Si se omiten, se mantiene el comportamiento predeterminado. Consulta los controles de razonamiento por modelo. Cada modelo publica en GET /v1/models, dentro de capability_metadata.reasoning, los niveles que acepta, su valor predeterminado y si el razonamiento se puede desactivar, para que los clientes configuren un modelo sin codificar una tabla fija. Los límites como max_completion_tokens, max_output_tokens y sus equivalentes nativos incluyen tokens de razonamiento y de respuesta final. effort no es un límite de tokens de salida. El presupuesto puede agotarse (finish_reason: "length" en Chat Completions) y dejar la respuesta final incompleta o vacía.

Búsqueda web

Pasa las herramientas de OpenAI Responses directamente. Para respuestas conectadas a la web, incluye una herramienta de búsqueda web en tools:
APIAny.AI reenvía las herramientas nativas de Responses a los modelos compatibles que las admiten. También se admiten las function tools.

Streaming

Establece stream: true para recibir el flujo de eventos SSE de Responses. Los eventos siguen el formato de OpenAI Responses, como response.created, response.output_text.delta, eventos de herramientas y response.completed.

Notas

  • El model es un ID de modelo público de APIAny.AI.
  • max_output_tokens es el límite de tokens de salida estilo Responses.
  • Los campos nativos de Responses como reasoning, text, tools, tool_choice, include, previous_response_id y store se reenvían cuando el modelo seleccionado los admite.

Salida de GPT-6 y finalización del flujo

En gpt-6-astra, los bloques iniciales de reflexión reconocibles se separan de la respuesta final. Lea content / output_text para la respuesta y los campos de razonamiento o eventos summary para la reflexión. Se conservan los ejemplos explícitos de etiquetas y los casos ambiguos. El formato no cambia el esfuerzo de razonamiento ni los límites de tokens. Un flujo HTTP 200 no garantiza una generación correcta. Gestione los eventos de error y marque las respuestas parciales como incompletas. En Chat, lea el último usage antes de [DONE]; en Responses, distinga response.completed, response.incomplete y response.failed / error.