/v1/responses cuando tu cliente ya utiliza el formato de la OpenAI Responses API,
o cuando necesitas funciones nativas de Responses como los controles de reasoning,
las herramientas de búsqueda web y los server-sent events oficiales de Responses.
Controles de reasoning
gpt-5.5 y gpt-5.4 aceptan los controles de reasoning de Responses. Usa
reasoning.effort para establecer la intensidad del reasoning:
gpt-5.5 y gpt-5.4 admiten none, low, medium, high y xhigh, pero no minimal ni max. Se acepta reasoning_effort de nivel superior como alias. Si se indican ambas formas, sus valores deben coincidir; los conflictos devuelven 400.
Los valores admitidos dependen del modelo. Si se omiten, se mantiene el comportamiento predeterminado. Consulta los controles de razonamiento por modelo.
Cada modelo publica en GET /v1/models, dentro de capability_metadata.reasoning, los niveles que acepta, su valor predeterminado y si el razonamiento se puede desactivar, para que los clientes configuren un modelo sin codificar una tabla fija.
Los límites como max_completion_tokens, max_output_tokens y sus equivalentes nativos incluyen tokens de razonamiento y de respuesta final. effort no es un límite de tokens de salida. El presupuesto puede agotarse (finish_reason: "length" en Chat Completions) y dejar la respuesta final incompleta o vacía.
Búsqueda web
Pasa las herramientas de OpenAI Responses directamente. Para respuestas conectadas a la web, incluye una herramienta de búsqueda web entools:
Streaming
Establecestream: true para recibir el flujo de eventos SSE de Responses. Los eventos siguen
el formato de OpenAI Responses, como response.created,
response.output_text.delta, eventos de herramientas y response.completed.
Notas
- El
modeles un ID de modelo público de APIAny.AI. max_output_tokenses el límite de tokens de salida estilo Responses.- Los campos nativos de Responses como
reasoning,text,tools,tool_choice,include,previous_response_idystorese reenvían cuando el modelo seleccionado los admite.
Salida de GPT-6 y finalización del flujo
Engpt-6-astra, los bloques iniciales de reflexión reconocibles se separan de la respuesta final. Lea content / output_text para la respuesta y los campos de razonamiento o eventos summary para la reflexión. Se conservan los ejemplos explícitos de etiquetas y los casos ambiguos. El formato no cambia el esfuerzo de razonamiento ni los límites de tokens.
Un flujo HTTP 200 no garantiza una generación correcta. Gestione los eventos de error y marque las respuestas parciales como incompletas. En Chat, lea el último usage antes de [DONE]; en Responses, distinga response.completed, response.incomplete y response.failed / error.