/v1/responses lorsque votre client utilise déjà le format de l’API OpenAI
Responses, ou lorsque vous avez besoin de fonctionnalités natives de Responses telles que
les contrôles de reasoning, les outils de recherche web et les server-sent events officiels de Responses.
Contrôles de reasoning
gpt-5.5 et gpt-5.4 acceptent les contrôles de reasoning de Responses. Utilisez
reasoning.effort pour définir la force du reasoning :
gpt-5.5 et gpt-5.4 acceptent none, low, medium, high et xhigh, mais ni minimal ni max. reasoning_effort au niveau racine est accepté comme alias. Si les deux formes sont présentes, leurs valeurs doivent être identiques ; sinon, la requête renvoie 400.
Les valeurs acceptées dépendent du modèle. En l’absence de valeur, le comportement par défaut est conservé. Voir les contrôles de raisonnement par modèle.
Les valeurs d’effort acceptées par chaque modèle, sa valeur par défaut et la possibilité de désactiver le raisonnement sont publiées dans GET /v1/models sous capability_metadata.reasoning, ce qui permet aux clients de configurer un modèle sans coder de tableau en dur.
Les limites comme max_completion_tokens, max_output_tokens et leurs équivalents natifs comptent à la fois les tokens de raisonnement et de réponse finale. effort n’est pas une limite de tokens de sortie. Le budget peut toujours être épuisé (finish_reason: "length" dans Chat Completions), laissant une réponse finale incomplète ou vide.
Recherche web
Passez directement les tools OpenAI Responses. Pour des réponses connectées au web, incluez un outil de recherche web danstools :
Streaming
Définissezstream: true pour recevoir le flux d’événements SSE de Responses. Les événements suivent
le format OpenAI Responses, par exemple response.created,
response.output_text.delta, les événements d’outils et response.completed.
Remarques
modelest un ID de modèle public APIAny.AI.max_output_tokensest la limite de tokens de sortie de style Responses.- Les champs natifs de Responses tels que
reasoning,text,tools,tool_choice,include,previous_response_idetstoresont transmis lorsqu’ils sont pris en charge par le modèle sélectionné.
Sortie GPT-6 et fin du flux
Avecgpt-6-astra, les blocs de réflexion initiaux reconnaissables sont séparés de la réponse finale. Lisez content / output_text pour la réponse, et les champs de raisonnement ou événements summary pour la réflexion. Les exemples explicites de balises et les cas ambigus sont conservés. Ce formatage ne modifie ni l’effort de raisonnement ni la limite de tokens.
Un flux HTTP 200 ne garantit pas le succès. Gérez les événements d’erreur et marquez toute réponse partielle comme incomplète. En Chat, lisez le dernier usage avant [DONE] ; en Responses, distinguez response.completed, response.incomplete et response.failed / error.