Skip to main content
Utilisez /v1/responses lorsque votre client utilise déjà le format de l’API OpenAI Responses, ou lorsque vous avez besoin de fonctionnalités natives de Responses telles que les contrôles de reasoning, les outils de recherche web et les server-sent events officiels de Responses.

Contrôles de reasoning

gpt-5.5 et gpt-5.4 acceptent les contrôles de reasoning de Responses. Utilisez reasoning.effort pour définir la force du reasoning :
gpt-5.5 et gpt-5.4 acceptent none, low, medium, high et xhigh, mais ni minimal ni max. reasoning_effort au niveau racine est accepté comme alias. Si les deux formes sont présentes, leurs valeurs doivent être identiques ; sinon, la requête renvoie 400. Les valeurs acceptées dépendent du modèle. En l’absence de valeur, le comportement par défaut est conservé. Voir les contrôles de raisonnement par modèle. Les valeurs d’effort acceptées par chaque modèle, sa valeur par défaut et la possibilité de désactiver le raisonnement sont publiées dans GET /v1/models sous capability_metadata.reasoning, ce qui permet aux clients de configurer un modèle sans coder de tableau en dur. Les limites comme max_completion_tokens, max_output_tokens et leurs équivalents natifs comptent à la fois les tokens de raisonnement et de réponse finale. effort n’est pas une limite de tokens de sortie. Le budget peut toujours être épuisé (finish_reason: "length" dans Chat Completions), laissant une réponse finale incomplète ou vide.

Recherche web

Passez directement les tools OpenAI Responses. Pour des réponses connectées au web, incluez un outil de recherche web dans tools :
APIAny.AI transmet les outils natifs de Responses aux modèles compatibles qui les prennent en charge. Les function tools sont également pris en charge.

Streaming

Définissez stream: true pour recevoir le flux d’événements SSE de Responses. Les événements suivent le format OpenAI Responses, par exemple response.created, response.output_text.delta, les événements d’outils et response.completed.

Remarques

  • model est un ID de modèle public APIAny.AI.
  • max_output_tokens est la limite de tokens de sortie de style Responses.
  • Les champs natifs de Responses tels que reasoning, text, tools, tool_choice, include, previous_response_id et store sont transmis lorsqu’ils sont pris en charge par le modèle sélectionné.

Sortie GPT-6 et fin du flux

Avec gpt-6-astra, les blocs de réflexion initiaux reconnaissables sont séparés de la réponse finale. Lisez content / output_text pour la réponse, et les champs de raisonnement ou événements summary pour la réflexion. Les exemples explicites de balises et les cas ambigus sont conservés. Ce formatage ne modifie ni l’effort de raisonnement ni la limite de tokens. Un flux HTTP 200 ne garantit pas le succès. Gérez les événements d’erreur et marquez toute réponse partielle comme incomplète. En Chat, lisez le dernier usage avant [DONE] ; en Responses, distinguez response.completed, response.incomplete et response.failed / error.