Skip to main content
클라이언트가 이미 OpenAI Responses API 형식을 사용하거나, reasoning 제어, 웹 검색 도구, 공식 Responses SSE 이벤트와 같은 Responses 고유 기능이 필요할 때 /v1/responses를 사용하세요.

Reasoning 제어

gpt-5.5와 gpt-5.4는 Responses reasoning 제어를 지원합니다. reasoning.effort로 추론 강도를 설정하세요.
gpt-5.5와 gpt-5.4는 none, low, medium, high, xhigh를 지원하며 minimal과 max는 지원하지 않습니다. 최상위 reasoning_effort도 호환 별칭으로 허용됩니다. 두 형식을 함께 지정하면 값이 같아야 하며, 충돌 시 400을 반환합니다. 지원 값은 모델마다 다릅니다. 생략하면 기존 기본 동작을 유지합니다. 모델별 추론 제어를 참고하세요. 각 모델이 허용하는 effort, 기본값, 그리고 추론을 끌 수 있는지 여부는 GET /v1/models의 capability_metadata.reasoning에 공개되므로, 클라이언트는 표를 하드코딩하지 않고 모델을 설정할 수 있습니다. max_completion_tokens, max_output_tokens 및 네이티브 대응 필드는 추론과 최종 답변 토큰의 합계를 제한합니다. effort 자체는 출력 토큰 상한이 아닙니다. 예산이 소진되면(Chat Completions의 finish_reason: "length") 최종 답변이 불완전하거나 비어 있을 수 있습니다.

웹 검색

OpenAI Responses tools를 직접 전달할 수 있습니다. 웹에 연결된 답변이 필요하면 tools에 웹 검색 도구를 포함하세요.
APIAny.AI는 Responses 고유 도구를 이를 지원하는 호환 모델로 전달합니다. Function tools도 지원됩니다.

스트리밍

stream: true로 설정하면 Responses SSE 이벤트 스트림을 받습니다. 이벤트는 response.created, response.output_text.delta, 도구 이벤트, response.completed처럼 OpenAI Responses 형식을 따릅니다.

참고

  • model은 APIAny.AI의 공개 모델 ID입니다.
  • max_output_tokens는 Responses 스타일의 출력 토큰 상한입니다.
  • reasoning, text, tools, tool_choice, include, previous_response_id, store 등 Responses 고유 필드는 선택한 모델이 지원할 때 전달됩니다.

GPT-6 출력 및 스트림 종료

gpt-6-astra는 식별 가능한 앞부분의 사고 블록을 최종 답변과 분리합니다. 답변은 content / output_text, 사고 내용은 별도의 reasoning 필드 또는 summary 이벤트에서 읽으세요. 명시적인 태그 예제와 모호한 표기는 그대로 유지합니다. 추론 강도나 출력 토큰 한도는 변경하지 않습니다. 스트림의 HTTP 200만으로 생성 성공을 판단할 수 없습니다. 오류 이벤트를 처리하고 부분 답변은 미완료로 표시하세요. Chat에서는 [DONE] 이전의 마지막 usage를 읽고, Responses에서는 response.completed, response.incomplete, response.failed / error를 구분하세요.