/v1/responses를 사용하세요.
Reasoning 제어
gpt-5.5와 gpt-5.4는 Responses reasoning 제어를 지원합니다.
reasoning.effort로 추론 강도를 설정하세요.
gpt-5.5와 gpt-5.4는 none, low, medium, high, xhigh를 지원하며 minimal과 max는 지원하지 않습니다. 최상위 reasoning_effort도 호환 별칭으로 허용됩니다. 두 형식을 함께 지정하면 값이 같아야 하며, 충돌 시 400을 반환합니다.
지원 값은 모델마다 다릅니다. 생략하면 기존 기본 동작을 유지합니다. 모델별 추론 제어를 참고하세요.
각 모델이 허용하는 effort, 기본값, 그리고 추론을 끌 수 있는지 여부는 GET /v1/models의 capability_metadata.reasoning에 공개되므로, 클라이언트는 표를 하드코딩하지 않고 모델을 설정할 수 있습니다.
max_completion_tokens, max_output_tokens 및 네이티브 대응 필드는 추론과 최종 답변 토큰의 합계를 제한합니다. effort 자체는 출력 토큰 상한이 아닙니다. 예산이 소진되면(Chat Completions의 finish_reason: "length") 최종 답변이 불완전하거나 비어 있을 수 있습니다.
웹 검색
OpenAI Responses tools를 직접 전달할 수 있습니다. 웹에 연결된 답변이 필요하면tools에 웹 검색 도구를 포함하세요.
스트리밍
stream: true로 설정하면 Responses SSE 이벤트 스트림을 받습니다. 이벤트는
response.created, response.output_text.delta, 도구 이벤트,
response.completed처럼 OpenAI Responses 형식을 따릅니다.
참고
model은 APIAny.AI의 공개 모델 ID입니다.max_output_tokens는 Responses 스타일의 출력 토큰 상한입니다.reasoning,text,tools,tool_choice,include,previous_response_id,store등 Responses 고유 필드는 선택한 모델이 지원할 때 전달됩니다.
GPT-6 출력 및 스트림 종료
gpt-6-astra는 식별 가능한 앞부분의 사고 블록을 최종 답변과 분리합니다. 답변은 content / output_text, 사고 내용은 별도의 reasoning 필드 또는 summary 이벤트에서 읽으세요. 명시적인 태그 예제와 모호한 표기는 그대로 유지합니다. 추론 강도나 출력 토큰 한도는 변경하지 않습니다.
스트림의 HTTP 200만으로 생성 성공을 판단할 수 없습니다. 오류 이벤트를 처리하고 부분 답변은 미완료로 표시하세요. Chat에서는 [DONE] 이전의 마지막 usage를 읽고, Responses에서는 response.completed, response.incomplete, response.failed / error를 구분하세요.