Skip to main content
채팅 모델은 다음 인터페이스를 통해 제공될 수 있습니다:
  • /v1/chat/completions
  • /v1/messages
  • /v1beta/models/{model}:generateContent
가격에는 다음이 포함될 수 있습니다:
  • 입력 token.
  • 출력 token.
  • 캐시된 입력 token.
  • 최소 요청 크레딧.
컨텍스트 윈도우와 최대 출력 길이는 모델 수준의 능력 메타데이터입니다.

사용 가능한 모델

추론 강도

DeepSeek Flash와 GLM 5.3 Flash

deepseek-v4-flash와 deepseek-v4.1-flash는 별칭이 아니라 서로 다른 모델입니다. V4 Flash는 텍스트를, V4.1 Flash는 텍스트와 이미지를 받습니다. 두 모델 모두 1,048,576 token 컨텍스트 윈도우에서 최대 393,216개의 출력 token을 지원합니다. GLM 5.3 Flash는 동일한 컨텍스트 윈도우와 최대 131,072개의 출력 token을 지원합니다. 실시간 사용 가능 여부와 가격은 /v1/models에서 확인하세요. glm-5.2는 더 이상 새 요청을 받지 않으며, 기존 사용 기록은 그대로 남아 있습니다. DeepSeek Flash는 none, low, high, max를 지원합니다. 호환 값인 minimal은 low로, medium과 xhigh는 high로 처리됩니다. Chat Completions에서는 thinking: { "type": "disabled" } 또는 effort none으로 추론을 끌 수 있습니다. 서로 모순되는 설정을 함께 지정하지 마세요. deepseek-v4.1-flash의 Chat Completions에서는 추론이 기본적으로 켜져 있습니다. 강제 도구 호출(tool_choice: "required" 또는 특정 함수 지정)에는 reasoning_effort: "none" 또는 thinking: { "type": "disabled" }가 필요합니다. 그렇지 않으면 요청은 invalid_tool_choice와 함께 HTTP 400을 반환합니다. 추론을 유지하려면 tool_choice: "auto"를 사용하세요. APIAny.AI가 추론을 대신 꺼 주지는 않습니다. GLM 5.3 Flash는 항상 추론합니다. effort 값은 low, high, max(모델 기본값)이며, 추론을 끄는 값은 400을 반환합니다. 빠른 동작 확인에는 low를 사용하세요. 추론과 최종 답변을 합한 만큼 token을 충분히 할당하세요. 예: max_tokens: 32768. 명시한 한도는 그대로 적용되며 임의로 늘어나지 않습니다. max_completion_tokens도 별칭으로 허용되지만, 서로 다른 출력 한도를 동시에 지정하면 400을 반환합니다. 이 모델들과 도구 대화를 이어갈 때는 어시스턴트 메시지의 reasoning_content, tool_calls와 이에 대응하는 도구 결과 메시지를 그대로 유지하세요. 캐시 적중 입력 token은 입력 token 합계에 이미 포함되며 중복 계산되지 않습니다. 이미지는 Chat의 image_url 또는 Responses의 input_image로 제출합니다. glm-5.3-flash는 문서(file / input_file)와 비디오도 추가로 받습니다. deepseek-v4.1-flash와 deepseek-v4-flash는 문서, 오디오, 비디오를 받지 않습니다.

공식 모델 ID

deepseek-flash와 deepseek-v4-pro는 각각 deepseek-v4.1-flash와 deepseek-v4의 동등한 ID로 허용되므로, 공식 이름에 맞춰 작성한 클라이언트도 수정 없이 그대로 동작합니다. 사용량과 과금은 APIAny.AI 모델 ID 기준으로 한 번만 기록됩니다. GET /v1/models는 두 ID를 모두 나열하고 동등한 항목에 alias_of를 표시합니다.
GLM은 같은 예시에서 "model": "glm-5.3-flash"를 사용하세요. Responses에서는 input, max_output_tokens, reasoning: { "effort": "low" }를 사용합니다. Responses에서 도구 호출을 이어갈 때는 반환된 output 항목 전체(추론 항목과 함수 호출 포함)와 이에 대응하는 function_call_output을 다음 input에 추가하세요. 추론 항목을 버리지 마세요. DeepSeek Responses는 상태를 저장하지 않으므로 previous_response_id에 의존하지 말고 대화 기록을 다시 보내야 합니다. Chat Completions에서는 reasoning_effort를, Responses에서는 reasoning: { "effort": "high" }를 사용합니다. 각 엔드포인트는 다른 형식도 호환 별칭으로 허용합니다. 둘 다 지정하면 값이 일치해야 하며, 충돌하면 400을 반환합니다. effort를 생략하면 모델 기본값이 유지됩니다. 문법상 허용되는 값은 none, minimal, low, medium, high, xhigh, max, ultra입니다. 모든 모델이 모든 값을 지원한다는 의미는 아닙니다. 잘못된 값과 문서에 명시된 모델 지원 범위를 벗어난 값은 400을 반환합니다. kimi-k3, glm-5.3-flash, gpt-6-astra, Grok 4.5 패밀리와 Gemini 3 패밀리는 추론이 항상 켜져 있으며, 추론을 끄는 값은 400을 반환합니다. gpt-5.4와 그 mini, nano 변형은 low 이상을 요청한 경우에만 추론합니다. minimax-m3와 gpt-4o-mini는 effort 파라미터를 전혀 받지 않으며, minimax-m3는 대신 thinking 객체를 제공합니다. 일부 모델은 이전 통합에서 사용하던 호환 표기도 허용합니다. grok-4.5, grok-4.5-latest, grok-4.6, grok-4.7은 max(xhigh로 실행)와 minimal(low로 실행)을 허용하고, gemini-3.1-pro는 minimal(low로 실행)을 허용합니다. 이 표기들은 요청이 실행되기 전에 정규화되므로 모델은 항상 공식 수준을 받습니다. capability_metadata.reasoning.compatEfforts가 이 매핑을 공개하며, 새 통합에서는 efforts의 값을 사용하세요. Anthropic Messages에서는 output_config.effort를 사용합니다. 네이티브 thinking은 그대로 독립적입니다. effort는 추론을 켜거나 budget_tokens를 선택하지 않습니다. Gemini 3의 네이티브 요청은 generationConfig.thinkingConfig.thinkingLevel을 사용하며, 허용되는 레벨은 모델마다 다릅니다. Gemini 2.5는 thinkingBudget을 사용합니다. OpenAI 호환 형식에서 Gemini 2.5는 minimal/low를 1024, medium을 8192, high를 24576, none을 0(Pro 제외)으로 매핑합니다. 명시적 effort와 네이티브 thinkingLevel 또는 thinkingBudget을 함께 지정하지 마세요. 설정이 동등하더라도 400을 반환합니다. includeThoughts만 단독으로는 effort와 함께 사용할 수 있습니다. 다른 OpenAI 호환 모델의 경우 문법상 유효한 effort가 선언된 지원 보장 없이 모델 실행에 전달됩니다. effort 값에 의존하기 전에 해당 모델의 기능을 확인하세요. max_completion_tokens, max_output_tokens 및 이에 대응하는 네이티브 필드와 같은 출력 한도에는 추론 토큰과 최종 답변 토큰이 함께 포함됩니다. effort는 출력 토큰 한도가 아닙니다. 요청은 여전히 예산을 소진해(Chat Completions의 finish_reason: "length") 최종 답변이 불완전하거나 비어 있을 수 있습니다.

모델 기능 메타데이터

GET /v1/models는 기능을 선언한 모든 모델에 대해 capability_metadata 객체를 반환합니다. 추측하지 않고 모델을 구성하려면 이 객체를 먼저 읽으세요:
  • input은 허용되는 입력 유형을 나열합니다: text, image, video, audio, file.
  • output은 생성되는 유형을 나열합니다.
  • features는 stream, tools, vision, jsonMode, 그리고 모델이 추론을 수행하는지 여부(thinking)를 알려줍니다.
  • reasoning은 추론 제어 방식을 설명합니다: mode(always-on, optional, none), 허용되는 efforts, effort를 생략할 때 적용되는 defaultEffort, 그리고 추론을 끌 수 있는 모델의 disableWith.
  • limits는 contextWindow와 maxOutputTokens를 알려줍니다.
reasoning.mode는 effort 값을 보내기 전에 확인해야 할 필드입니다. always-on은 추론을 끌 수 없음을, optional은 disableWith가 적용됨을, none은 해당 모델에 추론 모드가 없음을 의미합니다.
API 형식 참고: OpenAI, Anthropic Messages, Gemini, Gemini OpenAI.