/v1beta/models/{model}:generateContent를 사용하세요.
스트리밍
:generateContent 대신 :streamGenerateContent를 호출하면 증분
candidates 청크로 구성된 Gemini SSE 스트림을 받습니다.
구조화된 출력
JSON 출력을 위해generationConfig.responseMimeType: "application/json"과
responseSchema를 함께 사용하세요.
파라미터
지원되는generationConfig: temperature, topP, topK, maxOutputTokens,
stopSequences, responseMimeType, responseSchema, responseModalities
(이미지 출력을 위해 IMAGE 포함). 또한 최상위 tools(functionDeclarations)와
systemInstruction을 지원합니다.
추론 강도
Gemini 3는generationConfig.thinkingConfig.thinkingLevel, Gemini 2.5는 generationConfig.thinkingConfig.thinkingBudget을 사용합니다. 지원 수준과 예산은 모델마다 다릅니다. Gemini 3는 none을 지원하지 않으며 Gemini 2.5 Pro는 추론을 끌 수 없습니다.
minimal/low가 1024토큰, medium이 8192, high가 24576이며, 지원 모델의 none은 0입니다. 명시적인 effort와 네이티브 thinkingLevel 또는 thinkingBudget은 동시에 지정할 수 없으며, 설정이 동등해도 400을 반환합니다. includeThoughts만 있으면 effort와 함께 사용할 수 있습니다. 모델별 추론 제어를 참고하세요.
max_completion_tokens, max_output_tokens 및 네이티브 대응 필드는 추론과 최종 답변 토큰의 합계를 제한합니다. effort 자체는 출력 토큰 상한이 아닙니다. 예산이 소진되면(Chat Completions의 finish_reason: "length") 최종 답변이 불완전하거나 비어 있을 수 있습니다.