/v1beta/models/{model}:generateContent para integraciones compatibles con Gemini.
Streaming
Llama a:streamGenerateContent en lugar de :generateContent para recibir un
flujo de server-sent events de Gemini con fragmentos incrementales de candidates.
Salida estructurada
UsagenerationConfig.responseMimeType: "application/json" junto con
responseSchema para obtener salida en JSON:
Parámetros
generationConfig admitidos: temperature, topP, topK, maxOutputTokens,
stopSequences, responseMimeType, responseSchema, responseModalities
(incluye IMAGE para salida de imagen). También tools de nivel superior (functionDeclarations)
y systemInstruction.
Intensidad del razonamiento
Gemini 3 utilizagenerationConfig.thinkingConfig.thinkingLevel; Gemini 2.5 utiliza generationConfig.thinkingConfig.thinkingBudget. Los niveles y presupuestos admitidos dependen del modelo. Gemini 3 no admite none y Gemini 2.5 Pro no permite desactivar el pensamiento.
minimal/low a un presupuesto de 1024 tokens de pensamiento, medium a 8192, high a 24576 y none a 0 si se admite. No combines effort explícito con thinkingLevel o thinkingBudget nativos: se devuelve 400 incluso si los ajustes son equivalentes. includeThoughts por sí solo puede combinarse con effort. Consulta los controles de razonamiento por modelo.
Los límites como max_completion_tokens, max_output_tokens y sus equivalentes nativos incluyen tokens de razonamiento y de respuesta final. effort no es un límite de tokens de salida. El presupuesto puede agotarse (finish_reason: "length" en Chat Completions) y dejar la respuesta final incompleta o vacía.