/v1/chat/completions/v1/messages/v1beta/models/{model}:generateContent
- 入力 token。
- 出力 token。
- キャッシュされた入力 token。
- 最低リクエストクレジット。
利用可能なモデル
推論強度
Chat Completions ではreasoning_effort、Responses では reasoning: { "effort": "high" } を使用します。どちらのエンドポイントも、もう一方の形式を互換エイリアスとして受け付けます。両方を指定した場合は値が一致している必要があり、矛盾する値は 400 になります。effort を省略した場合はモデルのデフォルト動作が維持されます。
構文上の許容値は none、minimal、low、medium、high、xhigh、max、ultra です。すべてのモデルがすべての値に対応することを保証するものではありません。不正な値、および対応範囲が明記されたモデルでの対応範囲外の値は 400 になります。
kimi-k3、glm-5.3-flash、gpt-6-astra、Grok 4.5 シリーズ、Gemini 3 シリーズでは推論は常に有効で、推論を無効化する値は 400 になります。gpt-5.4 とその mini、nano は、low 以上を指定した場合にのみ推論します。minimax-m3 と gpt-4o-mini は effort パラメータ自体を受け付けません。minimax-m3 は代わりに thinking オブジェクトを使用します。
一部のモデルは、古い連携で使われていた互換表記も受け付けます。grok-4.5、grok-4.5-latest、grok-4.6、grok-4.7 は max(xhigh として実行)と minimal(low として実行)を受け付け、gemini-3.1-pro は minimal(low として実行)を受け付けます。これらはリクエストの実行前に正規化されるため、モデルは常に公式の強度を受け取ります。capability_metadata.reasoning.compatEfforts がこのマッピングを公開しています。新しい連携では efforts の値を使用してください。
Anthropic Messages では output_config.effort を使用します。ネイティブの thinking は独立した設定のままです。effort は思考を有効化せず、budget_tokens も選択しません。
Gemini 3 のネイティブリクエストは generationConfig.thinkingConfig.thinkingLevel を使用し、受け付けられるレベルはモデルごとに異なります。Gemini 2.5 は thinkingBudget を使用します。OpenAI 互換形式では、Gemini 2.5 の minimal/low は 1024、medium は 8192、high は 24576、none は 0(Pro を除く)に対応します。明示的な effort とネイティブの thinkingLevel または thinkingBudget は併用しないでください。設定が同等であっても 400 になります。includeThoughts のみであれば effort と併用できます。
その他の OpenAI 互換モデルでは、構文上有効な effort はモデル実行のために受け付けられますが、対応を保証するものではありません。effort の値に依存する前に、モデルの能力を確認してください。
max_completion_tokens、max_output_tokens およびネイティブの相当フィールドは、推論と最終回答のトークンを含みます。effort は出力トークンの上限ではありません。リクエストが予算を使い切ると(Chat Completions では finish_reason: "length")、最終回答が不完全または空になる場合があります。
画像は Chat の image_url または Responses の input_image で送信します。glm-5.3-flash はさらにドキュメント(file / input_file)と動画を受け付けます。deepseek-v4.1-flash と deepseek-v4-flash はドキュメント、音声、動画を受け付けません。
公式モデル ID
deepseek-flash と deepseek-v4-pro は、deepseek-v4.1-flash と deepseek-v4 の等価な ID としてそのまま使用できます。公式名で作成されたクライアントは変更なしで動作します。使用量と課金は APIAny.AI のモデル ID で一度だけ記録されます。GET /v1/models は両方の ID を一覧し、等価なエントリを alias_of で示します。
モデル能力メタデータ
GET /v1/models は、能力を宣言しているすべてのモデルについて capability_metadata オブジェクトを返します。推測せずにモデルを設定するために、これを読んでください。
inputは受け付けられる入力タイプを列挙します:text、image、video、audio、file。outputは生成されるタイプを列挙します。featuresはstream、tools、vision、jsonMode、およびモデルがそもそも推論するかどうか(thinking)を報告します。reasoningは推論の制御方法を説明します:mode(always-on、optional、none)、受け付けられるefforts、effort を省略したときに適用されるdefaultEffort、および推論を無効化できるモデルのdisableWith。limitsはcontextWindowとmaxOutputTokensを報告します。
reasoning.mode は、effort の値を送信する前に確認すべきフィールドです。always-on は推論を無効化できないことを意味し、optional は disableWith が適用されることを意味し、none はそのモデルに推論モードがないことを意味します。