各生成AIモデルの最大トークン数比較ガイド

はじめに

生成AIの性能や使い勝手を語るうえで欠かせない指標が、「コンテクスト長」「最大入力トークン」「最大出力トークン」です。これらの数値はモデルごとに大きく異なり、生成AIの業務利用設計に直結します。

本記事は、 生成AIモデル選定のチェックポイントを説明した後に、GPTシリーズ/Claude/Gemini 等の主要モデルのそれぞれの値を横断比較します。

生成AIの「コンテクスト長」「最大入出力トークン」に関しては、以下を参照ください。

生成AIのコンテクスト長と最大入出力トークンをGPT5で解説

はじめに 近年の生成AI(ChatGPT、Claude、Geminiなど)は、コンテクスト長の大幅拡大により、長文の資料や大量の情報を一度に扱えるようになりました。 特に昨今では AI…

※本記事の、「主要モデルの最新仕様一覧」の情報は、最新の生成AIモデルが発表されたタイミングで、随時追記しています

生成AIモデル選定のチェックポイント

生成AIモデルの選定は、単なるスペック比較だけでなく、自社の業務特性や目標に合致しているかを見極めることが重要です。以下の観点を深く掘り下げて検討することが重要です。

1.用途

要約、文章生成、データ解析、対話応答など、主な利用目的を明確化します。複合的に活用する場合は、どの機能を最優先するかを決めることがモデル選びの第一歩です。

2.データ量と種類

長期履歴や数百ページ規模の文書を扱うか、短文・単発リクエスト中心かを確認します。さらにテキスト以外に画像や音声などマルチモーダル対応が必要かも考慮します。
ドキュメントレビューや契約書比較など、長い履歴や大量の文書をまとめて扱いたい場合は、コンテクスト長が大きいモデルがおすすめです。
長文レポート生成や物語作成のように出力の長さを重視する場合は、最大出力トークンが大きいモデルを選びましょう。GPT-5などは128k級の出力にも対応します。

3.コスト構造

トークン単価だけでなく、API呼び出し頻度、推論時間による従量課金、モデルの種類ごとの価格差を含めて総合的に試算します。社内の利用拡大に伴うコスト増も見越しましょう。

4.応答速度と安定性

リアルタイム性が重要な顧客対応や会話用途か、時間をかけても高精度な出力が必要な分析用途かで選択肢は変わります。応答の一貫性や再現性も評価軸に加えると安心です。

5.将来の拡張性

現時点のニーズだけでなく、今後の業務拡大や新規プロジェクトに対応できるモデルかどうか、アップデートや新機能追加の頻度も含めて検討しましょう。

6.セキュリティと運用要件

機密データを扱う場合、データ保持ポリシー、モデルの安全性、ログや監査、暗号化やアクセス制御などの要件を満たすか確認します。

主要モデルの最新仕様一覧(2026年9月更新:GPT 6 Astra/Claude Fable 5.1/Claude Mythos 5.1/Opus 5/Gemini 3.7 Flashなど追加)

※ 下表は公式ドキュメント情報を元に作成。ベータ機能やAPI更新で変動する場合があります。
※※OpenAIのGPTシリーズ、AnthropicのClaudeシリーズ、GoogleのGeminiシリーズなどを中心に、最新モデルを随時追記しています

モデル名コンテクスト長最大入力トークン最大出力トークン補足説明
GPT-6 Astra1,050,000922,000128,000
OpenAIの最上位モデルで、複雑な推論、コーディング、コンピュータ操作、リサーチ、ドキュメント作成などの高度なエンドツーエンド業務向けに設計。
https://developers.openai.com/api/docs/models/gpt-6-astra
GPT-5.6 Sol1,050,000922,000128,000GPT-5.6シリーズのフラッグシップモデル。入力トークンが272Kを超えるプロンプトでは、リクエスト全体に対して入力料金が2倍、出力料金が1.5倍になる。
https://developers.openai.com/api/docs/models/gpt-5.6-sol
GPT-5.6 Terra1,050,000922,000128,000性能とコストのバランスを重視したモデル
https://developers.openai.com/api/docs/models/gpt-5.6-terra
GPT-5.6 Luna1,050,000922,000128,000コスト重視・大量処理向けモデル
https://developers.openai.com/api/docs/models/gpt-5.6-luna
GPT-5.51,050,000922,000128,000GPT-5.5では、入力トークンが272Kを超えるプロンプトについて、standard、batch、flexの各利用形態において、セッション全体に対して入力料金は2倍、出力料金は1.5倍になる
https://developers.openai.com/api/docs/models/gpt-5.5
GPT-5.5 Pro1,050,000922,000128,000GPT-5.5 Proは難しい問題に取り組むよう設計されているため、一部のリクエストでは完了までに数分かかる場合がある。
https://developers.openai.com/api/docs/models/gpt-5.5-pro
GPT‑5.4 mini400,000272,000128,000OpenAIモデルページ。
https://developers.openai.com/api/docs/models/gpt-5.4-mini
GPT‑5.4 nano400,000272,000128,000OpenAIモデルページ。
https://developers.openai.com/api/docs/models/gpt-5.4-nano
GPT-5.41,050,000922,000128,000OpenAIモデルページ。1.05M context windowに増加。
https://developers.openai.com/api/docs/models/gpt-5.4
GPT-5.4 Pro1,050,000922,000128,000OpenAIモデルページ。
https://developers.openai.com/api/docs/models/gpt-5.4-pro
GPT-5.2400,000272,000128,000OpenAIモデルページ。
https://platform.openai.com/docs/models/gpt-5.2
GPT-5.1400,000272,000128,000OpenAIモデルページ。
https://platform.openai.com/docs/models/gpt-5.1
GPT-5.3-Codex400,000272,000128,000OpenAIモデルページ。
https://openai.com/ja-JP/index/introducing-gpt-5-3-codex/
https://platform.openai.com/docs/models/gpt-5-codex
GPT‑4o128,000-16,384OpenAIモデルページ。
https://platform.openai.com/docs/models/gpt-4o
GPT‑4o mini128,000-16,384OpenAIモデルページ。
https://platform.openai.com/docs/models/gpt-4o-mini
o1200,000-100,000OpenAIモデルページ。
https://platform.openai.com/docs/models/o1
o3‑mini200,000-100,000OpenAIモデルページ。
https://platform.openai.com/docs/models/o3-mini
o4‑mini200,000-100,000OpenAIモデルページ。
https://platform.openai.com/docs/models/o4-mini
o3200,000-100,000
OpenAIモデルページ。
https://platform.openai.com/docs/models/o3
GPT‑4.11,047,576-32,768OpenAIモデルページ。
https://platform.openai.com/docs/models/gpt-4.1
GPT‑4.1 mini1,047,576-32,768OpenAIモデルページ。
https://platform.openai.com/docs/models/gpt-4.1-mini
o3‑pro200,000-100,000OpenAIモデルページ。
https://platform.openai.com/docs/models/o3-pro
gpt‑oss‑20B/120B131,072-≤131,072
(理論上限)
ローカル推論では入出力の配分は実行エンジン設定次第
https://platform.openai.com/docs/models/gpt-oss-120b
GPT‑5(main/mini/nano)400,000272,000128,000OpenAIモデルページ。
https://platform.openai.com/docs/models/gpt-5
「API では、すべての GPT‑5 モデルが最大 272,000 の入力トークンと最大 128,000 の推論・出力トークンに対応しており、合計で最大 400,000 トークンのコンテキスト長を扱えます。」と説明
https://openai.com/ja-JP/index/introducing-gpt-5-for-developers/
GPT-5-Codex400,000272,000128,000OpenAIモデルページ。
https://platform.openai.com/docs/models/gpt-5-codex
Gemini 3.8 Flash1,048,5761,048,57665,536Gemini 3.7 Flashから、ソフトウェアエンジニアリング、エージェント型タスク、専門分野における複雑な多段階推論を強化したGoogleの高速・高性能モデル。
https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash
Gemini 3.7 Flash1,048,5761,048,576(上限)65,536Gemini 3.6 Flashをベースとしたモデル
https://ai.google.dev/gemini-api/docs/models/gemini-3.7-flash
Gemini 3.6 Flash1,048,5761,048,576(※Google Gemini APIのモデル仕様に記載された入力トークン上限。コンテクストウィンドウは入力と出力を合わせた上限であるため、実際に利用できる入力トークン数は、生成する出力トークン数などに応じて減少)65,536Gemini 3.5 Flashを基盤に、コーディング、ナレッジワーク、マルチモーダル処理を強化したGoogleの汎用モデル
https://ai.google.dev/gemini-api/docs/models/gemini-3.6-flash?hl=ja
Gemini 3.5 Flash-Lite1,048,5761,048,57665,536低レイテンシ、高スループット、低コストを重視したGemini 3.5シリーズの軽量モデル
https://ai.google.dev/gemini-api/docs/models/gemini-3.5-flash-lite?hl=ja
Gemini 3.5 Flash1,048,5761,048,57665,536Googleの高速・高性能モデル。テキスト、画像、動画、音声、PDFを入力でき、出力はテキスト。Thinking、コード実行、関数呼び出し、構造化出力、検索グラウンディング、URLコンテキスト、キャッシュに対応。知識カットオフは2025年1月。
https://ai.google.dev/gemini-api/docs/models/gemini-3.5-flash?hl=ja
Gemini 3.1 Pro1,114,1121,048,57665,536Gemini APIドキュメント(モデルコード: gemini-3.1-pro-preview)
https://ai.google.dev/gemini-api/docs/models/gemini-3.1-pro-preview?hl=ja
Gemini 3 Pro1,114,1121,048,57665,536Gemini APIドキュメント
https://ai.google.dev/gemini-api/docs/models/gemini-3-pro-preview?hl=ja
Gemini 2.0 Flash/-Lite1,056,7681,048,5768,192Vertex AI公式の Max input / Max output を合算して表のコンテクスト長を算出。
https://cloud.google.com/vertex-ai/generative-ai/docs/models/gemini/2-0-flash?hl=ja
Gemma 4256,000(※E2B/E4Bは128,000)可変(合計内)可変(合計内)E2B/E4Bは128K、26B A4B/31Bは256K。Open-weightモデルのため、入出力の配分は総コンテクスト枠内で可変。実運用上の上限は推論ランタイム設定にも依存。
https://ai.google.dev/gemma/docs/core/model_card_4?hl=ja
Gemma 3128,000
(※1Bは 32,000)
可変(合計内)可変(合計内)「出力は入力を差し引いた合計枠内で可変」と説明。
https://ai.google.dev/gemma/docs/core?hl=ja
Gemini 2.5 Flash/‑Lite1,114,1111,048,57665,535Vertex AI公式の Max input / Max output を合算して表のコンテクスト長を算出。
https://cloud.google.com/vertex-ai/generative-ai/docs/models/gemini/2-5-flash?hl=ja
Gemini 2.5 Pro1,114,1111,048,57665,535Vertex AI公式の Max input / Max output を合算して表のコンテクスト長を算出。
https://cloud.google.com/vertex-ai/generative-ai/docs/models/gemini/2-5-pro?hl=ja
Gemma 3n32,000可変(合計内)可変(合計内)出力上限は推論ランタイム設定に依存。
https://ai.google.dev/gemma/docs/gemma-3n?hl=ja
Claude Fable 5.11,000,0001,000,000(コンテクスト長に依存。128,000出力を確保する設計では実効入力は約872,000128,000Fable 5を強化した、コーディング・知識労働・長時間のエージェント型タスク向けモデル。キャッシュ読み取り料金の引き下げにより、一般的なワークロードではFable 5比で約25%、エージェント型タスクでは最大約45%のコスト削減が見込まれる。https://www.anthropic.com/claude-fable-and-mythos-5-1
Claude Mythos 5.11,000,0001,000,000(コンテクスト長に依存。128,000出力を確保する設計では実効入力は約872,000128,000Fable 5.1と同じ基盤モデルを採用し、サイバーセキュリティやライフサイエンスの専門用途向けに異なるセーフガードを適用したモデル。審査された組織向けのTrusted Access Programを通じて提供される。
https://www.anthropic.com/claude-fable-and-mythos-5-1
Claude Fable 51,000,0001,000,000(コンテクスト長に依存。128,000出力を確保する設計では実効入力は約872,000)128,000安全性分類器による 拒否が発生する可能性があるため、API連携時には拒否レスポンス処理や他モデルへのフォールバック設計が重要
https://platform.claude.com/docs/en/about-claude/models/introducing-claude-fable-5-and-claude-mythos-5
Claude Opus 51,000,000最大約1,000,000(入力・出力・思考を含む総コンテクスト枠に依存。最大128,000トークンの出力枠を確保する設計では、入力の目安は約872,000)128,000(思考トークンと応答テキストの合計)Adaptive Thinkingがデフォルトで有効。effortをlow~maxの5段階で調整できる、タスクに応じて精度・コスト・応答速度を最適化しやすい。Opus 4.8から移行する場合は、思考トークンもmax_tokensに含まれる点に注意。
https://platform.claude.com/docs/ja/about-claude/models/whats-new-opus-5
Claude Opus 4.81,000,0001,000,000(コンテクスト長に依存。128,000出力を確保する設計では実効入力は約872,000)128,000長時間のエージェント型コーディング、高自律タスク向け
https://platform.claude.com/docs/en/about-claude/models/whats-new-claude-4-8
 Claude Opus 4.71,000,0001M(コンテクスト長に依存)128,000「最大トークン数競争」よりも「長大コンテキストの安定運用」に重心を置いたモデル
https://platform.claude.com/docs/en/about-claude/models/whats-new-claude-4-7
 Claude Opus 4.6200,000 (標準)/1M(beta)200,000(標準)/1M(beta)128,000200Kコンテキスト(betaで1M)+最大128K出力
https://platform.claude.com/docs/en/about-claude/models/whats-new-claude-4-6
Claude Sonnet 51,000,0001,000,000コンテクスト長に依存。128,000出力を確保する設計では実効入力は約872,000)128,000速度と知能のバランスに優れたSonnet系の次世代モデル。1Mコンテキストと128K出力に標準対応し、adaptive thinkingがデフォルトで有効。新トークナイザーにより同じテキストでも約30%多くトークン化される場合があるため、移行時はトークン数・max_tokens・コストの再見積もりが重要
https://platform.claude.com/docs/en/about-claude/models/whats-new-sonnet-5
Claude Sonnet 4.5200,000136,00064,000Anthropic公式比較表。
https://docs.claude.com/en/docs/about-claude/models/overview#model-comparison-table
Claude Sonnet 3.7200,000136,00064,000
(※βで 128,000 可)
Anthropic公式の比較表。
https://docs.anthropic.com/en/docs/about-claude/models/overview
Claude Sonnet 4200,000
(※βで 1,000,000 可)
136,000
(※β時は 936,000)
64,000Anthropic公式の比較表。
https://docs.anthropic.com/en/docs/about-claude/models/overview
Claude Opus 4.1200,000168,00032,000Anthropic公式比較表。 https://docs.anthropic.com/en/docs/about-claude/models/overview
Grok 4.5500,000未公表未公表最大入力トークンおよび最大出力トークンの個別上限は、公式には公表されていない。
https://docs.x.ai/developers/models/grok-4.5
Qwen3.6-27B262,144出力枠と共有。最大出力81,920を確保するなら約180,224、推奨出力32,768なら約229,376推奨32,768、最大81,920https://ai.azure.com/catalog/models/qwen-qwen3.6-27b
DeepSeek-V4-Pro/Flash1,000,000未公表。最大出力384Kを確保する前提なら実効約616K384,000https://ai.azure.com/catalog/models/DeepSeek-V4-Flash

まとめ

昨今は 100万トークン級のコンテクスト長や、思考時間を調整する「Thinking」系の進化により、長さだけでなく推論の質と柔軟性が重要になっています。

用途と制約(精度・コスト・速度)を踏まえ、最適なモデルの組み合わせを選ぶことが、生成AI活用のROI最大化につながります。


ご相談を希望される方は、お気軽にこちらのお問い合わせフォームからご連絡ください。

筆者
AITC センター長
深谷 勇次