先に結論:2026年9月時点で、GPT-5.5、Claude Opus 4.8 / Sonnet 4.6、Gemini 3.7 Flash はいずれも約100万 token のウィンドウを広告しています。「1M Token」は「100万漢字が読める」という意味ではなく、窓を埋め尽くすことが使いこなすことでもありません。公称上限は近い。有効検索、最大出力、価格の段差は違います。JSON を扱うなら正しい手順は、先に切り詰め、先に検証し、それからどれだけ入れるかを決めることです——ダンプ全体を貼ることではありません。
本稿は2026年9月5日時点の内容です。数字は各社の公開ドキュメントに従います。OpenAI の gpt-5.5 API は総窓 約 1,050,000 token、出力 128K。Anthropic の Opus 4.8 / Sonnet 4.6 はデフォルト 1M、出力 128K、長コンテキストの追加課金なし。Google の gemini-3.7-flash は入力 1,048,576 / 出力 65,536。プロダクト面(ChatGPT、Codex、claude.ai)はしばしばより狭いです。マーケティングページを API 上限として扱わないでください。
1M Token とは何か
Token は、モデルが数え、課金する最小のテキスト塊です——文字でも、単語でもありません。英語ではおよそ 1 token ≈ 0.75 語、約 4 文字。中国語では、トークナイザと句読点次第で、1 token が 1–2 文字に相当することが多いです。JSON はより「高い」:括弧、引用符、繰り返される key、インデントの空白がすべて予算を消費します。
1M Token は、約100万 token のコンテキストウィンドウです。粗い換算:約 75 万英語の語、または約 50–80 万漢字、または厚い本1冊から中程度の本数冊、または中規模リポジトリとドキュメント。それは「100万字の小説」でも「100万行のコード」でもありません。同じ 1M でも、散文、表、圧縮した JSON では載せられる情報量がかなり違います。
コンテキストウィンドウは1回のリクエストで同時に置ける総量です:システムプロンプト + 会話履歴 + ツール定義 + ツール戻り値 + 今回の出力。GPT-5 系は reasoning token も算入します。90万 token の入力に高い推論を載せると、モデルが「読み終わる」前に context_length_exceeded に当たります。予算はすでに尽きています。
| 言い方 | 実際の意味 | よくある誤読 |
|---|---|---|
| 1M Token | 入力+出力(一部モデルは推論も含む)約 1,000,000 token の上限 | 100万漢字 / 100万行のコードが読める |
| コンテキストウィンドウ | 1リクエストの共有予算 | アカウント生涯の記憶、または過去プロジェクト全部の自動想起 |
| 最大出力 | このターンで生成できる token 数 | ウィンドウそのものと等しい(Gemini の出力は約 64K で、1M よりはるかに小さい) |
| 有効コンテキスト | 複数ニードル検索 / 長文書推論がまだ安定する長さ | 料金ページに書いてある数字と等しい |
2023年の主流はまだ 4K–32K でした。2024年、Gemini 1.5 が 1M を見出しにしました。2025年には 200K が中位の標準になりました。2026年9月時点で、フラッグシップ API の広告数字はすでに 1M に揃っています。競争は「誰がより長いか」ではなく、「200K を超えても針を見つけられるか、キャッシュが日常使いできるほど安いか」です。
超長コンテキストウィンドウは何の役に立つか
超長ウィンドウが解くのは、1回の推論で多くの材料を同時に見ることです。データベースの代替でも、無料の無限記憶でもありません。以下の仕事は、128K ではたいてい分割か RAG が要ります。1M なら「先に検索してから聞く」を「先に載せてから聞く」に畳めることがあります——載せるものを先に選別した場合に限ります。
- リポジトリ全体 / 複数ファイルのコーディング:関連モジュール、テスト、インターフェース定義を同一ターンに置けば、「モデルがそのファイルを見ていない」が減ります。Agent コーディングのボトルネックは依然、ツールループとテストフィードバックにあり、ウィンドウ広告にはありません——《Gemini 3.8 Flash と AI Coding》で書きました。
- 長文書レビュー:契約、財務報告、仕様、複数 PDF の対照。「第47節と付録 B の衝突を見つける」向きです。「1年分のメールをそのまま貼って要約を聞く」向きではありません。
- マルチモーダル長入力:Gemini は動画、音声、画像、テキストを同一ウィンドウに算入します。1時間の動画は token を非常に速く消費します。1M はクォータであり、無圧縮アップロードへの招待ではありません。
- 複数ステップの Agent:ツール戻り JSON、エラースタック、前回のパッチを会話にしばらく残せます。ウィンドウが大きくても、スタック原文をそのまま戻し入れる理由にはなりません——《Agent JSON データフロー》を参照してください。
- 大きな JSON の対照:OpenAPI / JSON Schema、サンプルペイロード、本番エラーログを1ターンに置きます。本サイトの読者が 1M を使うべきいちばんの場所であり、請求を突き破るいちばん簡単な場所でもあります。
- RAG を1層省く:材料が安定し、体積が制御でき、毎回原文を引用する必要があるとき、まとめてコンテキストに入れるほうがベクトル庫より簡単です。材料が毎日変わり、繰り返しクエリが多いときは、検索のほうが安く、新しいままです。
逆に言えば:雑談、単ラベル分類、短い JSON 抽出に1M 窓を使うのは浪費です。レイテンシ、プリフィル、token 課金がすべて罰します。短い仕事には短いモデルか、短い予算を使ってください。
GPT、Claude、Gemini の比較
下表は、2026年9月5日にドキュメントへ書ける公開仕様です。価格は公式の100万 token あたり表価です。プロダクト面の上限は別です。Gemini 3.8 Flash は本稿時点でまだ GA ではありません——本番は 3.7 を使い続けてください。
| ベンダー / モデル | 公称ウィンドウ | 最大出力 | 入力 / 出力 価(1M あたり) | ウィンドウ上の注意 |
|---|---|---|---|---|
| OpenAI GPT-5.5 API | 約 1,050,000 | 128,000 | $5 / $30 | reasoning は総窓に算入;Codex プロダクト面は 400K |
| OpenAI GPT-5.5 Pro | 約 1,050,000 | 128,000 | $30 / $180 | 同じ窓。高いのは出力と推論 |
| OpenAI GPT-5.4 | 約 1M | 128,000 | $2.50 / $15 | 同クラス 1M、単価はより低い |
| Anthropic Claude Opus 4.8 | 1M(デフォルト、beta ヘッダなし) | 128,000 | $5 / $25 | 長コンテキスト追加課金なし;prompt cache 約 90% off |
| Anthropic Claude Sonnet 4.6 | 1M | 128,000 | $3 / $15 | context awareness 付き(残り予算を把握する) |
| Anthropic Claude Haiku 4.5 | 200K | 64,000 | $1 / $5 | 速くて安い。1M クラスではない |
| Google Gemini 3.7 Flash | 1,048,576 | 65,536 | Intro $0.75 / $3.75(〜2026-12-31) | 2027-01-01 から標準価 $1.50 / $7.50 |
| Google Gemini 3.1 Pro | 1,048,576 | 65,536 | 約 $2 / $4(200K 超で加算されることが多い) | サードパーティ頁の 2M / 10M を契約に書かない |
この表の読み方:3社のフラッグシップはいずれも約 1M を入れられます。差は出力の余裕、推論が窓を食うか、200K を超えると高くなるか、キャッシュに割引があるかです。
- 一度に長い構造化結果を吐く必要がある(大きな JSON、長いパッチ、複数ファイル diff):GPT-5.5 と Claude 4.6/4.8 の 128K 出力は、Gemini の約 64K の約2倍です。Gemini は「たくさん読んで、表を1枚書く」向きです。
- 同じシステムプロンプト + ツール Schema を毎回打つ:Claude の prompt cache、Gemini の Context Caching、OpenAI の cached input は、毎回フル入力を払うより安いです。Agent の
toolsJSON はキャッシュすべきです——《Tool Calling と JSON Schema》を参照してください。 - 予算が厳しく、材料が多く、出力が短い:Gemini 3.7 Flash の Intro 価は、依然3社で最も安い 1M クラスです。200K を超えた有効検索は、自分のデータで複数ニードルを測ってください。窓の数字だけを信じないでください。
- プロダクト面 ≠ API:ChatGPT / Codex 上の GPT-5.5 は 400K のことがあります。一部のクラウドマーケットの Claude はまだ 200K です。SLA を書く前に、出荷する面のモデルカードを開いてください。この記事の API 列をコピーしないでください。
公称ウィンドウ vs 有効ウィンドウ
2026年の合意は、もう無視しにくいです:1M を広告することと、1M を使いこなすことは別の仕事です。複数ニードル検索(MRCR v2 系:超長テキストから散らばった複数の事実を見つける)では、精度は通常 128K のあと落ち始め、200K–512K で分化し、1M 近くでは全文を「読んだ」ように振る舞うモデルは少数だけです。
公開評価とサードパーティのまとめ(設定は完全には揃っていません。傾向として見て、検収基準にしないでください)は、おおよそ次のとおりです:
- GPT-5.5:前世代に比べ、512K–1M 帯の複数ニードル推論で一段上がり、いま「本当に満窓に入れる」ときに最もよく名前が挙がる API の一つです。単ニードルで原文の一文を探すなら、3社とも 128K 内ではまだ大丈夫です。
- Claude Opus 4.6:1M 複数ニードルは約 76% と報告され、曲線は比較的平らです。4.7 / 4.8 は校正寄りです——見つからなければ拒否するか不確かだと明示し、位置を捏造しません。長文書のコンプライアンスレビューは、後者を求めることが多いです。
- Gemini 3.x:128K 内の検索と長文書理解は依然強い一方、200K を超える複数ニードルはより急に落ちます。「厚い束を読んで短い JSON を出す」向きです。「90万 token のログから8本目の針を必ず見つける」向きではありません。
本番では価格表ではなく、三つの帯で使ってください:
| 長さ帯 | どう扱うか | 推奨 |
|---|---|---|
| ≤128K | ほぼ全面利用可 | 3社ともデフォルト作業域にできる |
| 128K–256K | サンプルで測る | 自分の JSON / リポジトリで複数ニードルを行う。Arena 点は無視 |
| 256K–500K | 使える。すべての事実が見つかると仮定しない | 重要フィールドは JSONPath で事前抽出。繰り返し接頭辞はキャッシュ |
| 500K–1M | 入る。「入る」≠「読めた」 | 安定した高価値材料だけ。答えは Schema で固定 |
「中間喪失」(lost in the middle)は、ウィンドウが 1M になっても消えていません。硬い制約はシステムプロンプトの先頭とユーザーメッセージの末尾に置き、中間に付録を積んでください。モデルは、40万 token 目に埋まった列挙値より、「Schema に合う JSON だけを出力せよ」という最後の一文を覚えることが多いです。
JSON:詰め込むことと検証は別
1M 窓で初めて、「OpenAPI 全体、3日分のエラーログ、下書き Schema」が1リクエストに収まります。違法な JSON を合法にはしませんし、緩い Schema を自動で厳しくもしません。窓が解くのは可視範囲。契約が解くのは形です。すでに《Prompt から Structured Output へ》《OpenAI vs Gemini Structured Output》で同じ規律を使いました:生成段階は Schema で違法 token を止め、着地後にもう一度検証します。
80万 token の本番ダンプを丸ごと入れると、よく失敗するのは「窓が足りない」以外の理由です:繰り返す key が予算を浪費する、中間フィールドが落ちる、配列の長さを数え間違える、出力が 64K/128K 上限で切れる、請求が入力全額で跳ねる。正しい順序は切り詰め → 検証 → それから渡すです。
{
"name": "longContextPack",
"description": "Pack sent into a 1M window: only validated, trimmed JSON",
"parameters": {
"type": "object",
"additionalProperties": false,
"properties": {
"task": { "type": "string", "enum": ["align_fields", "diff_versions", "extract_errors"] },
"schemaId": { "type": "string", "description": "Stable schema id — do not paste a giant schema inline" },
"focusPaths": {
"type": "array",
"minItems": 1,
"maxItems": 32,
"items": { "type": "string", "description": "JSONPath, e.g. $.paths./v2/orders.post" }
},
"payload": { "type": "object", "description": "Already syntax-checked and size-trimmed — not a raw log string" },
"tokenBudget": { "type": "integer", "minimum": 1000, "maximum": 1000000 }
},
"required": ["task", "schemaId", "focusPaths", "payload", "tokenBudget"]
}
}
そのパックを JSON ツール箱に入れてローカルで構文検証し、JSONPath で focusPaths を抜き、Diff で2つのバージョンの payload を比べてください。モデルが見るべきは切り詰めたオブジェクトであり、20MB の .json ファイルではありません。GPT / Claude / Gemini を替えるのはモデル文字列だけです。パックのフィールド名は変えてはいけません。
いまどう使うか
- 先に token を数え、それから入れる:システムプロンプト、ツール Schema、履歴、添付を分けて見積もってください。GPT-5.5 は推論の予備を算入し、Gemini は動画 / PDF のページ数を算入します。予算超えなら切る——「まだ入るはず」に賭けないでください。
- 繰り返す接頭辞はキャッシュへ:system + tools はほぼ毎回同じなら、prompt cache / Context Caching に入れるべきです。1M 窓の最初の請求は入力代です。キャッシュが当たれば、長窓は日常使いできるようになります。
- 出力は Structured Output で縛り、「JSON を返して」と書かない:OpenAI は
response_format.json_schema、Gemini はresponseMimeType+responseJsonSchema、Claude はツールかプレフィルです。窓がどれだけ長くても、緩いプロンプトはフィールドを一つ増やし、required を一つ落とします。 - 測った有効帯を超えたら検索し、無理に詰め込まない:自分の複数ニードルが 256K で落ちたなら、70万 token のログを全文理解として扱わないでください。エラーコードとタイムスタンプを JSONPath で抜くほうが、モデルに海を泳がせるより安いです。
- 出力上限で回答を割る:Gemini は約 64K、GPT/Claude は約 128K。20万 token の JSON レポートは、分割 + 各片に Schema であり、1回で書き切ることではありません。
- ローカルのフィクスチャが通ってから API を打つ:同じ payload をブラウザで JSON 検証 と Diff に通します。何もアップロードされません。本番前に REST 契約を合わせるのと同じ習慣です。
よくある質問
1M Token は何語に相当しますか?
固定換算はありません。英語はおよそ 75 万語。中国語は句読点と混在するラテン文字次第で、およそ 50–80 万字です。JSON、コード、表は token をより速く消費します。容量計画を「100万語」でしないでください。各社の tokenizer で実サンプルを数えてください。
GPT、Claude、Gemini の 1M 窓はどれが使いやすいですか?
タスク次第です。満窓の複数ニードル推論では、公開評価で GPT-5.5 がよく先頭に来ます。捏造より拒否が欲しいなら、Claude 4.7/4.8 のほうが安定です。安くたくさん読んで短い JSON 表を書くなら、Gemini 3.7 Flash の Intro 価が3社で最も合います。「窓の数字が最大なら勝ち」ではありません。
1M 窓があれば RAG は不要ですか?
必要です。1M は安定し、境界があり、毎回原文を引用する材料向きです。コーパスが毎日変わり、繰り返しクエリが多く、または測った有効窓が 1M よりはるかに小さいときは、検索のほうが安く、更新しやすいです。長窓と RAG は補完であり、置換ではありません。
ChatGPT / Claude.ai でも満 1M が使えますか?
必ずしも使えません。API の gpt-5.5 は約 1.05M。Codex プロダクト面はよく 400K です。一部のクラウドマーケットの Claude はまだ 200K です。使っているそのプロダクトのモデルカードを信じてください。API ドキュメントをチャット製品の期待に写さないでください。
Gemini はすでに 2M や 10M ですか?
2026年9月時点で、gemini-3.7-flash と gemini-3.1-pro の公開ドキュメントは入力 1,048,576 token と書いています。2M / 10M は、より早い実験枠、集約頁、未 GA 変種に多いです。契約とクォータ表に書くときは、Google の現行モデルカードを使い、ブログの見出しを使わないでください。
JSON 全体を 1M 窓に入れても、Schema は必要ですか?
必要です。窓は可視範囲を広げるだけで、出力の形は縛りません。抽出、整列、Agent ツール引数は依然 JSON Schema が要り、着地後に構文と構造を検証します。モデルは GPT から Gemini に替えられます。フィールド名と required は動かしてはいけません。
まとめ
1M Token は 2026年フラッグシップ API の揃った広告です:GPT-5.5、Claude 4.6/4.8、Gemini 3.7 はいずれも約100万 token を限度表に書けます。役立つのは、1回の推論でリポジトリ、長文書、または切り詰めた JSON パックを同時に見るときです。無料記憶でも、「満杯にすれば理解する」でもありません。有効窓はしばしば 128K–500K にあります。満 1M は容量として扱い、理解力として扱わないでください。出力上限、推論が窓を食うか、200K のあと高くなるか——それが選定フィールドです。
宿題は次の「2M」噂を追うことではありません。窓に送る材料を Schema を通るパックに書くことです。JSONPath でパスを切り、Diff でバージョンを合わせ、検証してから API を打ってください。Structured Output と Tool Calling は本サイトですでに書いています。本稿はコンテキストウィンドウ側の読み方だけを足します。