1M Token とは?超長コンテキストウィンドウの用途と GPT・Claude・Gemini 比較

2026年9月5日時点:1M Token の意味、超長コンテキストが本当に役立つ場面、GPT-5.5、Claude Opus 4.8 / Sonnet 4.6、Gemini 3.7 Flash の公称窓・実効検索・価格の比較。

先に結論:2026年9月時点で、GPT-5.5、Claude Opus 4.8 / Sonnet 4.6、Gemini 3.7 Flash はいずれも約100万 token のウィンドウを広告しています。「1M Token」は「100万漢字が読める」という意味ではなく、窓を埋め尽くすことが使いこなすことでもありません。公称上限は近い。有効検索、最大出力、価格の段差は違います。JSON を扱うなら正しい手順は、先に切り詰め、先に検証し、それからどれだけ入れるかを決めることです——ダンプ全体を貼ることではありません。

本稿は2026年9月5日時点の内容です。数字は各社の公開ドキュメントに従います。OpenAI の gpt-5.5 API は総窓 約 1,050,000 token、出力 128K。Anthropic の Opus 4.8 / Sonnet 4.6 はデフォルト 1M、出力 128K、長コンテキストの追加課金なし。Google の gemini-3.7-flash は入力 1,048,576 / 出力 65,536。プロダクト面(ChatGPT、Codex、claude.ai)はしばしばより狭いです。マーケティングページを API 上限として扱わないでください。

1M Token とは何か

Token は、モデルが数え、課金する最小のテキスト塊です——文字でも、単語でもありません。英語ではおよそ 1 token ≈ 0.75 語、約 4 文字。中国語では、トークナイザと句読点次第で、1 token が 1–2 文字に相当することが多いです。JSON はより「高い」:括弧、引用符、繰り返される key、インデントの空白がすべて予算を消費します。

1M Token は、約100万 token のコンテキストウィンドウです。粗い換算:約 75 万英語の語、または約 50–80 万漢字、または厚い本1冊から中程度の本数冊、または中規模リポジトリとドキュメント。それは「100万字の小説」でも「100万行のコード」でもありません。同じ 1M でも、散文、表、圧縮した JSON では載せられる情報量がかなり違います。

コンテキストウィンドウは1回のリクエストで同時に置ける総量です:システムプロンプト + 会話履歴 + ツール定義 + ツール戻り値 + 今回の出力。GPT-5 系は reasoning token も算入します。90万 token の入力に高い推論を載せると、モデルが「読み終わる」前に context_length_exceeded に当たります。予算はすでに尽きています。

言い方実際の意味よくある誤読
1M Token入力+出力(一部モデルは推論も含む)約 1,000,000 token の上限100万漢字 / 100万行のコードが読める
コンテキストウィンドウ1リクエストの共有予算アカウント生涯の記憶、または過去プロジェクト全部の自動想起
最大出力このターンで生成できる token 数ウィンドウそのものと等しい(Gemini の出力は約 64K で、1M よりはるかに小さい)
有効コンテキスト複数ニードル検索 / 長文書推論がまだ安定する長さ料金ページに書いてある数字と等しい

2023年の主流はまだ 4K–32K でした。2024年、Gemini 1.5 が 1M を見出しにしました。2025年には 200K が中位の標準になりました。2026年9月時点で、フラッグシップ API の広告数字はすでに 1M に揃っています。競争は「誰がより長いか」ではなく、「200K を超えても針を見つけられるか、キャッシュが日常使いできるほど安いか」です。

超長コンテキストウィンドウは何の役に立つか

超長ウィンドウが解くのは、1回の推論で多くの材料を同時に見ることです。データベースの代替でも、無料の無限記憶でもありません。以下の仕事は、128K ではたいてい分割か RAG が要ります。1M なら「先に検索してから聞く」を「先に載せてから聞く」に畳めることがあります——載せるものを先に選別した場合に限ります。

  • リポジトリ全体 / 複数ファイルのコーディング:関連モジュール、テスト、インターフェース定義を同一ターンに置けば、「モデルがそのファイルを見ていない」が減ります。Agent コーディングのボトルネックは依然、ツールループとテストフィードバックにあり、ウィンドウ広告にはありません——《Gemini 3.8 Flash と AI Coding》で書きました。
  • 長文書レビュー:契約、財務報告、仕様、複数 PDF の対照。「第47節と付録 B の衝突を見つける」向きです。「1年分のメールをそのまま貼って要約を聞く」向きではありません。
  • マルチモーダル長入力:Gemini は動画、音声、画像、テキストを同一ウィンドウに算入します。1時間の動画は token を非常に速く消費します。1M はクォータであり、無圧縮アップロードへの招待ではありません。
  • 複数ステップの Agent:ツール戻り JSON、エラースタック、前回のパッチを会話にしばらく残せます。ウィンドウが大きくても、スタック原文をそのまま戻し入れる理由にはなりません——《Agent JSON データフロー》を参照してください。
  • 大きな JSON の対照:OpenAPI / JSON Schema、サンプルペイロード、本番エラーログを1ターンに置きます。本サイトの読者が 1M を使うべきいちばんの場所であり、請求を突き破るいちばん簡単な場所でもあります。
  • RAG を1層省く:材料が安定し、体積が制御でき、毎回原文を引用する必要があるとき、まとめてコンテキストに入れるほうがベクトル庫より簡単です。材料が毎日変わり、繰り返しクエリが多いときは、検索のほうが安く、新しいままです。

逆に言えば:雑談、単ラベル分類、短い JSON 抽出に1M 窓を使うのは浪費です。レイテンシ、プリフィル、token 課金がすべて罰します。短い仕事には短いモデルか、短い予算を使ってください。

GPT、Claude、Gemini の比較

下表は、2026年9月5日にドキュメントへ書ける公開仕様です。価格は公式の100万 token あたり表価です。プロダクト面の上限は別です。Gemini 3.8 Flash は本稿時点でまだ GA ではありません——本番は 3.7 を使い続けてください。

ベンダー / モデル公称ウィンドウ最大出力入力 / 出力 価(1M あたり)ウィンドウ上の注意
OpenAI GPT-5.5 API約 1,050,000128,000$5 / $30reasoning は総窓に算入;Codex プロダクト面は 400K
OpenAI GPT-5.5 Pro約 1,050,000128,000$30 / $180同じ窓。高いのは出力と推論
OpenAI GPT-5.4約 1M128,000$2.50 / $15同クラス 1M、単価はより低い
Anthropic Claude Opus 4.81M(デフォルト、beta ヘッダなし)128,000$5 / $25長コンテキスト追加課金なし;prompt cache 約 90% off
Anthropic Claude Sonnet 4.61M128,000$3 / $15context awareness 付き(残り予算を把握する)
Anthropic Claude Haiku 4.5200K64,000$1 / $5速くて安い。1M クラスではない
Google Gemini 3.7 Flash1,048,57665,536Intro $0.75 / $3.75(〜2026-12-31)2027-01-01 から標準価 $1.50 / $7.50
Google Gemini 3.1 Pro1,048,57665,536約 $2 / $4(200K 超で加算されることが多い)サードパーティ頁の 2M / 10M を契約に書かない

この表の読み方:3社のフラッグシップはいずれも約 1M を入れられます。差は出力の余裕、推論が窓を食うか、200K を超えると高くなるか、キャッシュに割引があるかです。

  • 一度に長い構造化結果を吐く必要がある(大きな JSON、長いパッチ、複数ファイル diff):GPT-5.5 と Claude 4.6/4.8 の 128K 出力は、Gemini の約 64K の約2倍です。Gemini は「たくさん読んで、表を1枚書く」向きです。
  • 同じシステムプロンプト + ツール Schema を毎回打つ:Claude の prompt cache、Gemini の Context Caching、OpenAI の cached input は、毎回フル入力を払うより安いです。Agent の tools JSON はキャッシュすべきです——《Tool Calling と JSON Schema》を参照してください。
  • 予算が厳しく、材料が多く、出力が短い:Gemini 3.7 Flash の Intro 価は、依然3社で最も安い 1M クラスです。200K を超えた有効検索は、自分のデータで複数ニードルを測ってください。窓の数字だけを信じないでください。
  • プロダクト面 ≠ API:ChatGPT / Codex 上の GPT-5.5 は 400K のことがあります。一部のクラウドマーケットの Claude はまだ 200K です。SLA を書く前に、出荷する面のモデルカードを開いてください。この記事の API 列をコピーしないでください。

公称ウィンドウ vs 有効ウィンドウ

2026年の合意は、もう無視しにくいです:1M を広告することと、1M を使いこなすことは別の仕事です。複数ニードル検索(MRCR v2 系:超長テキストから散らばった複数の事実を見つける)では、精度は通常 128K のあと落ち始め、200K–512K で分化し、1M 近くでは全文を「読んだ」ように振る舞うモデルは少数だけです。

公開評価とサードパーティのまとめ(設定は完全には揃っていません。傾向として見て、検収基準にしないでください)は、おおよそ次のとおりです:

  • GPT-5.5:前世代に比べ、512K–1M 帯の複数ニードル推論で一段上がり、いま「本当に満窓に入れる」ときに最もよく名前が挙がる API の一つです。単ニードルで原文の一文を探すなら、3社とも 128K 内ではまだ大丈夫です。
  • Claude Opus 4.6:1M 複数ニードルは約 76% と報告され、曲線は比較的平らです。4.7 / 4.8 は校正寄りです——見つからなければ拒否するか不確かだと明示し、位置を捏造しません。長文書のコンプライアンスレビューは、後者を求めることが多いです。
  • Gemini 3.x:128K 内の検索と長文書理解は依然強い一方、200K を超える複数ニードルはより急に落ちます。「厚い束を読んで短い JSON を出す」向きです。「90万 token のログから8本目の針を必ず見つける」向きではありません。

本番では価格表ではなく、三つの帯で使ってください:

長さ帯どう扱うか推奨
≤128Kほぼ全面利用可3社ともデフォルト作業域にできる
128K–256Kサンプルで測る自分の JSON / リポジトリで複数ニードルを行う。Arena 点は無視
256K–500K使える。すべての事実が見つかると仮定しない重要フィールドは JSONPath で事前抽出。繰り返し接頭辞はキャッシュ
500K–1M入る。「入る」≠「読めた」安定した高価値材料だけ。答えは Schema で固定

「中間喪失」(lost in the middle)は、ウィンドウが 1M になっても消えていません。硬い制約はシステムプロンプトの先頭とユーザーメッセージの末尾に置き、中間に付録を積んでください。モデルは、40万 token 目に埋まった列挙値より、「Schema に合う JSON だけを出力せよ」という最後の一文を覚えることが多いです。

JSON:詰め込むことと検証は別

1M 窓で初めて、「OpenAPI 全体、3日分のエラーログ、下書き Schema」が1リクエストに収まります。違法な JSON を合法にはしませんし、緩い Schema を自動で厳しくもしません。窓が解くのは可視範囲。契約が解くのは形です。すでに《Prompt から Structured Output へ》《OpenAI vs Gemini Structured Output》で同じ規律を使いました:生成段階は Schema で違法 token を止め、着地後にもう一度検証します。

80万 token の本番ダンプを丸ごと入れると、よく失敗するのは「窓が足りない」以外の理由です:繰り返す key が予算を浪費する、中間フィールドが落ちる、配列の長さを数え間違える、出力が 64K/128K 上限で切れる、請求が入力全額で跳ねる。正しい順序は切り詰め → 検証 → それから渡すです。

{
  "name": "longContextPack",
  "description": "Pack sent into a 1M window: only validated, trimmed JSON",
  "parameters": {
    "type": "object",
    "additionalProperties": false,
    "properties": {
      "task": { "type": "string", "enum": ["align_fields", "diff_versions", "extract_errors"] },
      "schemaId": { "type": "string", "description": "Stable schema id — do not paste a giant schema inline" },
      "focusPaths": {
        "type": "array",
        "minItems": 1,
        "maxItems": 32,
        "items": { "type": "string", "description": "JSONPath, e.g. $.paths./v2/orders.post" }
      },
      "payload": { "type": "object", "description": "Already syntax-checked and size-trimmed — not a raw log string" },
      "tokenBudget": { "type": "integer", "minimum": 1000, "maximum": 1000000 }
    },
    "required": ["task", "schemaId", "focusPaths", "payload", "tokenBudget"]
  }
}

そのパックを JSON ツール箱に入れてローカルで構文検証し、JSONPath で focusPaths を抜き、Diff で2つのバージョンの payload を比べてください。モデルが見るべきは切り詰めたオブジェクトであり、20MB の .json ファイルではありません。GPT / Claude / Gemini を替えるのはモデル文字列だけです。パックのフィールド名は変えてはいけません。

いまどう使うか

  1. 先に token を数え、それから入れる:システムプロンプト、ツール Schema、履歴、添付を分けて見積もってください。GPT-5.5 は推論の予備を算入し、Gemini は動画 / PDF のページ数を算入します。予算超えなら切る——「まだ入るはず」に賭けないでください。
  2. 繰り返す接頭辞はキャッシュへ:system + tools はほぼ毎回同じなら、prompt cache / Context Caching に入れるべきです。1M 窓の最初の請求は入力代です。キャッシュが当たれば、長窓は日常使いできるようになります。
  3. 出力は Structured Output で縛り、「JSON を返して」と書かない:OpenAI は response_format.json_schema、Gemini は responseMimeType + responseJsonSchema、Claude はツールかプレフィルです。窓がどれだけ長くても、緩いプロンプトはフィールドを一つ増やし、required を一つ落とします。
  4. 測った有効帯を超えたら検索し、無理に詰め込まない:自分の複数ニードルが 256K で落ちたなら、70万 token のログを全文理解として扱わないでください。エラーコードとタイムスタンプを JSONPath で抜くほうが、モデルに海を泳がせるより安いです。
  5. 出力上限で回答を割る:Gemini は約 64K、GPT/Claude は約 128K。20万 token の JSON レポートは、分割 + 各片に Schema であり、1回で書き切ることではありません。
  6. ローカルのフィクスチャが通ってから API を打つ:同じ payload をブラウザで JSON 検証 と Diff に通します。何もアップロードされません。本番前に REST 契約を合わせるのと同じ習慣です。

よくある質問

1M Token は何語に相当しますか?

固定換算はありません。英語はおよそ 75 万語。中国語は句読点と混在するラテン文字次第で、およそ 50–80 万字です。JSON、コード、表は token をより速く消費します。容量計画を「100万語」でしないでください。各社の tokenizer で実サンプルを数えてください。

GPT、Claude、Gemini の 1M 窓はどれが使いやすいですか?

タスク次第です。満窓の複数ニードル推論では、公開評価で GPT-5.5 がよく先頭に来ます。捏造より拒否が欲しいなら、Claude 4.7/4.8 のほうが安定です。安くたくさん読んで短い JSON 表を書くなら、Gemini 3.7 Flash の Intro 価が3社で最も合います。「窓の数字が最大なら勝ち」ではありません。

1M 窓があれば RAG は不要ですか?

必要です。1M は安定し、境界があり、毎回原文を引用する材料向きです。コーパスが毎日変わり、繰り返しクエリが多く、または測った有効窓が 1M よりはるかに小さいときは、検索のほうが安く、更新しやすいです。長窓と RAG は補完であり、置換ではありません。

ChatGPT / Claude.ai でも満 1M が使えますか?

必ずしも使えません。API の gpt-5.5 は約 1.05M。Codex プロダクト面はよく 400K です。一部のクラウドマーケットの Claude はまだ 200K です。使っているそのプロダクトのモデルカードを信じてください。API ドキュメントをチャット製品の期待に写さないでください。

Gemini はすでに 2M や 10M ですか?

2026年9月時点で、gemini-3.7-flash と gemini-3.1-pro の公開ドキュメントは入力 1,048,576 token と書いています。2M / 10M は、より早い実験枠、集約頁、未 GA 変種に多いです。契約とクォータ表に書くときは、Google の現行モデルカードを使い、ブログの見出しを使わないでください。

JSON 全体を 1M 窓に入れても、Schema は必要ですか?

必要です。窓は可視範囲を広げるだけで、出力の形は縛りません。抽出、整列、Agent ツール引数は依然 JSON Schema が要り、着地後に構文と構造を検証します。モデルは GPT から Gemini に替えられます。フィールド名と required は動かしてはいけません。

まとめ

1M Token は 2026年フラッグシップ API の揃った広告です:GPT-5.5、Claude 4.6/4.8、Gemini 3.7 はいずれも約100万 token を限度表に書けます。役立つのは、1回の推論でリポジトリ、長文書、または切り詰めた JSON パックを同時に見るときです。無料記憶でも、「満杯にすれば理解する」でもありません。有効窓はしばしば 128K–500K にあります。満 1M は容量として扱い、理解力として扱わないでください。出力上限、推論が窓を食うか、200K のあと高くなるか——それが選定フィールドです。

宿題は次の「2M」噂を追うことではありません。窓に送る材料を Schema を通るパックに書くことです。JSONPath でパスを切り、Diff でバージョンを合わせ、検証してから API を打ってください。Structured Output と Tool Calling は本サイトですでに書いています。本稿はコンテキストウィンドウ側の読み方だけを足します。