Vorab: Bis September 2026 werben GPT-5.5, Claude Opus 4.8 / Sonnet 4.6 und Gemini 3.7 Flash alle mit einem Fenster von etwa einer Million Token. „1M Token“ heißt nicht „eine Million chinesische Schriftzeichen“, und das Fenster vollzustopfen ist nicht dasselbe wie es zu nutzen. Die beworbenen Limits liegen nah beieinander. Effektives Retrieval, maximale Ausgabe und Preisstufen tun das nicht. Wer mit JSON arbeitet, sollte zuerst zuschneiden, validieren und dann entscheiden, wie viel rein soll — nicht den gesamten Dump einfügen.
Dieser Beitrag gilt zum 5. September 2026. Die Zahlen folgen öffentlichen Dokumenten: OpenAIs gpt-5.5-API mit etwa 1,050,000 Token gesamt und 128K Ausgabe; Anthropics Opus 4.8 / Sonnet 4.6 standardmäßig 1M und 128K Ausgabe ohne Aufpreis für langen Kontext; Googles gemini-3.7-flash mit 1,048,576 Input / 65,536 Output. Produktoberflächen (ChatGPT, Codex, claude.ai) sind oft schmaler. Behandeln Sie eine Marketingseite nicht als API-Limit.
Was 1M Token bedeutet
Ein Token ist der kleinste Textblock, den ein Modell zählt und abrechnet — kein Zeichen und kein Wort. Im Englischen gilt etwa 1 Token ≈ 0.75 Wörter bzw. rund 4 Zeichen. Im Chinesischen deckt ein Token oft 1–2 Schriftzeichen ab, je nach Tokenizer und Interpunktion. JSON ist teurer: Klammern, Anführungszeichen, wiederholte Keys und Einrückungen verbrauchen Budget.
1M Token = ein Kontextfenster von etwa einer Million Token. Grobe Umrechnung: ~750,000 englische Wörter oder ~500,000–800,000 chinesische Schriftzeichen, oder ein dickes Buch bis einige mittlere, oder ein mittelgroßes Repo plus Dokumentation. Es ist kein „Roman mit einer Million Zeichen“ und keine „Million Zeilen Code“. Dieselben 1M fassen in Prosa, Tabellen und minimiertem JSON sehr unterschiedliche Mengen an Signal.
Das Kontextfenster ist das gemeinsame Budget einer einzelnen Anfrage: System-Prompt + Verlauf + Tool-Definitionen + Tool-Ergebnisse + die Ausgabe dieser Runde. Modelle der GPT-5-Klasse zählen außerdem Reasoning-Token. Eine 900K-Token-Eingabe plus hoher Reasoning-Aufwand trifft context_length_exceeded, bevor das Modell „fertig gelesen“ hat. Das Budget ist weg.
| Begriff | Tatsächliche Bedeutung | Häufige Fehldeutung |
|---|---|---|
| 1M Token | Eine Obergrenze von ~1,000,000 Token für Input + Output (und Reasoning, bei manchen Modellen) | Das Modell kann eine Million Zeichen oder eine Million Zeilen lesen |
| Kontextfenster | Gemeinsames Budget für eine Anfrage | Konto-weites Gedächtnis oder automatisches Erinnern aller vergangenen Projekte |
| Maximale Ausgabe | Wie viele Token diese Runde erzeugen darf | Gleich dem Fenster (Geminis ~64K Ausgabe liegt weit unter 1M) |
| Effektiver Kontext | Länge, bei der Multi-Needle-Retrieval und Reasoning über lange Dokumente stabil bleiben | Gleich der Zahl auf der Preisseite |
2023 lag der Mainstream bei 4K–32K. 2024 machte Gemini 1.5 aus 1M eine Schlagzeile. Bis 2025 war 200K der Mittelklasse-Standard. Stand September 2026 haben Flaggschiff-APIs die Werbezahl auf 1M ausgerichtet. Der Wettlauf heißt nicht mehr „wer ist länger“, sondern wer nach 200K noch Nadeln findet und wessen Cache günstig genug für den Alltag ist.
Wozu ein langes Kontextfenster dient
Ein langes Fenster löst das Problem, viele Materialien in einer Inferenz gleichzeitig zu sehen. Es ersetzt keine Datenbank und ist kein kostenloses unendliches Gedächtnis. Die folgenden Aufgaben brauchen bei 128K meist Chunking oder RAG. Bei 1M können Sie „erst suchen, dann fragen“ manchmal in „erst laden, dann fragen“ verwandeln — wenn das Geladene zuvor gefiltert wurde.
- Gesamtes Repo / Mehrdatei-Coding: verwandte Module, Tests und Schnittstellendefinitionen in einer Runde halten, damit das Modell seltener eine Datei übersieht. Agent-Coding hängt weiter an Tool-Schleifen und Test-Feedback, nicht an der Fenster-Werbung — das haben wir in Gemini 3.8 Flash und KI-Coding behandelt.
- Prüfung langer Dokumente: Verträge, Filings, Spezifikationen, mehrere PDFs nebeneinander. Gut für „finden Sie den Konflikt zwischen §47 und Anhang B“. Schlecht für „fügen Sie ein Jahr E-Mail ein und bitten Sie um eine Zusammenfassung“.
- Lange multimodale Eingabe: Gemini zählt Video, Audio, Bilder und Text in demselben Fenster. Eine Stunde Video verbraucht Token schnell. 1M ist ein Kontingent, keine Einladung zum unkomprimierten Upload.
- Mehrstufige Agents: Tool-JSON, Error-Stacks und der letzte Patch können eine Weile im Thread bleiben. Ein größeres Fenster ist kein Grund, rohe Stacks erneut einzuspeisen — siehe den Agent-JSON-Datenfluss.
- Große JSON-Abgleiche: OpenAPI / JSON Schema, Beispiel-Payloads und Produktions-Error-Logs in einer Runde. Das ist der 1M-Einsatz, der die meisten Leser dieser Seite interessieren sollte — und der schnellste Weg, die Rechnung zu sprengen.
- Eine RAG-Schicht überspringen: Wenn der Korpus stabil und begrenzt ist und Sie jedes Mal wörtliche Zitate brauchen, kann Einfüllen einfacher sein als ein Vektorspeicher. Wenn der Korpus sich täglich ändert oder Anfragen sich wiederholen, bleibt Retrieval günstiger und aktueller.
Umgekehrt: Chat, Ein-Label-Klassifikation, kurze JSON-Extraktion. Ein 1M-Fenster ist Verschwendung. Latenz, Prefills und die Token-Abrechnung bestrafen Sie. Kurze Jobs bekommen ein kurzes Modell oder ein kurzes Budget.
GPT vs. Claude vs. Gemini
Die Tabelle unten ist das, was Sie am 5. September 2026 in ein Dokument schreiben können. Preise sind offizielle Listenpreise pro Million Token; Limits der Produktoberfläche gelten extra. Gemini 3.8 Flash ist zum Zeitpunkt dieses Artikels noch nicht GA — lassen Sie die Produktion auf 3.7.
| Anbieter / Modell | Beworbenes Fenster | Max. Ausgabe | Input / Output pro 1M | Was am Fenster zu beachten ist |
|---|---|---|---|---|
| OpenAI GPT-5.5 API | ~1,050,000 | 128,000 | $5 / $30 | Reasoning zählt gegen das Gesamtfenster; Codex-Produktoberfläche ist 400K |
| OpenAI GPT-5.5 Pro | ~1,050,000 | 128,000 | $30 / $180 | Dasselbe Fenster; Sie zahlen für Ausgabe und Reasoning |
| OpenAI GPT-5.4 | ~1M | 128,000 | $2.50 / $15 | Dieselbe 1M-Klasse, niedrigerer Stückpreis |
| Anthropic Claude Opus 4.8 | 1M (Standard, kein Beta-Header) | 128,000 | $5 / $25 | Kein Aufpreis für langen Kontext; Prompt Cache ~90% Rabatt |
| Anthropic Claude Sonnet 4.6 | 1M | 128,000 | $3 / $15 | Context Awareness (kennt das Restbudget) |
| Anthropic Claude Haiku 4.5 | 200K | 64,000 | $1 / $5 | Schnell und günstig — keine 1M-Klasse |
| Google Gemini 3.7 Flash | 1,048,576 | 65,536 | Intro $0.75 / $3.75 bis 2026-12-31 | Standard $1.50 / $7.50 ab 2027-01-01 |
| Google Gemini 3.1 Pro | 1,048,576 | 65,536 | Etwa $2 / $4 (oft ein Aufpreis über 200K) | 2M-/10M-Angaben Dritter nicht in einen Vertrag schreiben |
So lesen Sie die Tabelle: Alle drei Flaggschiffe können etwa 1M aufnehmen. Die Unterschiede liegen im Ausgabe-Spielraum, ob Reasoning das Fenster frisst, ob Token über 200K teurer sind und ob sich der Cache lohnt.
- Sie brauchen ein langes strukturiertes Ergebnis in einem Schuss (großes JSON, langer Patch, Mehrdatei-Diff): GPT-5.5 und Claude 4.6/4.8 mit 128K Ausgabe sind etwa 2× so breit wie Geminis ~64K. Gemini eignet sich besser für „viel lesen, eine Tabelle schreiben“.
- Derselbe System-Prompt + Tool-Schema bei jedem Aufruf: Claudes Prompt Cache, Geminis Context Caching und OpenAIs Cached Input schlagen jedes Mal den vollen Input-Preis. Das Agent-
tools-JSON gehört in den Cache — siehe Tool Calling und JSON Schema. - Knappes Budget, viel Material, kurze Ausgabe: Der Intro-Preis von Gemini 3.7 Flash ist weiter die günstigste 1M-Stufe der drei. Über 200K messen Sie Multi-Needle auf Ihren eigenen Daten; vertrauen Sie nicht allein der Fensterzahl.
- Produkt ≠ API: GPT-5.5 auf ChatGPT / Codex kann 400K sein; manche Cloud-Marktplätze liefern Claude weiter mit 200K. Öffnen Sie die Modellkarte der Oberfläche, auf der Sie ausliefern, bevor Sie ein SLA schreiben.
Beworbenes Fenster vs. nutzbares Fenster
Der Konsens 2026 ist kaum noch zu übersehen: 1M zu bewerben und 1M zu nutzen sind zwei verschiedene Jobs. Bei Multi-Needle-Retrieval (MRCR-v2-Stil: mehrere verstreute Fakten in einem riesigen Text finden) fällt die Genauigkeit meist nach 128K, spaltet sich zwischen 200K und 512K, und nahe 1M verhalten sich nur noch wenige Modelle so, als hätten sie die ganze Datei gelesen.
Öffentliche Evals und Drittzusammenstellungen (Setups sind nicht identisch — lesen Sie sie als Trend, nicht als Abnahmetest) sehen ungefähr so aus:
- GPT-5.5: gegenüber früheren GPT-5.x ein Sprung beim Multi-Needle-Reasoning im Band 512K–1M und eine der APIs, die am häufigsten genannt wird, wenn Leute das Fenster wirklich füllen. Single-Needle „finde diesen Satz“ klappt bei allen dreien innerhalb von 128K.
- Claude Opus 4.6: Multi-Needle bei 1M wurde mit rund 76% berichtet, bei flacherer Kurve. 4.7 / 4.8 setzen stärker auf Kalibrierung — ablehnen oder Unsicherheit markieren statt einen Fundort zu erfinden. Compliance-Prüfungen langer Dokumente wollen meist Letzteres.
- Gemini 3.x: innerhalb von 128K weiter stark bei Retrieval und Verständnis langer Dokumente; Multi-Needle fällt nach 200K steiler ab. Gut für „einen dicken Stapel lesen, kurzes JSON ausgeben“. Schlecht für „die 8. Nadel in 900K Token Logs garantieren“.
In der Produktion arbeiten Sie mit Bändern — nicht mit der Preisliste:
| Band | So behandeln | Tun Sie das |
|---|---|---|
| ≤128K | Fast vollständig nutzbar | Standard-Arbeitsbereich bei allen dreien |
| 128K–256K | An Stichproben messen | Multi-Needle auf Ihrem JSON / Repo fahren; Arena-Scores ignorieren |
| 256K–500K | Nutzbar; nicht annehmen, dass jede Tatsache gefunden wird | Schlüsselfelder mit JSONPath vorab extrahieren; wiederholte Präfixe cachen |
| 500K–1M | Passt hinein; „passt“ ≠ „verstanden“ | Nur stabiles, hochwertiges Material; Antworten mit Schema festziehen |
„Lost in the middle“ ist nicht verschwunden, nur weil Fenster 1M erreicht haben. Harte Constraints an den Anfang des System-Prompts und ans Ende der User-Nachricht; Anhänge in die Mitte. Modelle merken sich „gib JSON aus, das zum Schema passt“ öfter als ein Enum, das bei Token 400,000 begraben liegt.
JSON: Einfüllen ist keine Validierung
Ein 1M-Fenster ist das erste Mal, dass „die ganze OpenAPI, drei Tage Error-Logs und ein Entwurfsschema“ in eine Anfrage passen. Es macht illegales JSON nicht legal und zieht ein lockeres Schema nicht fest. Das Fenster ist Sichtbarkeit; der Vertrag ist die Form. Dieselbe Regel haben wir in Vom Prompt zu Structured Output und OpenAI vs. Gemini Structured Output verwendet: illegale Token zur Decode-Zeit mit Schema blockieren, nach dem Aufruf erneut validieren.
Ein 800K-Token-Produktionsdump vollzustopfen scheitert meist nicht an „das Fenster war zu klein“: wiederholte Keys verschwenden Budget, mittlere Felder fallen weg, Array-Längen werden falsch gezählt, die Ausgabe bricht an der 64K-/128K-Grenze ab, und Sie zahlen den vollen Input. Die Reihenfolge ist zuschneiden → validieren → dann füttern.
{
"name": "longContextPack",
"description": "Paket für ein 1M-Fenster: nur validiertes, zugeschnittenes JSON",
"parameters": {
"type": "object",
"additionalProperties": false,
"properties": {
"task": { "type": "string", "enum": ["align_fields", "diff_versions", "extract_errors"] },
"schemaId": { "type": "string", "description": "Stabile Schema-ID — kein riesiges Schema inline einfügen" },
"focusPaths": {
"type": "array",
"minItems": 1,
"maxItems": 32,
"items": { "type": "string", "description": "JSONPath, z. B. $.paths./v2/orders.post" }
},
"payload": { "type": "object", "description": "Bereits syntaxgeprüft und zugeschnitten — kein roher Log-String" },
"tokenBudget": { "type": "integer", "minimum": 1000, "maximum": 1000000 }
},
"required": ["task", "schemaId", "focusPaths", "payload", "tokenBudget"]
}
}
Werfen Sie dieses Paket in die JSON-Toolbox für eine lokale Syntaxprüfung, ziehen Sie focusPaths mit JSONPath und vergleichen Sie zwei Payload-Versionen per Diff. Das Modell sollte ein zugeschnittenes Objekt sehen, nicht eine 20MB-.json-Datei. GPT / Claude / Gemini tauschen Sie über den Modell-String. Die Feldnamen des Pakets sollten sich nicht ändern.
Was Sie jetzt tun sollten
- Zählen Sie Token, bevor Sie vollstopfen: System, Tools, Verlauf und Anhänge getrennt schätzen. Bei GPT-5.5 Reasoning-Reserve einplanen; bei Gemini Video- / PDF-Seiten zählen. Über Budget: schneiden — nicht auf „es sollte noch passen“ wetten.
- Wiederholte Präfixe cachen: System + Tools sind fast jeder Aufruf gleich, also gehören sie in Prompt Cache / Context Caching. Die erste 1M-Fenster-Rechnung ist eine Input-Rechnung; nach Cache-Hits wird das lange Fenster alltagstauglich.
- Ausgabe mit Structured Output begrenzen, nicht mit „bitte JSON zurückgeben“: OpenAIs
response_format.json_schema, GeminisresponseMimeType+responseJsonSchema, Claude-Tools oder Prefills. Ein längeres Fenster erfindet trotzdem ein Feld und lässt ein required weg, wenn der Prompt locker ist. - Jenseits des gemessenen Bands: Retrieval, nicht reinpressen: Wenn Ihr eigenes Multi-Needle bei 256K gescheitert ist, behandeln Sie 700K Logs nicht als Volltextverständnis. JSONPath auf Fehlercodes und Zeitstempel ist günstiger, als das Modell schwimmen zu lassen.
- Antworten an der Ausgabegrenze teilen: ~64K bei Gemini, ~128K bei GPT/Claude. Ein 200K-JSON-Report sind Shards plus ein Schema pro Shard, nicht eine heroische Completion.
- Lokale Fixtures, bevor Sie die API treffen: dieselbe Payload durch JSON-Validierung und Diff im Browser. Nichts wird hochgeladen. Dieselbe Gewohnheit wie ein REST-Vertrag vor dem Launch.
Häufige Fragen
Wie viele Wörter sind 1M Token?
Es gibt keine feste Umrechnung. Englisch sind etwa 750,000 Wörter; Chinesisch etwa 500,000–800,000 Schriftzeichen, je nach Interpunktion und gemischtem Latein. JSON, Code und Tabellen verbrauchen Token schneller. Planen Sie Kapazität nicht als „eine Million Wörter“. Zählen Sie echte Samples mit dem Tokenizer des Anbieters.
Wessen 1M-Fenster ist am besten — GPT, Claude oder Gemini?
Es hängt vom Job ab. Beim Multi-Needle-Reasoning über das volle Fenster setzen öffentliche Evals oft GPT-5.5 an die Spitze. Wenn Sie lieber eine Ablehnung als eine erfundene Quelle wollen, sind Claude 4.7/4.8 ruhiger. Wenn Sie viel lesen und eine kurze JSON-Tabelle zum Budget ausgeben müssen, ist der Intro-Preis von Gemini 3.7 Flash der günstigste der drei. Die größte Werbezahl gewinnt nicht.
Brauche ich bei einem 1M-Fenster noch RAG?
Ja. 1M eignet sich für stabiles, begrenztes Material, das Sie wörtlich zitieren müssen. Wenn der Korpus sich täglich ändert, Anfragen sich wiederholen oder Ihr gemessenes effektives Fenster weit unter 1M liegt, bleibt Retrieval günstiger und leichter zu aktualisieren. Langer Kontext und RAG ergänzen einander; sie ersetzen einander nicht.
Kann ich auf ChatGPT oder Claude.ai die vollen 1M nutzen?
Nicht unbedingt. Die gpt-5.5-API liegt bei etwa 1.05M; die Codex-Produktoberfläche oft bei 400K. Manche Cloud-Marktplätze liefern Claude weiter mit 200K. Vertrauen Sie der Modellkarte des Produkts, das Sie tatsächlich nutzen — nicht der API-Spalte, die in eine Chat-App-Erwartung kopiert wurde.
Ist Gemini bereits bei 2M oder 10M?
Stand September 2026 listen die öffentlichen Dokumente für gemini-3.7-flash und gemini-3.1-pro 1,048,576 Input-Token. 2M / 10M stammen meist von früheren Experimentierstufen, Aggregator-Seiten oder noch nicht GA-Varianten. Für Verträge und Kontingenttabellen gilt Googles aktuelle Modellkarte, nicht eine Blog-Überschrift.
Wenn ich eine ganze JSON-Datei in ein 1M-Fenster stopfe, brauche ich trotzdem ein Schema?
Ja. Das Fenster verbreitert nur die Sichtbarkeit; es begrenzt nicht die Ausgabeform. Extraktion, Abgleich und Agent-Tool-Argumente brauchen weiter JSON Schema, danach eine Syntax- und Strukturprüfung nach dem Aufruf. Sie können GPT gegen Gemini tauschen. Feldnamen und Required-Listen sollten sich nicht bewegen.
Fazit
1M Token ist die Flaggschiff-API-Werbung 2026, die GPT-5.5, Claude 4.6/4.8 und Gemini 3.7 alle auf eine Limits-Seite drucken können. Nützlich ist sie, wenn eine Inferenz ein Repo, ein langes Dokument oder ein zugeschnittenes JSON-Paket gleichzeitig sehen muss. Es ist kein kostenloses Gedächtnis, und vollstopfen ist kein Verstehen. Nutzbare Fenster liegen oft zwischen 128K und 500K; behandeln Sie volle 1M als Kapazität, nicht als Verständnis. Ausgabegrenzen, ob Reasoning das Fenster frisst, und ob Token über 200K teurer sind, sind die echten Auswahlfelder.
Die Aufgabe ist nicht, dem nächsten „2M“-Gerücht hinterherzulaufen. Sondern das, was Sie senden, so zu packen, dass es eine Schema-Prüfung übersteht: JSONPath zum Zuschneiden der Pfade, Diff zum Vergleichen der Versionen, validieren, dann die API aufrufen. Diese Seite hat Structured Output und Tool Calling bereits behandelt; dieser Artikel ergänzt nur die Lesart des Kontextfensters.