01
Geheugen: van een half bestuursstuk naar een heel jaar aan stukken
In een zinHet contextvenster van het topmodel ging van 8.192 tokens in maart 2023 naar 1.050.000 in september 2026, maar het bruikbare deel is kleiner dan het geadverteerde deel.
In maart 2023 kwam GPT-4 met een contextvenster van 8.192 tokens, een cijfer dat OpenAI nog steeds op zijn modeldocumentatie publiceert. Neem een bestuursstuk van twintig pagina's als ongeveer 9.000 woorden, dat is ongeveer 12.000 tokens. Dat is de aanname die dit rapport overal hanteert, en die betekent dat GPT-4 niet eens een heel bestuursstuk tegelijk in beeld kon houden. Ongeveer twee derde ervan.
Wat dit betekent voor het bestuur
- Passen is niet langer de beperking. Een jaar aan notulen, het jaarverslag en de begroting passen in een gesprek met elk huidig topmodel, dus stop met het afbakenen van AI-werk op documentgrootte.
- Vraag naar het bruikbare getal, niet naar het geadverteerde. Gepubliceerd onderzoek laat zien dat de nauwkeurigheid ruim voor de opgegeven limiet daalt, dus behandel het venster als een plafond en eis bewijs bij de lengte die je echt gebruikt.
Contextvenster van het topmodel van OpenAI, maart 2023 tot september 2026
| Point | series |
|---|---|
| 2023 H1 | 8,19K |
| 2023 H2 | 128K |
| 2024 H1 | 128K |
| 2024 H2 | 128K |
| 2025 H1 | 1,05M |
| 2025 H2 | 400K |
| 2026 H1 | 1,05M |
| 2026 H2 | 1,05M |
Bestuursstukken: 1 = 12.000 tokens.
Hoe dit is geteld
Er is een lijn getekend, het topmodel van OpenAI, omdat dat de lijn is die de meeste besturen daadwerkelijk hebben gebruikt en elk punt op de eigen modelpagina's van OpenAI staat. Concurrerende topmodellen volgden dicht en worden in de tekst genoemd. De reeks bestuursstukken deelt het venster door 12.000 tokens, oftewel een stuk van twintig pagina's van ongeveer 9.000 woorden bij ruwweg 1,33 token per woord. Tokenaantallen verschillen per tokenizer, dus lees de aantallen stukken als orde van grootte, niet als meting.
Bewijs dat de andere kant op wijst
Van de modellen die een contextvenster van 32.000 tokens of meer claimen, hield slechts de helft bij 32.000 tokens een aanvaardbare prestatie vast.
RULER: What's the Real Context Size of Your Long-Context Language Models? (arXiv:2404.06654)
Op de NoLiMa-evaluatie, die letterlijke woordoverlap tussen vraag en antwoord weghaalt, zakte GPT-4o van 99,3 procent bij korte context naar 69,7 procent bij 32.000 tokens, en elf van de dertien geteste modellen zakten onder de helft van hun eigen kortecontextscore.
NoLiMa: Long-Context Evaluation Beyond Literal Matching (arXiv:2502.05167)
Het grootste breed beschikbare contextvenster is niet meer verschoven sinds 27 juni 2024, toen Google twee miljoen tokens op Gemini 1.5 Pro voor alle ontwikkelaars openstelde. Elk geverifieerd topmodel staat in september 2026 op een miljoen tot 1,05 miljoen.
Google, new features for the Gemini API and Google AI Studio. OpenAI model documentation. Anthropic model overview. Gemini API: Gemini 3.8 Flash