Naar inhoud
AI Board

AI voor management · bijgewerkt 8 september 2026

Welke AI kan een managementteam vertrouwen?

  • Onderdeel van het AI Board onderzoeksprogramma

Geheugen: het geadverteerde venster

Het grootste gepubliceerde contextvenster ging van 4,1K naar 10M tokens, dus documentlengte is zelden nog de grens.

Het grootste door leveranciers vermelde contextvenster steeg van 4,1K tokens in november 2022 naar 10M tokens in april 2025, getekend op een logaritmische schaal.
Pointseries
20224,1K
20238,19K
100K
128K
200K
20242M
202510M
Lopend maximum van het door de leverancier vermelde contextvenster, november 2022 tot april 2025. De laatste stap is de eigen claim van Meta voor Llama 4 Scout, een geadverteerd venster en geen gemeten geheugen. Logaritmische schaal. Bron: leveranciersdocumentatie en lanceringsposts, geraadpleegd 8 september 2026.

Lees de analyse

Praktisch geheugen tegenover geadverteerd

Het geadverteerde venster is geen werkgeheugen: het sterkste model in de NoLiMa-studie verloor bij 32.000 tokens 29,6 procentpunt nauwkeurigheid.

  • Korte tekst99,3%
  • Bij 32.000 tokens69,7%
In de NoLiMa-studie scoorde GPT-4o 99,3% op korte tekst en 69,7% zodra de context 32.000 tokens bereikte.
LabelValue
Korte tekst99,3%
Bij 32.000 tokens69,7%
NoLiMa (Modarressi e.a., ICML 2025), GPT-4o. Bij 32.000 tokens zakten 11 van de 13 geteste modellen, die allemaal minstens 128.000 tokens adverteren, onder de helft van hun eigen score op korte tekst.

Lees de analyse

Zelfverzekerde fouten per generatie

Tussen GPT-4o en GPT-5 in redeneermodus daalde het aandeel antwoorden met een grote feitelijke fout met een factor 4,3.

  • GPT-4o (May 2024)20,6%
  • o3 (Apr 2025)22,0%
  • GPT-5 main (Aug 2025)11,6%
  • GPT-5 thinking (Aug 2025)4,8%
Aandeel antwoorden met minstens een grote feitelijke fout over 4 modelgeneraties, van 22,0% in het slechtste geval tot 4,8% in het beste. Lager is beter.
LabelValue
GPT-4o (May 2024)20,6%
o3 (Apr 2025)22,0%
GPT-5 main (Aug 2025)11,6%
GPT-5 thinking (Aug 2025)4,8%
GPT-5 systeemkaart van OpenAI, 13 augustus 2025, productie-representatieve prompts met browsen aan. Cijfers van de leverancier op een eigen evaluatie, dus lees ze als richting. Tegenvoorbeeld uit hetzelfde lab: op PersonQA hallucineerde o3 twee keer zo vaak als het oudere o1.

Lees de analyse

EU-residentie bij de topmodellen

8 van de 13 actuele topmodellen hebben een gedocumenteerde route om met dataresidentie binnen de EU te draaien.

8van de topmodellen
  • Gedocumenteerde EU-route8
  • Geen gedocumenteerde EU-route5
8 van de 13 actuele topmodellen hebben een gedocumenteerde EU-route en 5 hebben er geen.
SegmentValueShare
Gedocumenteerde EU-route862%
Geen gedocumenteerde EU-route538%
Een route is een EU-cloudregio, een Europese aanbieder, of zelf hosten op gepubliceerde gewichten. De tier onder het topsegment is beter gedekt: van 39 actuele modellen hebben er 28 een gedocumenteerde route. Bron: documentatie van leveranciers en cloudaanbieders, geraadpleegd 8 september 2026.

Lees de analyse

Kosten per bestuurder per werkweek

Tegen openbare lijstprijzen kost een week intensief gebruik door een bestuurder tussen US$ 0,89 en US$ 11,88, nog voor elke korting.

  • GPT-6 AstraUS$ 11,88
  • Claude Fable 5.1US$ 10,62
  • Claude Opus 5US$ 5,94
  • Qwen3.8-MaxUS$ 5,16
  • Mistral Medium 3.5US$ 4,05
  • Grok 4.6US$ 2,64
  • GPT-5.6 TerraUS$ 2,50
  • Claude Sonnet 5US$ 2,38
  • DeepSeek-V4-ProUS$ 1,26
  • Gemini 3.8 FlashUS$ 0,89
Geschatte interfacekosten van een werkweek van een bestuurder over 10 modellen, van US$ 11,88 voor het duurste tot US$ 0,89 voor het goedkoopste.
LabelValue
GPT-6 AstraUS$ 11,88
Claude Fable 5.1US$ 10,62
Claude Opus 5US$ 5,94
Qwen3.8-MaxUS$ 5,16
Mistral Medium 3.5US$ 4,05
Grok 4.6US$ 2,64
GPT-5.6 TerraUS$ 2,50
Claude Sonnet 5US$ 2,38
DeepSeek-V4-ProUS$ 1,26
Gemini 3.8 FlashUS$ 0,89
Schatting op openbare lijstprijzen in Amerikaanse dollars: 40 vragen per week, 60.000 invoertokens per vraag, 1.500 uitvoertokens per antwoord, invoer uit cache waar het lab een cacheprijs publiceert. Een schatting, geen offerte. Bron: prijspagina's van leveranciers, geraadpleegd 8 september 2026.

Lees de analyse

Wat benchmarks niet beantwoorden

Vijf vragen die een managementteam echt stelt, en geen publieke benchmark beantwoordt er een op je eigen bestuursmap.

  • Geheugen4
  • Feitelijkheid3
  • Eerlijkheid2
  • Bronvermelding2
  • Discipline3
Aantal publieke benchmarks dat per bestuursvraag het dichtst in de buurt komt: Geheugen 4, Feitelijkheid 3, Eerlijkheid 2, Bronvermelding 2, Discipline 3. Geen ervan gebruikt een echte bestuursmap.
LabelValue
Geheugen4
Feitelijkheid3
Eerlijkheid2
Bronvermelding2
Discipline3
Aantal publieke benchmarks dat per vraag het dichtst in de buurt komt, uit onze benchmarkanalyse van 8 september 2026. Ze meten allemaal op publiek materiaal of op één document tegelijk, en precies dat gat moet de Model Index dichten.

Lees de analyse

02Het landschap nu

De actuele topmodellen naast elkaar

Elk actueel topmodel uit de dataset, met de feiten waarop een managementteam beslist: hoeveel het kan lezen, of het binnen de EU kan draaien, en wat het kost per miljoen tokens.

13 actuele topmodellen. Geheugen is het door de leverancier vermelde contextvenster, geen gemeten werkgeheugen. Prijzen zijn API-lijstprijzen per miljoen tokens in Amerikaanse dollars. Bron: leveranciersdocumentatie, geraadpleegd 8 september 2026.
LabModelGeheugenEU-residentieIn / MUit / M
OpenAIGPT-6 Astra1,05M tokensNeeUS$ 10,00US$ 50,00
AnthropicClaude Fable 5.11M tokensJaEU-multiregioUS$ 10,00US$ 50,00
AnthropicClaude Mythos 5.11M tokensNeeUS$ 10,00US$ 50,00
Google (DeepMind)Gemini 3.8 Flash1,05M tokensJaEU-multiregioUS$ 0,75US$ 3,75
xAIGrok 4.6500K tokensNeeUS$ 2,00US$ 6,00
MetaMuse Spark 1.31M tokensNeeUS$ 1,25US$ 4,25
DeepSeekDeepSeek-V4-Pro1M tokensJazelf gehostUS$ 1,32US$ 3,96
Mistral AIMistral Medium 3.5256K tokensJaEU-regioUS$ 1,50US$ 7,50
Alibaba (Qwen)Qwen3.8-Max1M tokensJaEU-regioUS$ 2,00US$ 6,00
Z.aiGLM-5.31M tokensNeeUS$ 1,40US$ 4,40
Moonshot AIKimi K31,05M tokensJazelf gehostUS$ 3,00US$ 15,00
CohereCommand A+128K tokensJazelf gehostniet gepubliceerdniet gepubliceerd
NVIDIANemotron 3 Ultra1M tokensJazelf gehostniet gepubliceerdniet gepubliceerd

Bekijk het volledige landschap, inclusief de tier eronder en de modellen die worden uitgefaseerd

03Het onderzoek achter de cijfers

Drie pagina's, een vraag

Niemand leest een onderzoeksrapport van a tot z. De grafieken hierboven zijn de samenvatting; op deze pagina's wordt elk cijfer onderbouwd, gedateerd en van een bron voorzien.

Gepland november 2026 / nog geen resultaten

AI Board Model Index, eerste editie

De ranglijst komt op deze pagina te staan. Er zijn nog geen resultaten en nergens op deze site staan scores, want er is nog niets gemeten. Zodra de eerste editie verschijnt, opent de ranglijst hier en wordt de methodepagina de bijlage daarbij.

04Voor jouw rol

Wat dit betekent op jouw stoel

Hetzelfde landschap ziet er vanuit drie stoelen anders uit. Elke rol heeft een hoofdstuk in de gids en een pagina over wat een AI-assistent in dat werk doet.

CEO

Samenhang uit een rommelige stapel documenten, en een antwoord dat je in een vergadering kunt herhalen zonder het eerst na te lopen.

Wat een CEO moet kiezen

AI CEO

CFO

Bronvermelding. Een getal zonder document en paginanummer is een mening, hoe stellig het ook klinkt.

Wat een CFO moet kiezen

AI CFO

CTO

Residentie, licenties en de uitweg. De generatie die je in Europa kunt hosten is niet altijd de nieuwste.

Wat een CTO moet kiezen

AI CTO

05Methode

Hoe we werken

Deze pagina volgt dezelfde discipline als de rest van de site: we publiceren niets wat je niet kunt controleren.

Alleen primaire bronnen
Elk feit over een model komt uit leveranciersdocumentatie, een officiële lanceringspost, een systeemkaart, een peer-reviewed paper of de eigen regiolijst van een cloudaanbieder. Nooit uit een samenvatting van een samenvatting.
Feiten met een peildatum
Modelspecificaties veranderen wekelijks. Elke grafiek vermeldt op welke dag de cijfers zijn geverifieerd, zodat je ziet hoe oud een bewering is voordat je erop handelt.
Wat we niet kunnen verifiëren, laten we weg
Heeft een cijfer geen primaire bron, dan staat het niet op de pagina, ook niet als schatting of als marge. Een kortere pagina is de prijs van een controleerbare pagina.
Geen leveranciersgeld
Geen enkele modelleverancier betaalt voor een plek in dit onderzoek, en geen van hen ziet een pagina voordat die gepubliceerd is.
Correcties
Zie je iets wat niet klopt of verouderd is? Laat het weten, dan corrigeren we de pagina en dateren we de wijziging. De contactgegevens staan op de pagina over ons.

Word AI-native vóór je concurrentie

Surf mee op de AI-golf in plaats van erachteraan te zwemmen. Vraag toegang aan, dan plannen we je installatie in.

Je bedrijfsbrein staat op je eigen laptop. Jij kiest of een vraag naar een cloudmodel gaat of volledig lokaal blijft.