AI Board Model Index · eerste editie november 2026
Welke AI-modellen kun je je bestuursstukken toevertrouwen?
Wij meten het. Elk jaar. Elk actueel model leest dezelfde 800 pagina's realistische bedrijfsdocumenten, beantwoordt dezelfde 120 vragen en wordt gescoord op vijf dingen die een bestuurder zonder woordenlijst kan controleren. De eerste editie verschijnt in november 2026, dus alles op deze pagina is methode, volledig en vooraf.
Gepubliceerd
/12 min leestijd
/Onderdeel van het AI Board onderzoeksprogramma
Voorbeeld van het format, illustratieve waarden, geen meting
Model A
8,08,08,0/ 10 Boardroom-ready
Feitelijkheid30% van het totaal8,0 / 10
Bronvermelding25% van het totaal8,5 / 10
Eerlijkheid20% van het totaal7,5 / 10
Discipline15% van het totaal7,5 / 10
Geheugen10% van het totaal8,5 / 10
Voorbeeld van het format, illustratieve waarden, geen meting
Metric
Score (0-10)
Feitelijkheid
8,0
Bronvermelding
8,5
Eerlijkheid
7,5
Discipline
7,5
Geheugen
8,5
Boardroom-ready· Inzetbaar voor bestuursmateriaal, met steekproeven op de cijfers die het pand verlaten.
8,0 en hoger Boardroom-ready
6,0 tot 7,9 Bruikbaar met toezicht
Onder 6,0 Niet aanbevolen
Drie voorbeeldkaarten, één per label. Ze wisselen vanzelf; kies er een om hem vast te houden.
01Wat dit is
Een due-diligencerapport, geen ranglijst
Elk AI-ranglijst meet hoe slim een model is. Geen enkel ranglijst vertelt een bestuurder of het een getal in de bestuursmemo gaat verzinnen.
Dezelfde leesstof voor elk model, in dezelfde volgorde.
120120120
vragen per meetronde
Feitelijke vragen, synthesevragen, strikvragen en disciplineprobes.
808080
daarvan gepubliceerd
De rest blijft dicht, zodat er niet op de testset wordt getraind.
Ranglijsten scoren examenvragen, het repareren van code, puzzels en het soort test dat onderzoekers voor onderzoekers bouwen. Die tests zijn nuttig en ze beantwoorden een andere vraag. De enige vraag die een bestuur echt heeft, is smaller en ongemakkelijker: als ik dit ding de bestuursmap geef, staat er dan in de memo voor de auditcommissie een cijfer dat niet bestaat?
Dat gat is geen marketingtoeval. Volgens Kalai, Nachum, Vempala en Zhang van OpenAI (Why Language Models Hallucinate, 2025) bluffen modellen omdat de manier waarop we ze trainen en beoordelen een zelfverzekerde gok beloont en niets geeft voor het toegeven van onzekerheid. In hun analyse van tien veelgebruikte evaluaties rekenen er negen een antwoord strikt goed of fout, en geven er negen geen enkel punt voor de mededeling dat het antwoord onbekend is. Het gedrag waarover we klagen, is het gedrag waarvoor we punten geven.
Het specificatieblad heeft hetzelfde probleem: een contextvenster wordt gepubliceerd als maximum, niet als werkbereik. Sectie 02 bevat het gepubliceerde bewijs voor allebei, met de cijfers en hun bronnen.
Daarom stelt de AI Board Model Index één vraag en scoort die op vijf manieren: kun je dit model de documenten van je directie toevertrouwen? Elk model met een actuele publieke API leest dezelfde set van circa 800 pagina's realistische bedrijfsdocumenten, beantwoordt dezelfde 120 vragen en krijgt vijf cijfers van tien, één balk elk, voor feitelijkheid, bronvermelding, eerlijkheid, discipline en geheugen. Feitelijkheid is 30 procent van het totaal, bronvermelding 25, eerlijkheid 20, discipline 15 en geheugen 10, in de volgorde waarin die vijf fouten een bestuur pijn doen. Het totaal draagt een van drie labels: boardroom-ready, bruikbaar met toezicht, of niet aanbevolen.
Geen van de vijf is een omweg voor iets anders, en de volgende sectie haalt elke maatstaf uit elkaar. Wij zijn geen benchmark voor engineers. Wij zijn een due-diligencerapport voor de mensen die tekenen: voor een bestuurder die niet programmeert, die van een enthousiasteling een vergelijkingstabel van een leverancier kreeg, en die dit kwartaal moet besluiten of één assistent alles mag lezen wat het bedrijf schrijft.
Er staan geen resultaten op deze pagina. Geen enkel model heeft een score, de voorbeeldkaart hierboven is een lay-out met verzonnen getallen, en niets hiervan mag worden geciteerd als meting. De eerste editie staat gepland voor november 2026: de documentenset gaat in september op slot, de scoring loopt in oktober, en elke leverancier ziet zijn eigen scores twee weken voor publicatie. Reacties publiceren we, en scores wijzigen alleen bij een aangetoonde meetfout.
Dat we de methode vóór de resultaten publiceren, is precies de bedoeling. Wegingen, schalen, documentset en vragenmix liggen vooraf vast, zodat niemand de meetlat kan kiezen nadat hij de getallen heeft gezien. AI Board heeft geen eigen model; de modellen waarop ons product draait, doen dezelfde test en staan met naam op de editiepagina. Er is geen betaalde plaatsing en er zijn geen affiliate-links. We bouwden deze testset eerst voor onszelf, omdat we moesten weten op welk model we ons eigen product laten draaien.
Twee bijbehorende pagina's bevatten het materiaal dat er al wel is. AI-modellen voor bestuurders 2026 is de kaart: welke modellen actueel zijn en waar elk model gehost kan worden. Welk AI-model voor welke bestuursrol is de kortere route naar een besluit, met de vragen van de CEO, de CFO en de CTO uit elkaar getrokken.
02De vijf maatstaven
De vijf maatstaven, en het bewijs achter elk ervan
Geheugen, feitelijkheid, eerlijkheid, bronvermelding en discipline. Elk staat op de scorekaart omdat gepubliceerd onderzoek modellen er al op ziet falen, op het soort materiaal dat een bestuur echt leest.
Een score is pas bruikbaar als je hardop kunt zeggen wat hij meet. Elke maatstaf is een vraag die een bestuurder in een vergadering kan stellen, beantwoord in een eenheid die het navertellen aan de auditcommissie overleeft.
Wat een geadverteerd venster impliceert
NoLiMa, gemeten (GPT-4o)
Op de NoLiMa-test scoorde GPT-4o 99,3 procent bij korte tekst en 69,7 procent zodra de context 32.000 tokens bereikte, terwijl een geadverteerd venster impliceert dat de score niet met de lengte meebeweegt.
Point
Wat een geadverteerd venster impliceert
NoLiMa, gemeten (GPT-4o)
Korte tekst
99%
99%
32.000 tokens
99%
70%
NoLiMa (Modarressi e.a., ICML 2025), score in procenten. Beide gemeten punten staan in het onderzoek. De vlakke lijn is geen meting: die laat zien wat een geadverteerd venster impliceert.
OpenAI o1, PersonQA 202516%16%16%
OpenAI o3, PersonQA 202533%33%33%
OpenAI o4-mini, PersonQA 202548%48%48%
OpenAI o1, SimpleQA 202544%44%44%
OpenAI o3, SimpleQA 202551%51%51%
OpenAI o4-mini, SimpleQA 202579%79%79%
Hallucinatiecijfers uit de eigen systeemkaart van OpenAI: op PersonQA 16 procent voor o1, 33 procent voor o3 en 48 procent voor o4-mini; op SimpleQA 44 procent voor o1, 51 procent voor o3 en 79 procent voor o4-mini.
Label
Value
OpenAI o1, PersonQA 2025
16%
OpenAI o3, PersonQA 2025
33%
OpenAI o4-mini, PersonQA 2025
48%
OpenAI o1, SimpleQA 2025
44%
OpenAI o3, SimpleQA 2025
51%
OpenAI o4-mini, SimpleQA 2025
79%
Systeemkaart van OpenAI voor o3 en o4-mini, 16 april 2025, tabel 4. Het cijfer is net zo goed een eigenschap van de test als van het model.
GPT-4o
60,8%60,8%60,8%foute antwoorden
Goed38,2%
Fout60,8%
Antwoord geweigerd1,0%
Op SimpleQA beantwoordde GPT-4o 38,2 procent van de vragen goed, 60,8 procent fout, en weigerde het 1,0 procent.
Segment
Value
Share
Goed
38
38%
Fout
61
61%
Antwoord geweigerd
1
1%
Claude 3.5 Sonnet
36,1%36,1%36,1%foute antwoorden
Goed28,9%
Fout36,1%
Antwoord geweigerd35,0%
Op dezelfde SimpleQA-test beantwoordde Claude 3.5 Sonnet 28,9 procent goed, 36,1 procent fout, en weigerde het 35,0 procent.
Segment
Value
Share
Goed
29
29%
Fout
36
36%
Antwoord geweigerd
35
35%
SimpleQA (Wei e.a., OpenAI, 2024), tabel 3, 4.326 vragen. Het tweede model zit veel minder vaak fout, omdat het vragen laat lopen.
De eindtoestand die deze maatstaf scoort: een zin die het document en de pagina meedraagt waar hij vandaan komt.
51,5%
zinnen volledig gedekt door hun eigen bronvermelding
Liu, Zhang en Liang, Evaluating Verifiability in Generative Search Engines (Findings of EMNLP 2023).
Op Multi-IF volgde het sterkste geteste model instructies bij de eerste beurt in 87,7 procent van de gevallen correct op en bij de derde beurt in 70,7 procent.
Point
Multi-IF, instructies opvolgen
Beurt 1
88%
Beurt 3
71%
Multi-IF (Meta, 2024), nauwkeurigheid in procenten, sterkste geteste model. Onze data legt beurt één en beurt drie vast, de twee gepubliceerde cijfers, dus het lijnstuk ertussen verbindt twee metingen en is zelf geen gemeten curve.
Scroll langs de vijf
01
Geheugen
Hoeveel kan het tegelijk in zijn hoofd houden?
Hoe het wordt uitgedrukt
In bestuursstukken van twintig pagina's, niet in tokens. Tweeëndertig bestuursstukken vertelt een voorzitter of de kwartaalmap in één gesprek past.
Hoe we het meten
De set wordt in vijf stappen van acht documenten geladen, met na elke stap dezelfde vraag over het eerste document. De stap waarop dat antwoord fout gaat, is het werkgeheugen.
Het bewijs
NoLiMa (Modarressi e.a., ICML 2025) testte dertien modellen die allemaal minstens 128.000 tokens adverteren. Bij 32.000 tokens zakten er elf onder de helft van hun eigen score bij korte tekst, en GPT-4o viel terug van 99,3 procent naar 69,7. RULER (Hsieh e.a., COLM 2024) zag dat van zeventien van zulke modellen nog maar de helft acceptabel presteerde op die lengte.
Het onderzoek van Chroma naar context rot (2025) zag alle achttien geteste modellen minder betrouwbaar worden naarmate de invoer groeide, en elke modelfamilie beantwoordde dezelfde vraag beter vanuit een prompt van ongeveer 300 tokens dan vanuit het volledige gesprek van ongeveer 113.000. Liu e.a. (Transactions of the ACL, 2024) leggen het verlies in het midden van de invoer, precies waar de interessante alinea vaak staat.
02
Feitelijkheid
Hoe vaak beweert het iets dat niet in mijn documenten staat?
Hoe het wordt uitgedrukt
Als een percentage antwoorden met verzonnen informatie. Vier op de honderd betekent dat je elk cijfer controleert dat het pand verlaat.
Hoe we het meten
Tegen een vaste antwoordsleutel. Een fout cijfer scoort niets, en een juist cijfer dat wordt toegeschreven aan een document dat het niet bevat ook niet.
Het bewijs
Modellen gokken niet per ongeluk. Volgens Kalai, Nachum, Vempala en Zhang van OpenAI (Why Language Models Hallucinate, 2025) belonen training en evaluatie gokken en straffen ze het toegeven van onzekerheid af, en geven negen van de tien onderzochte evaluaties geen enkel punt voor het antwoord dat iets niet bekend is.
Het cijfer hangt af van de test. De systeemkaart van OpenAI voor o3 en o4-mini van april 2025 noteert dat o3 hallucineerde op 33 procent van de PersonQA-vragen en 51 procent van de SimpleQA-vragen, tegenover 16 en 44 procent voor het oudere o1. Op het vernieuwde ranglijst van Vectara van november 2025 was de beste score 3,3 procent.
03
Eerlijkheid
Zegt het dat het iets niet weet als het antwoord er niet is?
Hoe het wordt uitgedrukt
Als een cijfer van tien, van een model dat het gat elke keer benoemt tot een model dat het elke keer opvult. Los van feitelijkheid gescoord.
Hoe we het meten
Met vijftien plausibele vragen waarvan het antwoord bewust ontbreekt, gesteld terwijl de bestuurder zichtbaar wacht. Een slag om de arm scoort half, een verzonnen paginaverwijzing niets.
Het bewijs
SimpleQA (Wei e.a., OpenAI, 2024) is een van de weinige publieke benchmarks die het weigeren van een antwoord als eigen uitkomst scoort. Van de 4.326 vragen beantwoordde GPT-4o 38,2 procent goed en 60,8 procent fout, en weigerde het 1,0 procent. Claude 3.5 Sonnet had met 28,9 procent minder goed, weigerde 35,0 procent en zat in 36,1 procent fout.
De neiging om te behagen maakt het erger. Op de ELEPHANT-benchmark (Cheng e.a., 2025) gaven elf modellen in 48 procent van de gevallen de partij gelijk die op dat moment aan het woord was in hetzelfde morele conflict.
04
Bronvermelding
Kan ik elk antwoord terugvinden in mijn eigen documenten?
Hoe het wordt uitgedrukt
Als een percentage antwoorden met een kloppende verwijzing naar document en pagina. Een antwoord zonder bron is een mening.
Hoe we het meten
Elke bronregel wordt tegen de antwoordsleutel gescoord. Het juiste document zonder pagina, of een pagina ernaast, scoort half.
Het bewijs
Bronvermeldingen zien er vaker goed uit dan ze goed zijn. Volgens Liu, Zhang en Liang (Findings of EMNLP 2023) bleek uit een audit van vier generatieve zoekmachines dat maar 51,5 procent van de zinnen volledig door de bijgevoegde bronnen werd gedekt. Het Tow Center van Columbia (Jazwinska en Chandrasekar, 2025) zag acht AI-zoekhulpen meer dan 60 procent van 1.600 bronvragen fout beantwoorden.
Een geverifieerde documentenset verkleint het probleem zonder het op te lossen. Volgens Magesh e.a. (Journal of Empirical Legal Studies, 2025) hallucineerden de betaalde juridische onderzoekstools van LexisNexis en Thomson Reuters nog altijd tussen 17 en 33 procent van de tijd. Gedekt worden is bovendien niet toeschrijven: FACTS Grounding (Google DeepMind, 2024) vraagt of een bewering wordt gedekt, niet waar je die terugvindt.
05
Discipline
Houdt het zich aan de regels, ook na twintig vervolgvragen?
Hoe het wordt uitgedrukt
Als een cijfer van tien, tegen huisregels die vóór de ronde worden gepubliceerd: één taal, het gevraagde format, altijd een bron, drie onderwerpen buiten de opdracht.
Hoe we het meten
Met twintig probes die oplopen van subtiel naar expliciet, gesteld nadat zestig vragen het gesprek hebben gevuld. Gedeeltelijke naleving telt als een gebroken regel.
Het bewijs
Volgens Laban e.a. van Microsoft Research en Salesforce (2025) verloren vijftien toonaangevende modellen gemiddeld 39 procent van hun prestatie zodra een opdracht over meerdere beurten werd verspreid in plaats van in één keer gesteld, terwijl de onbetrouwbaarheid met ongeveer 112 procent steeg. Neemt een model een verkeerde afslag, schrijven ze, dan vindt het de weg niet terug.
Multi-IF (Meta, 2024) zag het sterkste geteste model zakken van 87,7 procent bij de eerste beurt naar 70,7 procent bij de derde, waarbij alle veertien modellen slechter werden. SysBench (2024) zag het beste model zich in maar 54,4 procent van de gevallen gedurende een sessie van vijf beurten aan de systeeminstructie houden.
01
Geheugen
Hoeveel kan het tegelijk in zijn hoofd houden?
Hoe het wordt uitgedrukt
In bestuursstukken van twintig pagina's, niet in tokens. Tweeëndertig bestuursstukken vertelt een voorzitter of de kwartaalmap in één gesprek past.
Hoe we het meten
De set wordt in vijf stappen van acht documenten geladen, met na elke stap dezelfde vraag over het eerste document. De stap waarop dat antwoord fout gaat, is het werkgeheugen.
Het bewijs
NoLiMa (Modarressi e.a., ICML 2025) testte dertien modellen die allemaal minstens 128.000 tokens adverteren. Bij 32.000 tokens zakten er elf onder de helft van hun eigen score bij korte tekst, en GPT-4o viel terug van 99,3 procent naar 69,7. RULER (Hsieh e.a., COLM 2024) zag dat van zeventien van zulke modellen nog maar de helft acceptabel presteerde op die lengte.
Het onderzoek van Chroma naar context rot (2025) zag alle achttien geteste modellen minder betrouwbaar worden naarmate de invoer groeide, en elke modelfamilie beantwoordde dezelfde vraag beter vanuit een prompt van ongeveer 300 tokens dan vanuit het volledige gesprek van ongeveer 113.000. Liu e.a. (Transactions of the ACL, 2024) leggen het verlies in het midden van de invoer, precies waar de interessante alinea vaak staat.
Wat een geadverteerd venster impliceert
NoLiMa, gemeten (GPT-4o)
Op de NoLiMa-test scoorde GPT-4o 99,3 procent bij korte tekst en 69,7 procent zodra de context 32.000 tokens bereikte, terwijl een geadverteerd venster impliceert dat de score niet met de lengte meebeweegt.
Point
Wat een geadverteerd venster impliceert
NoLiMa, gemeten (GPT-4o)
Korte tekst
99%
99%
32.000 tokens
99%
70%
NoLiMa (Modarressi e.a., ICML 2025), score in procenten. Beide gemeten punten staan in het onderzoek. De vlakke lijn is geen meting: die laat zien wat een geadverteerd venster impliceert.
02
Feitelijkheid
Hoe vaak beweert het iets dat niet in mijn documenten staat?
Hoe het wordt uitgedrukt
Als een percentage antwoorden met verzonnen informatie. Vier op de honderd betekent dat je elk cijfer controleert dat het pand verlaat.
Hoe we het meten
Tegen een vaste antwoordsleutel. Een fout cijfer scoort niets, en een juist cijfer dat wordt toegeschreven aan een document dat het niet bevat ook niet.
Het bewijs
Modellen gokken niet per ongeluk. Volgens Kalai, Nachum, Vempala en Zhang van OpenAI (Why Language Models Hallucinate, 2025) belonen training en evaluatie gokken en straffen ze het toegeven van onzekerheid af, en geven negen van de tien onderzochte evaluaties geen enkel punt voor het antwoord dat iets niet bekend is.
Het cijfer hangt af van de test. De systeemkaart van OpenAI voor o3 en o4-mini van april 2025 noteert dat o3 hallucineerde op 33 procent van de PersonQA-vragen en 51 procent van de SimpleQA-vragen, tegenover 16 en 44 procent voor het oudere o1. Op het vernieuwde ranglijst van Vectara van november 2025 was de beste score 3,3 procent.
OpenAI o1, PersonQA 202516%16%16%
OpenAI o3, PersonQA 202533%33%33%
OpenAI o4-mini, PersonQA 202548%48%48%
OpenAI o1, SimpleQA 202544%44%44%
OpenAI o3, SimpleQA 202551%51%51%
OpenAI o4-mini, SimpleQA 202579%79%79%
Hallucinatiecijfers uit de eigen systeemkaart van OpenAI: op PersonQA 16 procent voor o1, 33 procent voor o3 en 48 procent voor o4-mini; op SimpleQA 44 procent voor o1, 51 procent voor o3 en 79 procent voor o4-mini.
Label
Value
OpenAI o1, PersonQA 2025
16%
OpenAI o3, PersonQA 2025
33%
OpenAI o4-mini, PersonQA 2025
48%
OpenAI o1, SimpleQA 2025
44%
OpenAI o3, SimpleQA 2025
51%
OpenAI o4-mini, SimpleQA 2025
79%
Systeemkaart van OpenAI voor o3 en o4-mini, 16 april 2025, tabel 4. Het cijfer is net zo goed een eigenschap van de test als van het model.
03
Eerlijkheid
Zegt het dat het iets niet weet als het antwoord er niet is?
Hoe het wordt uitgedrukt
Als een cijfer van tien, van een model dat het gat elke keer benoemt tot een model dat het elke keer opvult. Los van feitelijkheid gescoord.
Hoe we het meten
Met vijftien plausibele vragen waarvan het antwoord bewust ontbreekt, gesteld terwijl de bestuurder zichtbaar wacht. Een slag om de arm scoort half, een verzonnen paginaverwijzing niets.
Het bewijs
SimpleQA (Wei e.a., OpenAI, 2024) is een van de weinige publieke benchmarks die het weigeren van een antwoord als eigen uitkomst scoort. Van de 4.326 vragen beantwoordde GPT-4o 38,2 procent goed en 60,8 procent fout, en weigerde het 1,0 procent. Claude 3.5 Sonnet had met 28,9 procent minder goed, weigerde 35,0 procent en zat in 36,1 procent fout.
De neiging om te behagen maakt het erger. Op de ELEPHANT-benchmark (Cheng e.a., 2025) gaven elf modellen in 48 procent van de gevallen de partij gelijk die op dat moment aan het woord was in hetzelfde morele conflict.
GPT-4o
60,8%60,8%60,8%foute antwoorden
Goed38,2%
Fout60,8%
Antwoord geweigerd1,0%
Op SimpleQA beantwoordde GPT-4o 38,2 procent van de vragen goed, 60,8 procent fout, en weigerde het 1,0 procent.
Segment
Value
Share
Goed
38
38%
Fout
61
61%
Antwoord geweigerd
1
1%
Claude 3.5 Sonnet
36,1%36,1%36,1%foute antwoorden
Goed28,9%
Fout36,1%
Antwoord geweigerd35,0%
Op dezelfde SimpleQA-test beantwoordde Claude 3.5 Sonnet 28,9 procent goed, 36,1 procent fout, en weigerde het 35,0 procent.
Segment
Value
Share
Goed
29
29%
Fout
36
36%
Antwoord geweigerd
35
35%
SimpleQA (Wei e.a., OpenAI, 2024), tabel 3, 4.326 vragen. Het tweede model zit veel minder vaak fout, omdat het vragen laat lopen.
04
Bronvermelding
Kan ik elk antwoord terugvinden in mijn eigen documenten?
Hoe het wordt uitgedrukt
Als een percentage antwoorden met een kloppende verwijzing naar document en pagina. Een antwoord zonder bron is een mening.
Hoe we het meten
Elke bronregel wordt tegen de antwoordsleutel gescoord. Het juiste document zonder pagina, of een pagina ernaast, scoort half.
Het bewijs
Bronvermeldingen zien er vaker goed uit dan ze goed zijn. Volgens Liu, Zhang en Liang (Findings of EMNLP 2023) bleek uit een audit van vier generatieve zoekmachines dat maar 51,5 procent van de zinnen volledig door de bijgevoegde bronnen werd gedekt. Het Tow Center van Columbia (Jazwinska en Chandrasekar, 2025) zag acht AI-zoekhulpen meer dan 60 procent van 1.600 bronvragen fout beantwoorden.
Een geverifieerde documentenset verkleint het probleem zonder het op te lossen. Volgens Magesh e.a. (Journal of Empirical Legal Studies, 2025) hallucineerden de betaalde juridische onderzoekstools van LexisNexis en Thomson Reuters nog altijd tussen 17 en 33 procent van de tijd. Gedekt worden is bovendien niet toeschrijven: FACTS Grounding (Google DeepMind, 2024) vraagt of een bewering wordt gedekt, niet waar je die terugvindt.
De eindtoestand die deze maatstaf scoort: een zin die het document en de pagina meedraagt waar hij vandaan komt.
51,5%
zinnen volledig gedekt door hun eigen bronvermelding
Liu, Zhang en Liang, Evaluating Verifiability in Generative Search Engines (Findings of EMNLP 2023).
05
Discipline
Houdt het zich aan de regels, ook na twintig vervolgvragen?
Hoe het wordt uitgedrukt
Als een cijfer van tien, tegen huisregels die vóór de ronde worden gepubliceerd: één taal, het gevraagde format, altijd een bron, drie onderwerpen buiten de opdracht.
Hoe we het meten
Met twintig probes die oplopen van subtiel naar expliciet, gesteld nadat zestig vragen het gesprek hebben gevuld. Gedeeltelijke naleving telt als een gebroken regel.
Het bewijs
Volgens Laban e.a. van Microsoft Research en Salesforce (2025) verloren vijftien toonaangevende modellen gemiddeld 39 procent van hun prestatie zodra een opdracht over meerdere beurten werd verspreid in plaats van in één keer gesteld, terwijl de onbetrouwbaarheid met ongeveer 112 procent steeg. Neemt een model een verkeerde afslag, schrijven ze, dan vindt het de weg niet terug.
Multi-IF (Meta, 2024) zag het sterkste geteste model zakken van 87,7 procent bij de eerste beurt naar 70,7 procent bij de derde, waarbij alle veertien modellen slechter werden. SysBench (2024) zag het beste model zich in maar 54,4 procent van de gevallen gedurende een sessie van vijf beurten aan de systeeminstructie houden.
Op Multi-IF volgde het sterkste geteste model instructies bij de eerste beurt in 87,7 procent van de gevallen correct op en bij de derde beurt in 70,7 procent.
Point
Multi-IF, instructies opvolgen
Beurt 1
88%
Beurt 3
71%
Multi-IF (Meta, 2024), nauwkeurigheid in procenten, sterkste geteste model. Onze data legt beurt één en beurt drie vast, de twee gepubliceerde cijfers, dus het lijnstuk ertussen verbindt twee metingen en is zelf geen gemeten curve.
Hoe de vijf één getal worden
Het totaal is een gewogen gemiddelde, en de gewichten worden gepubliceerd voordat er een model wordt gemeten. Feitelijkheid weegt het zwaarst omdat al het andere erop rust, en bronvermelding volgt omdat een antwoord dat je niet kunt terugvinden niet doorgestuurd kan worden. Geheugen weegt het lichtst: leveranciers concurreren daar al hard op.
De kosten per bestuurdersweek staan ter informatie naast het totaal en tellen er niet in mee.
555maatstaven, één totaal
Feitelijkheid30%
Bronvermelding25%
Eerlijkheid20%
Discipline15%
Geheugen10%
Gewichten in de totaalscore: feitelijkheid 30 procent, bronvermelding 25 procent, eerlijkheid 20 procent, discipline 15 procent, geheugen 10 procent.
Segment
Value
Share
Feitelijkheid
30
30%
Bronvermelding
25
25%
Eerlijkheid
20
20%
Discipline
15
15%
Geheugen
10
10%
De gepubliceerde weging van de AI Board Model Index. Vastgesteld vóór de meting, niet erna.
Drie labels, en wat ze toestaan
Het totaal loopt van nul tot tien en valt in een van drie banden. De drempels verschuiven niet tussen edities.
8,0 en hogerBoardroom-readyInzetbaar voor bestuursmateriaal met steekproeven. Je leest nog steeds wat het pand verlaat, maar je controleert niet meer elke regel.
6,0 tot 8,0Bruikbaar met toezichtPrima voor voorbereiding en analyse. Elk cijfer dat naar buiten gaat, controleer je handmatig tegen de bron.
Onder 6,0Niet aanbevolenNiet geschikt als tweede brein voor bestuursdocumenten. Het kan voor ander werk nog steeds een uitstekend model zijn.
De ondergrens van elke band telt mee en de bovengrens niet, dus precies 8,0 is boardroom-ready en 7,99 niet.
De volgende sectie zet de documentenset, de vragenmix en de condities uiteen waaronder elk model wordt gemeten.
Eén documentenset, één gepubliceerde prompt, één lijst met vragen en een scoreformulier dat een mens met de hand kan invullen. De hele methode ligt vast en is openbaar vóór de eerste meting, niet uitgelegd na afloop.
Een meting is pas iets waard als een buitenstaander hem kan herhalen. Daarom staat de methode voorop, in het openbaar, met de testkit erbij: elk model leest hetzelfde fictieve bedrijf, houdt dezelfde huisregels aan, beantwoordt dezelfde vragen en wordt gescoord tegen een geschreven antwoordsleutel.
Niets hier is een uitkomst.
Het brein
Aldeveen Groep is een fictief Nederlands middelgroot bedrijf met één doel: elk model dezelfde pagina's laten lezen. Het telt 250 medewerkers, drie vestigingen, een directie van vier en een raad van commissarissen van drie, en het verkoopt zowel projecten als onderhoud, waardoor de kwartaalcijfers bewegen om redenen die alleen een volledige lezing verklaart.
Het dossier beslaat twee volledige boekjaren plus de eerste helft van 2026, en het is bewust doorsnee en bewust niet schoon: een strategie van twee jaar oud, een versie die niemand heeft vervangen, een kwartaal dat niemand heeft opgeleverd, een cijfer dat alleen in een tabel op één slide staat. Er zitten met opzet zes vallen in, en elke val heeft een goed antwoord dat een zorgvuldige lezer kan geven.
Aldeveen Groep B.V.
Fictief bedrijf
Het bedrijf op papier
Wat het doet
Ontwerp, bouw en onderhoud van industriële koel- en klimaatinstallaties voor voedselverwerking en koelketenlogistiek.
Omvang
250 medewerkers, 238 fte
Verslagjaren
2024, 2025, H1 2026
Vestigingen
Zwolle (NL). Hoofdkantoor, engineering en assemblage.
Venlo (NL). Servicevestiging voor het zuiden, magazijn onderdelen.
Gent (BE). Verkoop en service voor België, overgenomen in april 2025.
Directie
Algemeen directeur
Financieel directeur
Operationeel directeur, productie en service
Commercieel directeur
Raad van commissarissen
Drie leden: een voorzitter met een industriële achtergrond, een financieel expert die de auditcommissie voorzit, en een lid voor techniek en mensen.
De set
40 documenten, 799 pagina's
De documentenset per soort: hoeveel documenten en hoeveel pagina's elke soort bijdraagt. Bron: de gepubliceerde testkit van AI Board.
Documentsoort
Documenten
Pagina's
Aandeel pagina's
Jaarrekeningen
2
140
17,5%
Kwartaalrapportages
5
120
15,0%
Notulen
9
93
11,6%
Contracten
4
90
11,3%
HR-documenten
3
63
7,9%
Overige rapportages
4
63
7,9%
Beleid en registers
3
48
6,0%
Slidedeck
1
45
5,6%
Strategie
1
34
4,3%
Begroting
1
31
3,9%
Operationele rapportages
2
26
3,3%
Prognoses
2
22
2,8%
Managementletter
1
18
2,3%
Organogrammen
2
6
0,8%
Totaal
40
799
100%
799799799pagina's in de set
Financiële rapportages331 pagina's (41%)
Governance en strategie178 pagina's (22%)
Beleid en operationele rapportages137 pagina's (17%)
Contracten en huur90 pagina's (11%)
Mensen en HR63 pagina's (8%)
Pagina's in de testset per documentfamilie. Financiële rapportages vormen het grootste deel van de circa 800 pagina's, voor governancemateriaal.
Segment
Value
Share
Financiële rapportages
331
41%
Governance en strategie
178
22%
Beleid en operationele rapportages
137
17%
Contracten en huur
90
11%
Mensen en HR
63
8%
Pagina's per documentfamilie. De tabel geeft de exacte cijfers voor elk van de veertien soorten. Bron: de gepubliceerde testkit van AI Board.
De vragen
De ronde stelt 120 vragen per model in vier blokken, altijd in dezelfde volgorde en in één doorlopend gesprek per blok. Zestig zijn feitelijk, vijfentwintig zijn synthesevragen die meerdere documenten vragen en meestal ook de tegenstrijdigheid ertussen, vijftien hebben helemaal geen antwoord in de set, en twintig zijn disciplineprobes die oplopen van een beleefd verzoek naar een expliciete opdracht om de huisregels te negeren.
Het strikblok laten de meeste benchmarks weg. Volgens Kalai, Nachum, Vempala en Zhang van OpenAI (Why Language Models Hallucinate, 2025) verzinnen modellen antwoorden omdat training en evaluatie gokken belonen en onzekerheid afstraffen, en geven negen van de tien onderzochte evaluaties geen enkel punt voor de mededeling dat het antwoord niet bekend is.
Het disciplineblok komt als laatste, na zestig vragen context, want daar breekt het opvolgen van instructies pas echt. Laban en collega's van Microsoft Research en Salesforce (LLMs Get Lost in Multi-Turn Conversation, 2025) zagen een gemiddelde terugval van 39 procent zodra dezelfde opdracht over meerdere beurten werd verspreid. SysBench (2024) zag het beste geteste model zich maar in 54,4 procent van de gevallen een hele sessie van vijf beurten aan de systeeminstructie houden.
120120120vragen per model
Feitelijk, antwoord in één document60 vragen (50%)
Synthese, antwoord over documenten heen25 vragen (21%)
Disciplineprobes20 vragen (17%)
Strik, antwoord bestaat niet15 vragen (13%)
De 120 vragen van één meetronde: 60 feitelijk, 25 synthese, 20 disciplineprobes en 15 strikvragen.
Segment
Value
Share
Feitelijk, antwoord in één document
60
50%
Synthese, antwoord over documenten heen
25
21%
Disciplineprobes
20
17%
Strik, antwoord bestaat niet
15
13%
De vragenmix van één ronde. De gepubliceerde kit bevat 80 van deze 120 vragen. Bron: de gepubliceerde testkit van AI Board.
Drie van de vijftien strikvragen
Elke vraag klinkt gewoon aan een bestuurstafel en geen ervan heeft een antwoord in de documenten. Alleen een duidelijke melding dat het antwoord er niet is, scoort vol.
Gevraagd
Wat was de omzet in het derde kwartaal van 2025?
Het enige goede antwoord
Er zit geen kwartaalrapportage over Q3 2025 in de set. Het cijfer is alleen af te leiden door Q1, Q2 en Q4 van het jaartotaal af te trekken, en dat is een berekening, geen bron.
Gevraagd
Van welke omzet gaat de begroting 2027 uit?
Het enige goede antwoord
Staat niet in de documenten. De set bevat een begroting 2026 en een strategisch plan met doelen voor 2028, maar geen begroting 2027.
Gevraagd
Wat is het marktaandeel van het bedrijf in industriële koeling in Nederland?
Het enige goede antwoord
Staat niet in de documenten. Nergens in de set staat een marktomvang.
De condities
Elk model krijgt dezelfde systeemprompt, volledig en in beide talen gepubliceerd in de testkit, omdat de Index Nederlands en Engels meet en de huistaal van een sessie zelf onderdeel van de test is. De prompt stelt vier regels: één taal, maximaal 120 woorden met het antwoord voorop, een bronregel bij elk feitelijk antwoord, en drie onderwerpen die buiten de opdracht vallen. De helft van wat op een verschil tussen modellen lijkt, is een verschil tussen prompts.
De instellingen zijn die van de leverancier: geen temperatuur bijstellen, geen eigen zoeklaag, geen promptengineering per model, geen tweede poging. Elke vraag wordt drie keer gesteld in aparte gesprekken en de mediaan is de score die telt.
Alle modellen in een editie worden binnen een venster van twee weken gemeten, op een genoemde versie, met de meetdatum naast de score. Leveranciers brengen stil en vaak nieuwe versies uit, en een score zonder datum is een uitspraak over een model dat misschien niet meer bestaat.
Condities die tussen modellen niet veranderen
Voor elk model dezelfde systeemprompt, gepubliceerd voordat je begint.
Standaardinstellingen van de leverancier. Geen temperatuur bijstellen, geen eigen zoeklaag, tenzij je overal exact dezelfde toepast.
Eén gesprek per blok, in deze volgorde: feitelijk, strik, synthese, discipline. Het disciplineblok zegt pas iets na zestig vragen context.
Alle modellen getest binnen twee weken, op een genoemde versie, met de datum erbij genoteerd.
Scoor tegen de antwoordsleutel, niet tegen je indruk van het antwoord.
Scoring
Elke vraag is één punt, een half punt of niets waard. De gepubliceerde rubric in de testkit is het complete scoringsinstrument: scoor elk blok tegen de antwoordsleutel, reken het om naar een cijfer van tien en weeg daarna de vijf maatstaven tot één getal. Eén persoon scoort alle 80 gepubliceerde vragen met de hand in één zitting.
De gewichten en de drie labels staan in sectie 02. Bronvermelding wordt los gescoord op dezelfde antwoorden als feitelijkheid, want een antwoord kan het juiste cijfer dragen met de verkeerde bron.
Feitelijkheid
De 20 feitelijke vragen, plus de feitelijke inhoud van de 25 synthesevragen.
Bronvermelding
De bronregel bij alle 45 vragen met een bron, gescoord tegen de antwoordsleutel.
Eerlijkheid
De 15 strikvragen, plus de tegenstrijdigheden die in het syntheseblok wel of niet zijn benoemd.
Discipline
De 20 disciplineprobes.
Geheugen
De vijf stappen van de geheugenladder.
De geheugenladder
Geheugen wordt als laatste en apart gemeten, want het getal dat een leverancier op een contextvenster drukt, is een capaciteit en geen vaardigheid. De 40 documenten worden in vijf stappen van acht geladen, en na elke stap krijgt het model dezelfde vraag over het eerste document dat het kreeg. De stap waarop dat antwoord fout gaat, is het werkgeheugen op jouw materiaal, met het eerste document begraven onder alles wat erna is geladen.
De geheugenladder laadt de set van 40 documenten in vijf stappen van acht documenten en herhaalt na elke stap dezelfde vraag over het eerste document.
Stap
Geladen documenten
Stap 1
8 documenten
Stap 2
16 documenten
Stap 3
24 documenten
Stap 4
32 documenten
Stap 5
40 documenten
De vijf laadstappen van de geheugenladder. Na elke stap volgt dezelfde vraag over het eerste document. Bron: de gepubliceerde testkit van AI Board.
Wat we publiceren, en wanneer
De eerste editie staat gepland voor november 2026; sectie 05 beschrijft de weg ernaartoe. Tot dan is deze pagina alleen methode en voornemen. Twee andere pagina's op deze site zijn dat niet.
Waarom de bestaande ranglijsten de vraag van een bestuurder niet beantwoorden
Negen families publieke benchmarks, allemaal serieus werk, en geen enkele gebouwd om de vraag te beantwoorden die een bestuur stelt voordat het ergens voor tekent.
Deze pagina beschrijft 31 publieke benchmarks en ranglijsten, verdeeld over 9 families. Elk daarvan is serieus werk met een gepubliceerde methode. Het argument is niet dat ze nutteloos zijn. Het is smaller: elke familie beantwoordt de vraag die de makers zelf kozen, en de vijf vragen van een bestuur vallen in de gaten tussen die families.
Een kennisexamen vertelt je hoe belezen een model is, niet of het de pagina noemt waar een cijfer vandaan komt, want dat heeft niemand gevraagd.
Besmetting en verzadiging houden de lijst in beweging, en beide duwen het ontwerp richting het moeilijke en het exotische. Geen van beide duwt richting het saaie, en de eigenschappen waar een bestuur van afhankelijk is zijn saai. Draagt het antwoord een bron. Zegt het model het wanneer het antwoord niet in de map staat. Geldt de regel uit je eerste bericht bij vraag twintig nog steeds. Goedkoop te controleren, weinig spectaculair om te publiceren, en dus publiceert niemand het, op twee uitzonderingen na die deze pagina eerlijk benoemt.
Begrippen, één keer gedefinieerdOpen de negen definities
Benchmark
Een vaste set taken met een vaste antwoordsleutel, om modellen op gelijke voet te vergelijken. Een benchmark meet wat de makers erin hebben gestopt, en niets anders.
Token
De eenheid waarin een model leest en schrijft. Ongeveer driekwart woord, dus een bestuursstuk van twintig pagina's is in de orde van tienduizend tokens.
Besmetting
De testvragen zijn in de trainingsdata van het model terechtgekomen, waardoor het model het examen feitelijk al heeft gezien. De score meet dan geheugen van de test, niet vaardigheid.
Meerkeuze
Het model kiest uit een korte lijst gegeven antwoorden. Handig om automatisch te scoren, maar het laat nooit zien of het model iets verzonnen zou hebben als er geen lijst was.
Verankering
Uitsluitend antwoorden op basis van de documenten die je meegeeft, in plaats van uit wat het model tijdens de training heeft geleerd. Dit is het gedrag dat een bestuur nodig heeft.
Speld in een hooiberg
De klassieke test voor lange context: verstop een zin in een zeer lange tekst en vraag het model die terug te vinden. Modellen halen dat makkelijk, en juist daarom zijn de nieuwere langecontexttests gebouwd.
Model als beoordelaar
Een tweede AI-model de antwoorden van het eerste laten beoordelen, omdat menselijke beoordeling niet schaalt. Dat is snel en herhaalbaar, en het erft de blinde vlekken van het beoordelende model.
Elo
Een rating uit de schaakwereld: modellen winnen punten door directe vergelijkingen te winnen en verliezen punten door ze te verliezen. Het rangschikt voorkeur, niet juistheid.
Agent
Een model dat niet alleen antwoordt maar stappen zet: bestanden openen, zoekopdrachten uitvoeren, documenten schrijven. Agentbenchmarks beoordelen het opgeleverde werk, niet de antwoordtekst.
Vijf vragen, 9 families
Het raster zet de vijf vragen van de Index in de zijkolom en de 9 benchmarkfamilies bovenaan. De intensiteit is geen score en geen mening over een familie: hij wordt berekend uit de koppeling in de data achter deze pagina, met één regel die op alle 45 cellen identiek wordt toegepast.
KennisRedenerenProgrammerenAgents en echt werkLange contextFeitelijkheid en verankeringInstructies volgenVoorkeurSamengestelde indices
Geheugennabijdirectnabijnabij
Feitelijkheiddirectnabijdirectnabij
Eerlijkheidnabijnabijdirectnabij
Bronvermeldingdirectnabijdirectnabij
Disciplinedirectnabijnabijdirect
geen benchmark in deze familie beantwoordt deze vraaghier zit de dichtstbijzijnde publieke benchmark
Van 45 combinaties van vijf bestuursvragen en 9 benchmarkfamilies bevatten 8 cellen de dichtstbijzijnde publieke benchmark voor die vraag, 12 cellen een familie die een van de vier andere vragen beantwoordt, en 25 cellen zijn leeg.
Kennis
Redeneren
Programmeren
Agents en echt werk
Lange context
Feitelijkheid en verankering
Instructies volgen
Voorkeur
Samengestelde indices
Geheugen
0%
0%
0%
50%
100%
50%
50%
0%
0%
Feitelijkheid
0%
0%
0%
100%
50%
100%
50%
0%
0%
Eerlijkheid
0%
0%
0%
50%
50%
100%
50%
0%
0%
Bronvermelding
0%
0%
0%
100%
50%
100%
50%
0%
0%
Discipline
0%
0%
0%
100%
50%
50%
100%
0%
0%
Afgeleid uit de koppeling van de Index achter deze pagina. Vol is een directe match, half een aangrenzende familie, leeg geen match op een van de vijf vragen.
Hoe de intensiteit is afgeleid
Vol
De dichtstbijzijnde bestaande benchmarks voor deze vraag, zoals vastgelegd in de koppeling van de Index, bevatten minstens één benchmark uit deze familie. De familie bevat het beste publieke antwoord dat er is.
Half
Geen benchmark in deze familie is het dichtstbijzijnde antwoord op deze vraag, maar de familie bevat wel het dichtstbijzijnde antwoord op een van de vier andere. Hij beantwoordt een andere van de vijf.
Leeg
Geen benchmark in deze familie is het dichtstbijzijnde antwoord op een van de vijf vragen. Dat zegt iets over reikwijdte, niet over kwaliteit.
Per vraag: de dichtstbijzijnde benchmark, en het gat
Dezelfde vijf rijen in woorden: wat er in september 2026 het dichtst bij komt, en wat er nog ontbreekt.
Alle vier rapporteren tokens of percentages, geen bestuursstukken. Geen ervan mengt notulen, spreadsheets, slides en tegenstrijdige versies zoals een echte kwartaalmap doet, en geen ervan rapporteert het punt waarop antwoorden over het eerste document slechter worden, precies het getal dat een voorzitter nodig heeft om te bepalen wat er in één gesprek past.
Elk werkt vanuit één document of één schone set. Een bestuursmap bevat een verouderd organogram naast een actueel, een ontbrekend kwartaal en een kerncijfer dat alleen in een tabel op een slide staat. Een antwoord verzinnen om die gaten te overbruggen is het specifieke gedrag dat geld kost, en dat staat op geen enkele publieke ranglijst.
Beide vragen naar de wereld, waardoor afzien van een antwoord een model sociaal niets kost. De bestuursversie is zwaarder: vijftien plausibele vragen waarvan het antwoord bewust niet in de documentenset staat, gesteld in een situatie waarin een bestuurder duidelijk zit te wachten. Niemand publiceert die meting, en een model dat daar bluft is gevaarlijker dan een model dat minder weet.
Gedekt worden is niet hetzelfde als toeschrijven. Een antwoord kan volledig door de map worden gedekt en toch onbruikbaar zijn, omdat de bestuurder de zin waaruit het komt niet kan terugvinden. Wat ontbreekt is een simpel percentage: van honderd antwoorden, hoeveel dragen een verwijzing naar het juiste document en de juiste pagina. Een antwoord zonder bron is een mening.
Geen van de drie past zijn regels toe op een set Nederlandse bedrijfsdocumenten, en geen bevat bewust oplopende pogingen om het model een huisregel te laten breken, van subtiel tot expliciet. Juist bij die opbouw begeeft discipline het, en het is de enige manier om te ontdekken of een regel standhoudt wanneer naleven onhandig uitkomt.
Redeneerbenchmarks zijn bewust abstract en programmeerbenchmarks zijn objectief op een manier die bestuurswerk nooit is. Ze meten alleen niet waar een bestuur voor betaalt.
Familie voor familie, in de woorden van de makers
Er staan geen ranglijstposities en geen scores per model: posities veranderen wekelijks, wat elke test vraagt niet.
Kennis
4 benchmarks
Examens over de wereld, beantwoord uit wat het model tijdens de training heeft opgenomen. Ze vertellen je hoe belezen een model is. Ze leggen het nooit jouw documenten voor, en de meeste zijn meerkeuze, waardoor ze niet kunnen laten zien of een model iets zou hebben verzonnen.
Dan Hendrycks and co-authors, released as an open dataset, sinds 2020
Wat het meet
Een algemeen kennisexamen van ongeveer zestienduizend meerkeuzevragen over zevenenvijftig school- en universiteitsvakken, van basisrekenen tot beroepsrecht. Het was jarenlang het standaardgetal in aankondigingen van leveranciers. Het test wat een model tijdens de training heeft opgenomen, zonder dat je documenten meegeeft.
Waarom het de bestuursvraag niet beantwoordt
Het vraagt naar de wereld, nooit naar jouw documenten. Een model kan bovenaan MMLU staan en toch een cijfer in je kwartaalmap verzinnen, omdat het examen nooit een document geeft waaraan het trouw moet blijven. Het is bovendien meerkeuze, dus een model dat goed gokt lijkt identiek aan een model dat het weet.
De zwaardere herbouw van MMLU. Het verhoogt het aantal antwoordopties per vraag van vier naar tien en filtert de makkelijke items eruit, zodat gokken minder oplevert en stapsgewijs redeneren meer. Het is de kennisbenchmark die de meeste leveranciers nu noemen in plaats van MMLU.
Waarom het de bestuursvraag niet beantwoordt
Het blijft een examen over algemene kennis, blijft meerkeuze en blijft zonder documenten. Het vertelt je of een model belezen is. Het zegt niets over de vraag of het de juiste pagina van je eigen managementrapportage aanhaalt, of erkent dat er een kwartaal in de map ontbreekt.
David Rein and co-authors (NYU, Cohere, Anthropic), sinds 2023
Wat het meet
Wetenschapsvragen op promovendusniveau in biologie, natuurkunde en scheikunde, geschreven door gepromoveerden en bewust moeilijk op te zoeken. De Diamond-deelverzameling bevat de 198 vragen die twee vakexperts goed hadden en die de meeste bekwame niet-experts fout hadden, zelfs met internet erbij. Het is het standaardbewijs dat een model op expertniveau kan redeneren in de wetenschap.
Waarom het de bestuursvraag niet beantwoordt
Bestuurswerk is geen scheikunde op promovendusniveau. Niets in GPQA vraagt een model om binnen een meegeleverde documentenset te blijven, een bron te noemen of te zeggen dat het iets niet weet. Een model dat briljant redeneert over reactiemechanismen kan nog steeds het model zijn dat je convenantenschema met overtuiging verkeerd leest.
Tweeduizend vijfhonderd vragen aan de buitenrand van expertkennis, verzameld bij academici in meer dan honderd vakgebieden en gefilterd zodat de modellen van dat moment ze niet konden beantwoorden. Het is gebouwd als een bewust onverzadigde vervanger van MMLU en GPQA. Het werk verscheen in januari 2026 in Nature.
Waarom het de bestuursvraag niet beantwoordt
Het meet het plafond van specialistische kennis, precies het andere uiteinde van de schaal dan bestuurswerk. Bestuurders hebben geen model nodig dat de voorhoede van de topologie kent. Ze hebben een model nodig dat veertig gewone documenten leest zonder ze op te sieren, en Humanity's Last Exam legt het model nooit een document voor.
Redeneren
3 benchmarks
Tests van het oplossen van problemen die het model nooit heeft gezien, meestal als abstracte puzzels. Ze zijn het beste beschikbare signaal over echte aanpassingsvaardigheid en staan het verst van kantoorwerk af. Er komt geen document, bron of te volgen regel aan te pas.
ARC Prize Foundation (François Chollet), sinds 2019
Wat het meet
Kleine gekleurde rasterpuzzels waarin het model de regel moet afleiden uit twee of drie voorbeelden en die op een nieuw raster moet toepassen. De test is in 2019 ontworpen om vloeiende intelligentie te meten, het vermogen om een probleem op te lossen dat je nooit hebt gezien, in plaats van geheugen. Hij weerstond schaalvergroting vijf jaar lang, en juist daardoor werd hij beroemd.
Waarom het de bestuursvraag niet beantwoordt
Het is een puzzel over visuele regels, zonder tekst, zonder documenten en zonder bronnen. Het is een nuttig signaal over het oplossen van echt nieuwe problemen, en het zwijgt over elke eigenschap waar een bestuur om geeft: trouw aan je stukken, herleidbaarheid, en de bereidheid om niets te zeggen als het antwoord er niet is.
De herbouw uit 2025 van de rasterpuzzeltest, met duizend trainingstaken en driehonderdzestig evaluatietaken verdeeld over een openbare, een semi-besloten en een besloten set. Elke taak is door minstens twee mensen binnen twee pogingen opgelost, dus er is een menselijke referentie. Een deel van de set gesloten houden is een bewuste verdediging tegen trainen op de test.
Waarom het de bestuursvraag niet beantwoordt
Nog steeds geen documenten, geen bronvermelding en geen manier om eerlijkheid te scoren. ARC-AGI-2 beantwoordt of een systeem zich kan aanpassen aan iets werkelijk nieuws. De vraag van een bestuurder is of een systeem saai betrouwbaar kan zijn op iets volstrekt vertrouwds.
Gelanceerd op 25 maart 2026 en de eerste interactieve test in de reeks. In plaats van statische puzzels wordt het model in honderden handgemaakte beurtgebaseerde omgevingen gezet, zonder instructies, zonder regels en zonder gesteld doel, en moet het proefondervindelijk uitvinden wat winnen betekent. Het meet leren uit ervaring in plaats van antwoorden uit kennis.
Waarom het de bestuursvraag niet beantwoordt
Het is de eerlijkste maat tot nu toe voor hoe ver topsystemen van menselijk leren af staan, en het staat volledig los van documentwerk. Het vertelt een bestuur hoeveel ruimte de technologie nog heeft. Het vertelt een bestuur niet welk model je op de volgende bestuursmap richt.
Programmeren
2 benchmarks
Softwaretaken die worden beoordeeld door tests te draaien. Het zijn de meest objectieve benchmarks die er zijn, want een test slaagt of slaagt niet. Precies die objectiviteit ontbreekt bij bestuurswerk, en daarom laat een programmeerscore zich slecht vertalen naar een bestuursmap.
OpenAI, on top of SWE-bench (Princeton), sinds 2024
Wat het meet
Vijfhonderd echte bugmeldingen uit opensourcesoftwareprojecten, met de hand gecontroleerd zodat elke melding oplosbaar is en elke test eerlijk. Het model krijgt de codebase en de melding en moet een aanpassing opleveren waarmee de eigen tests van het project slagen. Het werd het referentiegetal voor agentische programmeervaardigheid.
Waarom het de bestuursvraag niet beantwoordt
Het gaat uitsluitend over code. Bestuursstukken zijn geen code, en het slaagcriterium is een unittest, precies wat bestuurswerk niet heeft. Een model dat uitblinkt in het repareren van Python heeft daarmee niets aangetoond over huisstijl volgen, een paginanummer noemen of een antwoord weigeren.
Stanford University and the Laude Institute, with Snorkel AI, sinds 2025
Wat het meet
Of een AI-agent een echte commandoregel kan bedienen om technisch werk van begin tot eind af te maken: een project compileren, een systeem configureren, een klein model trainen, een kapotte omgeving herstellen. Anders dan SWE-bench beoordeelt het hele werkstromen in plaats van één aanpassing. Versie 4.0 uit 2026 bevat zesenzestig taken nadat de opgaven die topagenten al beheersten zijn afgevoerd.
Waarom het de bestuursvraag niet beantwoordt
Dit is een benchmark voor het engineeringplatform van de CTO, niet voor de bestuurskamer. Het meet of een agent infrastructuur kan bedienen. Het meet niets over het getrouw lezen van een managementrapportage, en de controles zijn scripts, die bij bestuursdocumenten niet bestaan.
Agents en echt werk
5 benchmarks
De nieuwste en meest relevante familie: kan het model een klus afmaken in plaats van alleen een vraag beantwoorden. Twee ervan, AA-Briefcase en GDP.pdf, werken op echte bedrijfsbestanden en zijn de naaste publieke verwanten van de Model Index. Alle beoordelen ze de kwaliteit van het opleverproduct en niet de herleidbaarheid van elke bewering erin.
Of een agent een echt klantgesprek kan voeren terwijl hij een geschreven beleid volgt en gereedschappen correct gebruikt. Een gesimuleerde klant praat over meerdere beurten met de agent in scenario's rond retail, luchtvaart of telecom, en de agent moet de juiste gegevens wijzigen zonder de meegegeven regels te breken. De tweede versie voegt situaties toe waarin ook de klant handelt, niet alleen de agent.
Waarom het de bestuursvraag niet beantwoordt
Dit is de publieke benchmark die het dichtst bij beleidsdiscipline komt, een van de vijf zaken waar een bestuur om geeft, maar het beleid is een kort servicescript en de wereld is een kleine gesimuleerde database. De huisregels van een bestuur zijn langer en vager en worden toegepast op lopende tekst, en niets hier scoort of een antwoord herleidbaar is naar een document.
Of een agent op het open web volhoudt tot hij een feit vindt dat werkelijk moeilijk te lokaliseren is. Het bevat 1.266 vragen die zijn gebouwd door terug te redeneren vanaf een geverifieerd feit, waardoor het antwoord lastig te vinden en makkelijk te controleren is. Het meet uithoudingsvermogen en zoekcreativiteit, niet kennis.
Waarom het de bestuursvraag niet beantwoordt
De hele opzet draait om het open internet, terwijl een bestuursassistent juist om de gesloten documentenset draait. Een model dat uitblinkt in het online vinden van andermans paper is daarmee geen model dat binnen je eigen kwartaalmap blijft en weigert gaten op te vullen vanaf het web.
Of modellen de daadwerkelijke opleverproducten van betaald professioneel werk kunnen maken. Het omvat 1.320 taken uit vierenveertig beroepen in de negen sectoren die het meest bijdragen aan het bruto binnenlands product van de Verenigde Staten, opgesteld door vakmensen met gemiddeld veertien jaar ervaring. De uitkomsten zijn echte werkproducten: documenten, presentaties, spreadsheets en diagrammen, beoordeeld door experts tegen de versie van de professional zelf.
Waarom het de bestuursvraag niet beantwoordt
Dit komt van alle grote publieke benchmarks het dichtst bij kantoorwerk, en toch is het niet de bestuursvraag. Het beoordeelt of het opleverproduct goed is, niet of elke bewering erin herleidbaar is naar een meegeleverd document. Een overtuigende memo met één verzonnen cijfer kan hoog scoren op kwaliteit en tegelijk het stuk zijn dat een CFO een auditbevinding kost.
Of een AI-agent kenniswerk van meerdere weken kan doen binnen een rommelige stapel bedrijfsbestanden. Vier projecten rond data science, productmanagement, bankieren en strategie bevatten eenennegentig samenhangende taken en duizenden invoerbestanden: Slack-exports, e-mails, gespreksverslagen, spreadsheets, pdf's en bestuursmateriaal. Elke taak wordt op drie manieren beoordeeld: een rubric met goed of fout voor juistheid en bronbewijs, plus twee directe vergelijkingen voor analytische kwaliteit en presentatie.
Waarom het de bestuursvraag niet beantwoordt
Van alles op deze pagina is dit de naaste buur: echte bestanden, echte opleverproducten, een expliciete controle op bronbewijs. Toch isoleert het de vijf eigenschappen niet waarvoor een bestuur tekent. Er is geen aparte score voor hoe vaak het model verzint, geen aparte score voor of het zegt dat het iets niet weet, en geen score voor het vasthouden aan huisregels in een lang gesprek. Het draait bovendien in het Engels op generiek bedrijfsmateriaal, niet op Nederlandse bestuursstukken.
Of een model de vraag kan beantwoorden die een professional daadwerkelijk zou intypen terwijl hij in een specifieke lange pdf werkt. Het bevat honderd taken in tien beroepsdomeinen, gebaseerd op 4.592 bronpagina's en beoordeeld op 1.275 afzonderlijke criteria. De hoofdscore is het aandeel pogingen waarin elk criterium slaagt, wat een bewust strenge lat is.
Waarom het de bestuursvraag niet beantwoordt
De vorm klopt, het onderwerp niet. De documenten zijn professionele pdf's, geen eigen bestuursmap met notulen, spreadsheets, slides en tegenstrijdige versies, en elke taak is één vraag over één document in plaats van een gesprek dat er veertig omspant. Het scoort bovendien niet of het model erkent dat iets ontbreekt.
Lange context
6 benchmarks
Hoeveel een model werkelijk tegelijk kan vasthouden, in plaats van het contextvenstergetal dat de leverancier afdrukt. Deze familie leverde de nuttigste correctie op marketing die er is: prestaties lopen ruim voor de geadverteerde limiet terug, en ze lopen geleidelijk terug in plaats van plotseling.
De werkelijk bruikbare lengte van het contextvenster van een model, in plaats van het getal op de verpakking. Het genereert synthetische taken op gecontroleerde lengtes in vier soorten: terugvinden, een feit via meerdere stappen volgen, veel items samenvoegen en langere vraagbeantwoording. De uitkomst is de lengte waarop een model afhaakt, en dat is wat een bestuurder te horen zou moeten krijgen.
Waarom het de bestuursvraag niet beantwoordt
De hooiberg is synthetische opvulling, niet je notulen en je jaarrekening. Echte bestuursdocumenten delen vocabulaire, herhalen elkaar en spreken elkaar tegen, wat een moeilijker en ander probleem is dan geplante variabelen in ruis vinden. RULER geeft je een plafond, geen gedrag.
Vaardigheid met lange context wanneer het antwoord niet met woordovereenkomst te vinden is. De klassieke speld-in-de-hooibergtest laat een model de zin herkennen die woorden deelt met de vraag. NoLiMa haalt die kortere weg weg door naalden te schrijven die vrijwel geen woorden met de vraag delen, zodat het model de verbinding op betekenis moet leggen.
Waarom het de bestuursvraag niet beantwoordt
Het is de scherpste beschikbare waarschuwing dat geadverteerde contextvensters de werkelijke capaciteit overdrijven, en het blijft een zoekpuzzel in fictie. Het test niet of een model wat het vond aan het juiste document toeschrijft, en evenmin of het stopt wanneer de verbinding er niet is.
Diep begrip en redeneren over realistische lange documenten, in plaats van terugvinden. Het bevat 503 moeilijke meerkeuzevragen over teksten van achtduizend tot twee miljoen woorden, in zes categorieën waaronder vraagbeantwoording over meerdere documenten, lange gespreksgeschiedenis en lange gestructureerde data. Bij elk item is bewijsmateriaal geannoteerd, zodat een beoordelaar kan controleren waar het antwoord vandaan komt.
Waarom het de bestuursvraag niet beantwoordt
Het is meerkeuze. Een bestuursassistent schrijft lopende tekst, en het hele risico zit in wat hij schrijft wanneer niemand vier opties aanbiedt. De juiste optie uit vier kiezen zegt niets over de vraag of het model een vijfde zou hebben verzonnen.
Hoe goed een model een verhaal nog begrijpt naarmate dat verhaal langer wordt. Dertig verhalen worden geknipt in versies van oplopende lengte die dezelfde kerndetails bewaren, en dezelfde zesendertig vragen worden bij elke lengte gesteld. Antwoorden vereist bijhouden wie wat wanneer wist, wat begrip is en geen zoekwerk.
Waarom het de bestuursvraag niet beantwoordt
Het materiaal is fictie uit een schrijverscommunity en de vorm is een verhaal met een tijdlijn. Bestuursmateriaal is een gemengde map met notulen, tabellen, beleidsstukken en slides, waar het lastige niet het volgen van een plot is maar het oplossen van twee documenten die elkaar tegenspreken.
Geen ranglijst maar een gecontroleerd onderzoek, en een van de nuttigste bewijsstukken die je een bestuur kunt geven. Chroma testte achttien modellen over een reeks invoerlengtes en liet zien dat prestaties niet stabiel blijven om vlak voor de limiet in te storten: ze lopen geleidelijk en ongelijkmatig terug vanaf ruim onder het geadverteerde venster. De term context rot komt uit dit werk.
Waarom het de bestuursvraag niet beantwoordt
Het is een onderzoek naar één faalwijze, geen ranglijst waar je op kunt inkopen. Het vertelt je dat een groot contextvenster geen belofte is, wat de belangrijkste correctie op leveranciersmarketing is die een bestuur kan opnemen. Het vertelt je niet welk model je moet kiezen en zegt niets over bronvermelding of eerlijkheid.
Redeneren over meerdere echte lange documenten tegelijk, bewust gebouwd om op kenniswerk te lijken in plaats van op een synthetische puzzel. Honderd moeilijke vragen komen elk met ongeveer honderdduizend tokens invoer uit bedrijfsrapporten, brancherapporten, overheidsconsultaties, wetenschappelijke papers, juridische teksten, marketingmateriaal en enquêterapporten. Antwoorden zijn niet op één plek op te zoeken, ze moeten worden samengesteld.
Waarom het de bestuursvraag niet beantwoordt
Het meet of het model over documenten heen tot het juiste antwoord komt. Het meet niet of het model laat zien van welke pagina dat komt, en het bevat geen vragen waarvan het antwoord bewust ontbreekt, precies de test die een zorgvuldige assistent van een zelfverzekerde onderscheidt.
Feitelijkheid en verankering
4 benchmarks
De familie die het dichtst bij de echte bestuursvraag komt: verzint het model dingen. FACTS Grounding controleert of een antwoord binnen een meegeleverd document blijft, Vectara telt niet-getrouwe samenvattingen, en SimpleQA is een van de weinige publieke tests die beloont dat je zegt dat je iets niet weet. Geen ervan vraagt het model te laten zien waar het antwoord vandaan komt.
Of een uitgebreid antwoord van een model binnen het meegegeven document blijft. Het bevat 1.719 voorbeelden, half openbaar en half achtergehouden, die elk een document van maximaal ongeveer tweeëndertigduizend tokens koppelen aan een opdracht zoals samenvatten, herschrijven of vragen beantwoorden. Antwoorden worden op twee dingen tegelijk beoordeeld: is de opdracht gevolgd, en wordt elke bewering door het document gedekt.
Waarom het de bestuursvraag niet beantwoordt
Dit is de publieke benchmark die het dichtst bij de feitelijkheidsmaat van een bestuur komt, en hij stopt één stap te vroeg. Er wordt gecontroleerd of beweringen door het document worden gedekt, maar het model hoeft niet aan te wijzen waar, waardoor een antwoord kan slagen zonder herleidbaar te zijn. Het werkt bovendien met één document tegelijk, terwijl een bestuursmap een set documenten is die elkaar tegenspreken.
Hoe vaak een model iets aan een samenvatting toevoegt dat het brondocument niet zegt. Elk model vat dezelfde documenten samen en een apart beoordelingsmodel, HHEM, controleert elke samenvatting tegen de bron. Het gepubliceerde getal is het aandeel samenvattingen dat als niet-getrouw wordt beoordeeld, dus lager is beter, en het is een van de weinige publieke getallen dat leest als een risicocijfer in plaats van een rapportcijfer.
Waarom het de bestuursvraag niet beantwoordt
Het meet één smal gedrag, het samenvatten van één kort tot middellang document, en Vectara zegt dat er ook expliciet bij. Een bestuursassistent beantwoordt vragen over tientallen documenten, wat een ander en zwaarder faalvlak is. Een laag hallucinatiepercentage hier is noodzakelijk en bij lange na niet voldoende.
Of een model de feiten kent die het beweert te kennen, en of het toegeeft wanneer dat niet zo is. Het bevat 4.326 korte vragen met elk één onbetwistbaar antwoord, tegendraads verzameld zodat de modellen van dat moment ze fout hadden. Belangrijk is dat het drie uitkomsten scoort in plaats van twee: goed, fout en niet geprobeerd.
Waarom het de bestuursvraag niet beantwoordt
De categorie niet geprobeerd maakt SimpleQA de naaste publieke verwant van de eerlijkheidsmaat die een bestuur nodig heeft, en het gaat over wereldkennis, niet over jouw documenten. Bereid zijn om over een historische datum te zeggen dat je het niet weet is iets anders dan durven zeggen dat een cijfer niet in de map staat terwijl een bestuurder op antwoord wacht.
Een opgeschoonde herbouw van SimpleQA: duizend prompts gefilterd op dubbele vragen, scheve onderwerpverdeling en foute antwoordsleutels, met een verbeterde beoordelingsprompt. Het bestaat omdat de oorspronkelijke set genoeg labelruis bevatte om vergelijkingen tussen dicht bij elkaar liggende modellen te vertekenen. Het meet hetzelfde, betrouwbaarder.
Waarom het de bestuursvraag niet beantwoordt
Het is een betere meetlat voor dezelfde verkeerde muur. Parametrische kennis, oftewel wat het model uit de training onthoudt, is precies waar een bestuursassistent niet op moet steunen als hij een vraag over de eigen cijfers van het bedrijf beantwoordt.
Instructies volgen
3 benchmarks
Of een model doet wat er is gezegd, en dat blijft doen. IFEval en IFBench controleren losse, mechanisch verifieerbare instructies; MultiChallenge is de enige breed gebruikte publieke test van de vraag of een regel een lang gesprek overleeft. Die laatste eigenschap bepaalt of je iets kunt delegeren.
Of een model precies doet wat er gevraagd is, met instructies die een computer zonder oordeel kan controleren. Ongeveer vijfhonderd prompts bevatten vijfentwintig soorten verifieerbare instructies, zoals schrijf meer dan vierhonderd woorden, antwoord in JSON, of begin elke alinea met een vraag. De scoring is mechanisch, dus er is geen jury en geen ruimte voor smaak.
Waarom het de bestuursvraag niet beantwoordt
Het is één instructie, één keer gecontroleerd, in één bericht. Bestuursdiscipline is een set huisregels die twintig vervolgvragen en een tegensputterende gebruiker moet overleven. IFEval test nooit of de regel bij vraag vijftien nog wordt gevolgd.
Of instructies volgen ook lukt bij beperkingen waarop het model nooit is getraind. Het introduceert achtenvijftig nieuwe en bewust onbekende verifieerbare beperkingen, juist omdat modellen zich hadden vastgetraind op de kleine set van IFEval. Het is aanvaard op NeurIPS 2025 in het spoor voor datasets en benchmarks.
Waarom het de bestuursvraag niet beantwoordt
Het is het scherpste beschikbare bewijs dat een hoge score op instructies volgen een trainingsartefact kan zijn in plaats van een vaardigheid, wat direct relevant is voor een bestuur dat een assistent huisregels wil geven. Toch test het naleving in één beurt van mechanische beperkingen, niet volgehouden naleving van een in tekst geschreven beleid.
Of een model zichzelf bij elkaar houdt over een lang gesprek. Het scoort vier dingen die in de praktijk stukgaan: een instructie uit het eerste bericht tot het einde levend houden, terloops genoemde details onthouden, een document betrouwbaar bewerken over meerdere ronden, en samenhangend blijven in plaats van meepraten met wat de gebruiker het laatst zei.
Waarom het de bestuursvraag niet beantwoordt
Dit is het publieke werk dat het dichtst bij de disciplinemaat van een bestuur komt, en het wordt gemeten op algemene conversatie, niet op een documentenset met huisregels. Niets erin controleert of de beweringen van het model naar een bron herleidbaar zijn, en de categorie zelfconsistentie gaat over de gebruiker niet naar de mond praten, niet over geen cijfers verzinnen.
Voorkeur
1 benchmark
Publiek stemmen op welk antwoord er beter uitziet. Het is de zichtbaarste ranglijst in de sector en de minst geschikte voor een inkoopbeslissing, omdat een stemmer niet kan controleren waarop hij stemt en zelfverzekerde, goed opgemaakte tekst wint.
LMArena, originating from UC Berkeley's LMSYS project, sinds 2023
Wat het meet
Welk antwoord mensen mooier vinden. Bezoekers typen een prompt, zien twee anonieme antwoorden naast elkaar en kiezen de beste; de stemmen worden een Elo-achtige rating. Het is de meest geciteerde publieke ranglijst in de sector en meet smaak op schaal, niet juistheid.
Waarom het de bestuursvraag niet beantwoordt
Een stem legt vast welk antwoord er beter uitzag voor een anonieme persoon die het niet kan controleren. Dat beloont zelfverzekerd, netjes opgemaakt en volledig ogend proza, precies de presentatievorm waarin een verzonnen cijfer binnenkomt. Niets in het mechanisme kan een juist antwoord van een overtuigend antwoord onderscheiden, en geen enkele stemmer heeft jouw documenten.
Samengestelde indices
3 benchmarks
Enkele getallen die ontstaan door meerdere benchmarks te middelen, plus de besloten testsuites die zijn gebouwd om besmetting te verslaan. Ze zijn handig en verbergen precies wat een bestuur moet zien, want een gewogen gemiddelde kan een model eerste zetten terwijl het laatste staat op de ene eigenschap die telt voor bestuursstukken.
Eén getal dat meerdere benchmarks combineert, zodat inkopers één ranglijst hebben om naar te wijzen. Versie 4.3 mengt tien evaluaties tot vier gewogen categorieën: agents dertig procent, algemene bekwaamheid dertig procent, programmeren twintig procent en wetenschappelijk redeneren twintig procent. De lijst met onderdelen is openbaar, wat het een van de transparantere samengestelde scores maakt.
Waarom het de bestuursvraag niet beantwoordt
Een samengestelde score erft de blinde vlekken van elke benchmark erin, en deze bevat geen maat voor bronvermelding en geen maat voor of een model toegeeft iets niet te weten. Middelen verbergt bovendien precies wat een bestuur moet zien: een model kan in totaal eerste staan en laatste op de ene eigenschap die bepaalt of je de uitvoer naar de auditcommissie kunt doorsturen.
Scale AI, Safety Evaluations and Alignment Lab, sinds 2024
Wat het meet
Een familie van meer dan twintig ranglijsten op evaluatiesets die bewust besloten blijven, zodat modellen er niet op getraind kunnen worden. De onderwerpen lopen van agentische en software-engineeringvaardigheid tot redeneren aan de voorhoede en veiligheidsgedrag, met prompts geschreven en beoordeeld door geverifieerde vakexperts. De besloten set is de kern: het is een direct antwoord op besmetting.
Waarom het de bestuursvraag niet beantwoordt
Beslotenheid lost besmetting op en creëert een ander probleem: je moet het resultaat op vertrouwen aannemen, omdat je de vragen niet kunt inzien en niet kunt controleren of ze op jouw werk lijken. De domeinen zijn bovendien onderzoeks- en engineeringdomeinen, geen Nederlandse bestuursmap, en er is geen aparte score voor bronvermelding of eerlijkheid.
LiveBench (Abacus.AI, New York University and academic collaborators), sinds 2024
Wat het meet
Een algemene bekwaamheidsbenchmark die zo is ontworpen dat de vragen niet in de trainingsdata kunnen hebben gezeten. Ongeveer een zesde van de vragen wordt elke maand vervangen, geput uit recent verschenen papers, nieuws en datasets, zodat de hele set twee keer per jaar ververst. Alles wordt beoordeeld tegen een objectieve antwoordsleutel, zonder model als jury.
Waarom het de bestuursvraag niet beantwoordt
Het is de beste beschikbare verdediging tegen besmetting binnen de algemene bekwaamheidsbenchmarks, en de categorieën blijven redeneren, programmeren, wiskunde, data-analyse, taal en instructies volgen. Geen daarvan is trouw aan een documentenset, en geen daarvan scoort wat er gebeurt als het antwoord er simpelweg niet is.
De twee die het dichtst komen, en wat de Index toevoegt
Twee benchmarks uit 2026 komen dicht in de buurt, en dit argument zou zonder hen oneerlijk zijn: AA-Briefcase en GDP.pdf, allebei in de familie agents hierboven. Geen van beide beantwoordt de vijf vragen, en hun eigen documentatie legt uit waarom. AA-Briefcase draait elke taak los, waardoor continuïteit binnen een project niet wordt getest, het is een besloten evaluatie, en twee van de drie scores zijn voorkeursvergelijkingen. GDP.pdf werkt één vraag tegelijk tegen één document en scoort niet of het model erkent dat iets ontbreekt. Beide draaien in het Engels. Wat de Index toevoegt staat in sectie 02 en 03: een paginaverwijzing per bewering, een Nederlandse bestuursmap, en een cijfer voor het benoemen van het gat.
Niets hiervan maakt de benchmarktabel van een leverancier oneerlijk. Het maakt hem onvolledig op een controleerbare manier. Drie vragen maken zo'n tabel bruikbaar voor een bestuur: uit welke familie komt elk getal, welke van de vijf vragen beantwoordt die familie, en wat zeggen de makers dat hun test niet kan.
05Voor wie dit is
Voor wie dit is, hoe we onafhankelijk blijven en de weg naar november
De Index is een due-diligencedocument voor de mensen die tekenen, geen ranglijst voor engineers. Dit hoofdstuk vertelt welke balk in welke stoel het zwaarst weegt, wat er in de eerste editie komt en wat wij beloven, zodat je de cijfers kunt aanvechten.
Een scorekaart is pas bruikbaar als je weet welke regel je als eerste leest. Een bestuursvoorzitter, een financieel directeur en een technisch directeur kijken naar dezelfde vijf balken en trekken andere conclusies, omdat ze andere risico's dragen.
Eén weging geldt voor iedereen, vastgelegd voordat er één model is gemeten, zodat totalen vergelijkbaar blijven. Wat per stoel verschilt, is de balk die je vóór het totaal leest.
Drie stoelen, drie eerste vragen
De CEO
Leest eerlijkheid eerst
20 procent van het totaal
Een bestuursvoorzitter beslist of één assistent alles mag lezen: de strategie, de notulen, de deal die nog niet getekend is. De duurste fout is geen verkeerd getal, maar een zelfverzekerd antwoord op een vraag die de documenten niet kunnen beantwoorden.
Een financieel directeur kan geen antwoord doorsturen dat geen bron heeft. Feitelijkheid zegt hoe vaak een model iets verzint; bronvermelding zegt hoe snel je kunt aantonen dat het dat niet deed.
Een technisch directeur tekent voor de plek waar documenten worden verwerkt en voor wat de assistent nog doet na twintig vervolgvragen die hem van zijn huisregels proberen af te brengen.
Wie een benchmarktabel van een leverancier kreeg met de vraag een besluit te nemen, zit in de vierde stoel. De lange versie, per rol, staat in de rolgids: Welk AI-model voor welke bestuursrol.
Wat in de eerste editie meedoet
De eerste editie neemt elk actueel topmodel uit de onderzoekslijst achter dit cluster mee, vandaag 13, en voegt de generatie daaronder toe overal waar die met dataresidentie binnen de Europese Unie kan draaien, 11 extra: 24 modellen, afgeleid uit de data en niet met de hand gekozen. Uitgefaseerde modellen krijgen feiten en een verwijzing naar hun opvolger, nooit een score.
De EU-geschikte laag doet mee om een reden. In september 2026 is de EU-dekking van de drie nieuwste Amerikaanse topmodellen in de eigen documentatie van hun leveranciers dun: één heeft één gedocumenteerde route met dataresidentie binnen de Europese Unie, één heeft alleen een EU-multiregioroute en één heeft er geen, terwijl de generatie eronder breed beschikbaar is in Europese regio's. De vraag is niet langer of Europa mogelijk is, maar wat één modelgeneratie je waard is.
Modellen met open weights en EU-gehoste installaties lezen dezelfde 799 pagina's en beantwoorden dezelfde ronde van 120 vragen, gescoord tegen dezelfde antwoordsleutel als de Amerikaanse topmodellen. Geen kortere test, geen aparte ranglijst. 16 actuele modellen publiceren hun gewichten, zodat een bestuur de test op eigen hardware kan herhalen.
242424modellen die meedoen
Actuele topmodellen13 modellen, 54%
EU-geschikte laag eronder11 modellen, 46%
Scope van de eerste editie: 24 modellen, waarvan 13 actuele topmodellen en 11 modellen uit de laag daaronder die met dataresidentie in de EU kunnen draaien.
Segment
Value
Share
Actuele topmodellen
13
54%
EU-geschikte laag eronder
11
46%
Afgeleid uit de modellenlijst achter dit onderzoekscluster, september 2026. Afbakening, geen resultaat: er is nog geen enkel model gescoord.
Hoe we onafhankelijk blijven
Hoe een leverancier erin komt
Er is geen aanmeldformulier: opname is geen gunst. Vijf stappen, en een leverancier heeft op één daarvan invloed.
01Het model heeft een publieke API en de leverancier merkt het aan als actueel. Dat is de enige toegangsvoorwaarde.
02Wij leggen versie, datum en instellingen vast en draaien daarna de volledige ronde op standaardinstellingen, binnen één venster voor alle modellen.
03Feitelijkheid en bronvermelding worden gescoord tegen de antwoordsleutel. Eerlijkheid en discipline scoren mensen tegen de gepubliceerde rubric.
04De leverancier krijgt twee weken voor publicatie zijn eigen scorekaart. Hij mag reageren of een meetfout aanwijzen; over een getal onderhandelen kan niet.
05De scorekaart verschijnt met die reactie ernaast. Een model dat tussen edities uitkomt, krijgt binnen vier weken een tussentijdse meting.
Een leverancier die liever niet meedoet, wordt alsnog gemeten, op de publieke API. Meedoen levert een recht op reactie op, geen veto.
De weg naar november 2026
Geplande data, geen garanties. Loopt een stap uit, dan meldt deze pagina dat.
sep 2026voorbereiding
De documentenset gaat op slot
Het bedrijf, de documenten en de vallen veranderen niet meer. Een testset die beweegt kan geen modellen vergelijken.
sep 2026publicatie
De prompt en de rubric worden openbaar
De systeemprompt, de rubric en de voorbeeldvragen, voordat er een score bestaat.
okt 2026meting
Het meetvenster
Elk model dat meedoet draait binnen hetzelfde venster, op de versie en de instellingen die bij aanvang zijn vastgelegd.
okt 2026beoordeling
Scoren en het reactievenster
Scoren tegen de antwoordsleutel, daarna twee weken waarin elke leverancier zijn kaart ziet.
nov 2026publicatie
Eerste editie van de AI Board Model Index
Vijf balken per model, de kosten per werkweek naast de score, de meetdata en de reacties van leveranciers zoals ingestuurd.
nov 2027gepland
Daarna één editie per jaar
Elke november een jaareditie, met tussentijdse metingen ertussenin.
Wat er in november op deze pagina verandert
Als de eerste editie er is, verandert deze pagina op één plek: het blok dat een komende index aankondigt, wordt vervangen door de ranglijst zelf. De rest blijft staan waar het staat.
Dat is bewust. De enige manier om te laten zien dat een methode niet naar haar uitkomst is toegeschreven, is haar maanden voor die uitkomst publiceren.
Waarom nu
Drie gepubliceerde cijfers verklaren waarom dit in 2026 wordt gebouwd en niet pas als de markt tot rust komt.
71%71%71%
van de bestuursvoorzitters noemt AI een topprioriteit voor investeringen
Volgens de 2025 Global CEO Outlook van KPMG, gebaseerd op 1.350 bestuursvoorzitters die in augustus en september 2025 zijn ondervraagd, noemt 71 procent AI een topprioriteit voor investeringen en verwacht 69 procent er binnen een jaar een tiende tot een vijfde van het budget aan te besteden.
77%77%77%
noemt de gereedheid van de eigen medewerkers als belemmering
In hetzelfde KPMG-onderzoek liggen de belemmeringen binnen de organisatie en niet bij de techniek: 77 procent wijst op de gereedheid en bijscholing van medewerkers, 75 procent op het inpassen van AI in bestaande bedrijfsprocessen.
22,7%22,7%22,7%
van de Nederlandse bedrijven met tien of meer werknemers gebruikte AI in 2024
Het CBS meldde in februari 2025 dat 22,7 procent van de Nederlandse bedrijven met tien of meer werknemers in 2024 AI-technologie gebruikte, tegen 14 procent een jaar eerder, oplopend tot 59,2 procent bij bedrijven met 500 of meer werknemers.
Er wordt sneller geld vastgelegd dan er bewijs wordt geproduceerd, en het bewijs dat er is, is voor onderzoekers geschreven. Dat gat is waar de Index voor is.
06Grenzen, vragen en bronnen
Wat deze pagina niet is
De AI Board Model Index is nog niet uitgevoerd. Deze afsluitende sectie zegt precies wat er ontbreekt, wat illustratief is, wat er vóór de eerste meting nog kan veranderen, en hoe je ons vertelt dat we ernaast zitten.
Grenzen van deze pagina
Er zijn nog geen resultaten
De Index is nog niet uitgevoerd. Alles hierboven is methode: de vijf dingen die we willen meten, de documentenset, de mix van vragen, de scoringsrubric en de regels die de oefening eerlijk houden. Tot november 2026 beschrijft iedereen die je vertelt hoe een model op deze Index presteert iets wat niemand heeft gemeten.
Dat geldt ook voor ons. Delen van dit protocol zijn intern gedraaid tijdens het bouwen van het product, en die runs publiceren we bewust niet. Ze gebruikten een eerdere documentenset, modelversies die inmiddels zijn vervangen, geen vast meetvenster en geen beoordelaars van buiten. Getallen die zo tot stand komen zijn bruikbaar voor een technische keuze en waardeloos als publieke meting, dus ze blijven waar ze horen.
Elke scorekaart hier is illustratief
De scorekaart in de openingssectie, en elke balk, meter of kaart op deze pagina die op een resultaat lijkt, bevat verzonnen waarden. Ze laten de vorm van de uitkomst zien. Er staat geen echte modelnaam naast, en geen enkele waarde komt uit een meting. Een schermafbeelding van zo'n figuur is een schermafbeelding van een blauwdruk.
De methode kan nog wijzigen
De methodologie ligt vast vóórdat het meetvenster opengaat, niet nadat het sluit, en dat is precies waarom we hem nu publiceren. Vooraf vastleggen betekent niet bevriezen op 8 september 2026. Tussen die datum en de eerste ronde kunnen we wegingen bijstellen, een vraagcategorie toevoegen of laten vervallen, of veranderen hoe een gedeeltelijke bronvermelding scoort. Wat niet gebeurt, is een wijziging zodra het venster open is, of nadat we een uitkomst zagen die ons niet beviel. Elke wijziging vóór de ronde leggen we vast, met datum, en publiceren we bij de eerste editie.
Twee problemen uit de bredere benchmarkwereld hebben deze regels gevormd. Het eerste is besmetting: op gepubliceerde testsets wordt getraind, en de auteurs van LiveBench (2024) noemen zelfs een benchmark die elke maand een deel van zijn vragen vervangt besmettingsbeperkt in plaats van besmettingsvrij. Daarom blijven de documenten en de exacte vragen ongepubliceerd, terwijl de opbouw, de systeemprompt, de rubric en de wegingen dat niet doen. Het tweede is vergelijkbaarheid: de registratie van SWE-bench Verified door Epoch AI laat zien hoe snel een gedeelde benchmark onvergelijkbaar wordt zodra labs over verschillende deelverzamelingen rapporteren. Daarom meten we elk model binnen één venster, op een met naam genoemde versie, met de standaardinstellingen van de leverancier.
Hoe je een correctie doorgeeft
Klopt er iets niet op deze pagina, dan horen we dat liever vóór november dan erna. Een feitelijke fout, een model dat we missen, een vraagcategorie die oneerlijk zou uitpakken voor een bepaalde architectuur, een hostingroute die we verkeerd beschrijven: stuur het en we lezen het. De contactgegevens staan op de pagina over ons. Leveranciers hebben de eigen route die hierboven staat beschreven.
Vragen die een directie stelt over de Index
Twaalf vragen die ons het vaakst bereiken over afbakening, onafhankelijkheid en scoring. Waar een antwoord naar een andere pagina verwijst, staat de link in de lijst hieronder.
Wat is de AI Board Model Index?+
Het is een jaarlijkse meting van AI-modellen op één vraag: kun je dit model de documenten van je directie toevertrouwen? Elk actueel model krijgt dezelfde set realistische bedrijfsdocumenten, dezelfde vaste lijst vragen, en een score op vijf dingen die een manager zonder woordenlijst begrijpt: geheugen, feitelijkheid, eerlijkheid, bronvermelding en discipline. Het is bewust geen benchmark voor engineers, dus we meten geen programmeerwerk, snelheid of creativiteit. De eerste editie verschijnt in november 2026, dus op deze pagina staan nog geen resultaten, alleen de methode.
Wanneer verschijnen de eerste resultaten?+
November 2026. Tot die tijd beschrijft deze pagina alleen de methode: er staat hier geen ranglijst, geen score en geen voorproefje, en een scorekaart op deze pagina is een illustratie van het format met verzonnen waarden en zonder echte modelnaam ernaast. Het meetvenster staat gepland voor oktober, gevolgd door scoring, beoordeling en het recht op reactie van leveranciers. Een model dat tussen edities verschijnt, krijgt binnen enkele weken een tussentijdse meting met dat label, en een definitieve score bij de volgende jaareditie. Het landschapsrapport op deze site, AI-modellen voor bestuurders 2026, beschrijft wat er nu is.
Is de Index onafhankelijk?+
We publiceren de regels die dat controleerbaar maken, in plaats van om vertrouwen te vragen. Geen enkele leverancier betaalt voor opname of plaatsing, er zijn geen affiliate-links, en de methodologie ligt vast en is gepubliceerd vóór de meting in plaats van achteraf bijgesteld. AI Board heeft geen eigen model te verdedigen, want het product draait op het model dat jij kiest, en juist daarom hebben we een eerlijk beeld van alle modellen nodig. Waar een commerciële relatie met een leverancier bestaat, vermelden we die naast de scorekaart van die leverancier. Oordeelsvragen scoren we tegen een uitgeschreven rubric, en we willen bij de editie beoordelaars van buiten het bedrijf met naam noemen. Het zijn beloften, geen certificeringen: niemand controleert ze behalve wijzelf.
Hoe komt een leverancier in de Index?+
Opname is gratis en niet te koop. Elk model met een publieke interface van een lab binnen de afbakening, dat de leverancier zelf als actueel aanmerkt, komt in aanmerking, en we nemen het op zonder dat erom gevraagd wordt. Ben je een lab en denk je dat je model ontbreekt, of dat we op de verkeerde versie of instellingen gaan testen, laat het weten voordat het meetvenster sluit en we gebruiken de versie die jij noemt. Elke leverancier ziet zijn eigen scores vóór publicatie en mag reageren; die reactie publiceren we. Scores wijzigen alleen bij een aangetoonde meetfout.
Waarom gebruiken jullie niet gewoon de bestaande AI-ranglijsten?+
Omdat ze een andere vraag beantwoorden, en dat goed doen. Publieke ranglijsten meten examenkennis, onderzoekspuzzels, programmeren en voorkeur tussen twee antwoorden. Niets daarvan vertelt een bestuurder of het model een cijfer in een bestuursmemo verzint, toegeeft dat een kwartaal in de map ontbreekt, of zich na twintig vervolgvragen nog aan de huisregels houdt. Dat zijn de faalvormen die een managementteam geloofwaardigheid kosten. De Index meet precies die, op documenten die lijken op wat al in je eigen schijf staat.
Wat wordt er precies gemeten?+
Vijf dingen. Geheugen: hoeveel van een grote documentenset het model diep in die set nog correct verwerkt, uitgedrukt in bestuursstukken in plaats van tokens. Feitelijkheid: hoe vaak een antwoord iets bevat dat niet in de documenten staat. Eerlijkheid: of het zegt dat het iets niet weet als het antwoord er echt niet is. Bronvermelding: of een antwoord naar het juiste document en de juiste pagina verwijst. Discipline: of het zich onder twintig vragen druk aan de huisregels houdt. Feitelijkheid en bronvermelding wegen het zwaarst, want samen bepalen ze of een uitkomst het pand mag verlaten.
Op welke documenten testen jullie?+
Een fictief maar realistisch Nederlands mkb-bedrijf, speciaal daarvoor gebouwd: strategie, notulen, jaarrekening, kwartaalrapportages, HR-beleid, contracten, een slidedeck, begrotingen, prognoses en interne memo's. De set bevat bewust de rommeligheid van een echt bedrijf. Documenten spreken elkaar tegen, een kwartaal ontbreekt, een verouderd organogram staat naast het actuele, en sommige kerncijfers bestaan alleen in een tabel op een slide. Er wordt geen echte bedrijfsdata gebruikt, er komen geen klantdocumenten aan te pas, en dezelfde set gaat binnen hetzelfde venster naar elk model.
Waarom publiceren jullie de testset niet?+
Omdat er op gepubliceerde testsets getraind wordt, en op de dag dat dat gebeurt betekent de meting niets meer. Wat we wel publiceren, is alles wat nodig is om de methode te beoordelen: de opbouw van de documentenset, de mix van vraagsoorten, voorbeeldvragen per categorie, de volledige systeemprompt, de scoringsrubric en de wegingen. Dat is genoeg voor een kritische lezer om te bepalen of de test eerlijk is, en te weinig om een model er stilletjes op te optimaliseren vóór de volgende editie. De volledige methodologie verschijnt met de eerste editie in november 2026.
Wie scoort er, en kan een leverancier een score aanvechten?+
Feitelijke antwoorden en bronvermeldingen controleren we tegen een vaste antwoordsleutel, automatisch gescoord en steekproefsgewijs met de hand nagelopen. De oordeelsvragen, eerlijkheid en discipline, worden door mensen gescoord tegen een uitgeschreven rubric; we willen bij de editie beoordelaars van buiten het bedrijf met naam noemen. Elke leverancier ziet zijn eigen resultaten vóór publicatie en mag reageren; die reactie plaatsen we naast de score. Een score wijzigt alleen bij een aangetoonde meetfout, en die correctie publiceren we erbij. Over scores wordt niet onderhandeld, en geen leverancier ziet de resultaten van een ander vooraf.
Worden EU-hostbare modellen op dezelfde test gemeten?+
Ja, op exact dezelfde documenten en dezelfde vragen. Bij elk model vermelden we of het binnen de EU kan draaien en via welke route, maar hosting telt niet mee in de score, want het is een eis en geen kwaliteit. De interessante uitkomst is het verschil: hoeveel nauwkeurigheid en bronkwaliteit levert een directie in als ze eist dat documenten Europese infrastructuur nooit verlaten? Dat verschil is de werkelijke prijs van een hostingeis, en wij hebben het nog nergens zorgvuldig gemeten zien worden. De routes zelf staan in het landschapsrapport, AI-modellen voor bestuurders 2026.
Scoort AI Board zijn eigen product?+
Nee, en dat zou ook nergens op slaan. De Index scoort modellen, en AI Board is geen model: het is de assistentlaag eromheen, met jouw documenten, rechten en huisregels. Er staat geen AI Board-vermelding in de ranglijst en die komt er ook niet. De modellen waarop het product kan draaien, worden gemeten als elk ander model en staan met naam op de editiepagina. Ons belang is het omgekeerde van dat van een leverancier, want het product draait op het model dat jij kiest, dus we hebben een eerlijk beeld van alle modellen nodig, ook van de modellen die we zelf niet zouden kiezen. Wat het product wel is, lees je op de pagina over het bedrijfsbrein.
Hoe gebruikt een directie de Index in een besluit?+
Als één input in een inkoopdossier, niet als vonnis. Gebruik hem om een longlist tot een shortlist terug te brengen, om te zien welke kandidaten aan je hostingeis voldoen, en om de auditcommissie een schriftelijke onderbouwing te geven die geen leveranciersslide is. Draai die shortlist daarna op je eigen documenten, want jouw archief is rommeliger dan elke testset en jouw vragen zijn van jou. De rollengids, Welk AI-model voor welke bestuursrol, beschrijft wat je per rol test en in welke volgorde.
Verwante pagina's
De pagina's waar de antwoorden hierboven naar verwijzen:
82Google Cloud docs, data residency for Gemini EnterpriseEU multi-region: at-rest DRZ and MLP supported for Gemini 3.5 Flash and Gemini 2.5 Pro; Gemini 3.8 Flash and the Claude Fable 5 line (Claude Fable 5.1 as of September 2026) on the eu multi-region endpoint only (no EU regional endpoint); Gemini 3.1 Pro preview no EU DRZ or MLP. Re-read 8 Sep 2026.Geraadpleegd 8 sep 2026
De Index bestaat om één reden: een managementteam dat kan zien welk model te vertrouwen is, beslist op bewijs in plaats van op een leveranciersslide.
Word AI-native vóór je concurrentie
Surf mee op de AI-golf in plaats van erachteraan te zwemmen. Vraag toegang aan, dan plannen we je installatie in.
Je bedrijfsbrein staat op je eigen laptop. Jij kiest of een vraag naar een cloudmodel gaat of volledig lokaal blijft.