Naar de hoofdinhoud

Het bewijs

Scorebord

Het oorspronkelijke doel is gehaald: GPT-NL op alle zes gepubliceerde benchmarks minimaal evenaren. Vijf keer erboven, op dbrd gelijk. WikiLingua-nl valt buiten de vergelijking, want daar wisselde de metriek. Walnoot 8B telt 8,05 miljard parameters tegen 26,03 miljard van GPT-NL.

Evaluatieframework
EuroEval 17.6.0
Model
Walnoot 8B Instruct 1.0
Bijgewerkt
17 september 2026
Een walnoot naast de bek van een stalen schuifmaat, van bovenaf op een donkere leistenen plaat.

Alle taken

Hoe verhoudt Walnoot 8B zich tot GPT-NL?

10 taken, dunste marge eerstEuroEval 17.6.0Alle 10 Nederlandse taken van EuroEval 17.6.0. Kolommen: taak, soort, metriek, onze score, het gepubliceerde cijfer van GPT-NL, de marge en de uitkomst. Het 95%-interval staat in de tabel onder de beslisregel.
TaakSoortMetriekWalnoot 8BGPT-NLMargeUitkomst
dbrdSentimentMCC90,5690+0,56gelijkspel
conll-nlEntiteitsherkenningmicro-F1 (no-MISC)46,5236+10,52gewonnen
squad-nlBegrijpend lezenEM62,0851+11,08gewonnen
scala-nlTaalkundige correctheidMCC34,4119+15,41gewonnen
hellaswag-nlAlledaags redenerenMCC22,46−2+24,46gewonnen
mmlu-nlKennisMCC37,162+35,16gewonnen
Zonder vergelijkingsbasis
wikilingua-nlSamenvattenChrF3++34,18geen gepubliceerde scoregeen gepubliceerde scoremetriekwissel
duidelijke-taalBegrijpelijke taalMETEOR52,95geen gepubliceerde scoregeen gepubliceerde scoregeen publicatie
valeu-nlEuropese waardenEuropeanValues2,02geen gepubliceerde scoregeen gepubliceerde scoregeen publicatie
mbbq-nlStereotyperingbias-gecorrigeerde accuratesse27,72geen gepubliceerde scoregeen gepubliceerde scoregeen publicatie
Voetnoten bij de tabel
  1. Op punten staan wij hier met 90,56 tegen 90 voor. Ons betrouwbaarheidsinterval loopt van 89,76 tot 91,35 en hun cijfer valt daarbinnen, dus onze regel noemt dit gelijkspel. Een hermeting liet eerder zien dat alleen al de GPU-parallelvorm dit cijfer 0,32 punt kan verschuiven.
  2. De metriek staat er voluit omdat er twee schalen naast elkaar bestaan. Wij toetsen op micro-F1 zonder MISC, want de gepubliceerde 36 van GPT-NL staat op diezelfde schaal. Inclusief MISC meet Walnoot 8B 29,13. Dat tweede cijfer staat in de ruwe logs en daarom staat het hier ook.
  3. Op deze taak wisselde de metriek tussen beide metingen. GPT-NL publiceerde 61 op BERTScore en wij meten 34,18 op ChrF3++. Die getallen staan op verschillende schalen, dus wij zetten ze nooit naast elkaar. Draait GPT-NL zijn model op ChrF3++, dan vergelijken we alsnog.
  4. Deze taak meet het herschrijven naar begrijpelijke taal. GPT-NL publiceerde hier geen cijfer, dus er valt niets naast te leggen. Deze tabel voert per taak de primaire metriek van het evaluatieframework. Dat is hier METEOR; alleen bij squad-nl wijken wij daarvan af omdat het gepubliceerde cijfer van GPT-NL op die andere maat staat.
  5. 2,02 is de laagste score van de hele suite. Wij hebben deze dataset intern als niet-citeerbaar aangemerkt; het lessenregister voert dat als EV-5 met status open. GPT-NL publiceerde hier geen cijfer.
  6. De metriek corrigeert de accuratesse voor de voorkeur die het model bij dubbelzinnige vragen laat zien. GPT-NL publiceerde hier geen cijfer. De score staat er omdat deze taak bij de officiële Nederlandse suite van EuroEval 17.6.0 hoort.

Een streepje betekent dat GPT-NL daar geen cijfer publiceerde en dan valt er ook geen marge te rekenen.

Bron van de GPT-NL-kolomTNO, GPTNL-DEL-4002, december 2025, pagina 44 tot 49. Gemeten op EuroEval 15.16.0, gepind in §3.6.3 op pagina 96.

De beslisregel

Wanneer telt een taak als gewonnen?

Winst heet pas winst als ons hele betrouwbaarheidsinterval boven hun cijfer ligt. Verlies pas als het er volledig onder ligt. Valt hun cijfer binnen ons interval, dan staat er gelijkspel. Dat geldt ook op een taak waar wij op punten voorstaan.

Het interval per taak

Elke taak die wij meten heeft een interval. Waar GPT-NL een cijfer publiceerde, staat dat ernaast.

Het 95%-interval per taak. Kolommen: taak, het cijfer van Walnoot 8B, het 95%-interval, het gepubliceerde cijfer van GPT-NL en of dat cijfer binnen de grenzen valt. Zonder gepubliceerd cijfer van GPT-NL valt er niets te toetsen.
TaakWalnoot 8B95%-intervalGPT-NLValt
dbrd90,5689,76–91,3590erbinnen
conll-nl46,5244,49–48,5536eronder
squad-nl62,0861,42–62,7351eronder
scala-nl34,4131,00–37,8119eronder
hellaswag-nl22,4620,73–24,19−2eronder
mmlu-nl37,1636,19–38,132eronder
wikilingua-nl34,1832,74–35,62geen gepubliceerde scoreniets te toetsen
duidelijke-taal52,9551,11–54,78geen gepubliceerde scoreniets te toetsen
valeu-nl2,021,41–2,64geen gepubliceerde scoreniets te toetsen
mbbq-nl27,7226,17–29,27geen gepubliceerde scoreniets te toetsen

Meetregime

Hoe is er gemeten?

Wij maten onze kolom met EuroEval 17.6.0 op de test-split, in 10 iteraties en met bf16-gewichten. De GPT-NL-kolom is hun eigen publicatie van december 2025 op EuroEval 15.16.0, interim-scores van het basismodel, gepubliceerd als puntscores zonder interval bij de cijfers die wij overnemen. Er zit twee hoofdversies verschil in het evaluatieframework. Over versies heen is de datasetinhoud niet gegarandeerd identiek. Daarom vermelden we bij iedere vergelijking expliciet welke versie is gebruikt.

Regime
test-split, 10 iteraties, bf16, nul mislukte instances

De kolom van GPT-NL

Waarom meten wij GPT-NL niet zelf?

GPT-NL publiceert geen gewichten, dus niemand buiten het consortium kan dat model draaien. Wij hebben het daarom nooit zelf gemeten. Deze tabel zet ons gemeten cijfer naast hun gepubliceerde cijfer.

GPT-NL, het model dat met publieke middelen voor het Nederlands wordt gebouwd, was het doel en de meetlat van dit project. Wij namen zijn eisen aan de data over. Apertus is het basismodel waarop Walnoot is doorgetraind; het instructiemodel van Apertus zelf maakte in zijn nabewerking andere keuzes dan wij, met een bredere datamix. Andere open modellen maakten andere keuzes in data en herkomst. Deze pagina vergelijkt met GPT-NL, omdat dat de vraag was die wij stelden.

Narekenen

Reken elk cijfer zelf na

pip install "euroeval[all]==17.6.0" && euroeval --model WAINUT/walnoot-8b-instruct --language nl --num-iterations 10 --dataset dbrd --dataset scala-nl --dataset conll-nl --dataset squad-nl --dataset wiki-lingua-nl --dataset mmlu-nl --dataset hellaswag-nl --dataset duidelijke-taal --dataset valeu-nl --dataset mbbq-nl --evaluate-test-split

Het commando installeert EuroEval 17.6.0, dezelfde versie waarmee wij hebben gemeten.

De evaluatie en de vergelijking met GPT-NL zijn door een onafhankelijke tester nagerekend op de nieuwste versie van EuroEval.

Dank aan Edwin Rijgersberg voor de feedback.