Van waarden naar benchmarks: hoe kies je een LLM voor de overheid?
Dit artikel is gebaseerd op het arXiv-paper From Values to Benchmarks: Evaluating LLMs for Governmental Use in Dutch.
De tijd van principes is voorbij. We hebben genoeg intentieverklaringen over verantwoorde AI. De AI Act eist concrete naleving. BIO2 eist meetbare beveiliging. De burger verwacht dat een overheidschatbot geen onzin vertelt over uitkeringen. We vragen niet langer wat belangrijk is. We moeten meten hoe het werkt.
Een onderzoeksgroep werkte samen met een grote Nederlandse gemeente. Zij ontwikkelden het "Grip on LLMs" framework. Ze evalueerden meer dan 30 meertalige modellen op zes dimensies. De resultaten zijn confronterend. Geen enkel model wint op alles. Een model dat feitelijk correct is, is niet automatisch eerlijk.
Dat laatste is precies waar overheidsorganisaties zich op verkijken. We denken dat factuality hetzelfde is als betrouwbaarheid. Dat is het niet.
Het probleem met LLM-selectie in de publieke sector
Elke gemeente die ik spreek worstelt met dezelfde vraag. Welk model gebruiken we voor onze interne kennissystemen, onze burgercommunicatie, onze documentanalyses? De markt biedt tientallen opties. OpenAI, Anthropic, open-source modellen van Mistral, Llama, Qwen. Iedereen claimt het beste te zijn. De benchmarks die leveranciers publiceren, meten echter zelden wat de overheid nodig heeft.
Standaard benchmarks zoals MMLU of HellaSwag testen algemene kennis. Ze testen niet of een model begrijpt hoe de Participatiewet werkt. Ze testen niet of een model weigert om gevoelige persoonsgegevens te verwerken. Ze testen niet wat een model kost op de schaal van een ministerie met miljoenen verzoeken per jaar.
Het "Grip on LLMs" framework pakt dit anders aan. Het definieert zes dimensies die er voor de overheid toe doen. Het evalueert modellen daar systematisch op. De dataset en methodologie zijn openbaar beschikbaar op arXiv. Dat maakt dit een referentiepunt. Het is geen marketingverhaal.
Zes dimensies die er echt toe doen
Het framework onderscheidt zes dimensies. Ik loop ze door. De keuze voor deze dimensies is zelf al een statement.
Factuality meet of een model feitelijk correcte antwoorden geeft. Dit is de klassieke dimensie. De implementatie is interessant. Het team gebruikte Nederlandse overheidsdocumenten als ground truth. Geen Engelstalige encyclopedieën.
Honesty meet of een model toegeeft dat het iets niet weet. Dit is iets anders dan factuality. Een model kan een feitelijk correct antwoord geven. Het wekt dan de indruk van alwetendheid. Of het kan een antwoord verzinnen dat toevallig klopt. Het model weet dan niet waarom. Honesty gaat over de relatie tussen het antwoord en de interne staat van het model. Een eerlijk model zegt "ik weet dit niet" wanneer de onderliggende kennis ontbreekt.
Social bias meet vooroordelen over geslacht, etniciteit, leeftijd en sociaaleconomische status. Voor een overheid is dit belangrijk. Een uitkeringsadvies dat onbewust discrimineert op etniciteit is immoreel. Het is ook juridisch onhoudbaar onder de Algemene wet gelijke behandeling.
Energy consumption spreekt voor zich. Datacenters van overheidsorganisaties moeten voldoen aan CO2-reductiedoelstellingen. Een model dat 10x meer energie verbruikt voor hetzelfde antwoord is duurder. Het is ook vervuilender.
Cost is de totale eigendomskost. Infrastructuur, API-kosten, onderhoud, fine-tuning. Voor een gemeente met een beperkt ICT-budget is dit vaak de bepalende factor.
Training data transparency meet in hoeverre de herkomst van trainingsdata bekend is. Dit raakt direct aan de AVG. Als een model getraind is op persoonsgegevens zonder rechtsgrondslag, dan is het gebruik daarvan problematisch.
De resultaten: niemand wint alles
De evaluatie van 30+ modellen levert een duidelijk beeld op. Ik vat de belangrijkste bevindingen samen. Ik raad aan om het volledige paper te lezen.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.