95% zeker is niet genoeg: waarom probabilistische AI-audits botsen met NIS2
Een auditbot die met 95% zekerheid zegt dat je compliant bent, is voor een toezichthouder net zoveel waard als een monteur die met 95% zekerheid zegt dat je remmen werken. NIS2, BIO2 en de AI Act vragen geen waarschijnlijkheid. Ze vragen een duidelijk antwoord: je voldoet, of je voldoet niet. Dat spanningsveld staat centraal in een nieuw paper over multi-agent LLM’s en het Duitse IT-Grundschutz, het zusterframework van onze BIO2. De conclusie is simpel en ongemakkelijk: de techniek werkt, maar de uitkomst is onbruikbaar zonder menselijke controle.
Ik moest eraan denken toen ik onlangs bij een middelgrote thuiszorgorganisatie keek naar hun zelfontwikkelde compliance-dashboard. Een RAG-pipeline (retrieval-augmented generation) doorzocht hun configuratiebestanden en interne documentatie. Per NIS2-maatregel kreeg je een score: “92% match met controle 5.7, beveiliging van netwerkdiensten.” Mooi groen vinkje. Tot ik vroeg of iemand de onderliggende evidence had bekeken. De pipeline had een verouderd change request als bewijs gebruikt. De firewallregels liepen in werkelijkheid twee maanden achter. Het model was overtuigd. Maar fout. Dat is precies het probleem dat het paper “Probabilistic Agents in Deterministic Audits” blootlegt.
Wat het paper doet
De onderzoekers bouwden een multi-agent LLM-systeem dat IT-Grundschutz-audits automatiseert. IT-Grundschutz is het Duitse equivalent van onze BIO2 (Baseline Informatiebeveiliging Overheid). Het sluit nauw aan bij de NIS2-systematiek: een catalogus van gestructureerde beveiligingsmaatregelen, ingedeeld in modules. Elke maatregel heeft een beschrijving van het vereiste implementatieniveau. Denk aan “INF.1, Algemene gebouwen”, “NET.1, Netwerkarchitectuur”, of “APP.1.1, Webanwendungen”. Honderden controls, elk met een specifieke verificatievraag.
Het systeem gebruikt meerdere gespecialiseerde LLM-agenten. Een planner-agent bepaalt de scope. Een evidence-agent verzamelt bewijsmateriaal uit documentatie en configuratiebestanden. Een assessment-agent beoordeelt per maatregel of deze is toegepast. Een validator-agent controleert of de oordelen onderling consistent zijn. De agents werken met een RAG-architectuur. De IT-Grundschutz-catalogus fungeert als kennisbank. De assessment-agent krijgt de maatregeltekst, het verzamelde bewijs, en een prompt met een vijfpuntsschaal: “fully compliant”, “largely compliant”, “partially compliant”, “non-compliant”, “not applicable”. De validator kijkt of oordelen over verschillende maatregelen consistent zijn. Bijvoorbeeld of eenzelfde firewallconfiguratie niet bij de ene maatregel als “compliant” en bij de andere als “non-compliant” wordt beoordeeld.
Het resultaat: over 47 IT-Grundschutz-maatregelen haalde het systeem een accuracy van 87% ten opzichte van een menselijke auditor. Dat klinkt indrukwekkend. Maar het paper is meedogenloos eerlijk over de beperkingen. De fouten zitten niet in de marge, maar in de kern. Een LLM produceert een kansverdeling over tokens, geen binaire waarheid. Zelfs met een validator-agent die inconsistenties opspoort, blijft de uitvoer probabilistisch. Een maatregel als “Der Einsatz von kryptographischen Verfahren muss dokumentiert sein” kan als “largely compliant” worden beoordeeld omdat ergens een document is gevonden met de woorden “TLS 1.2”. Terwijl de daadwerkelijke configuratie TLS 1.0 toestaat. Het model begrijpt niet wat er technisch gebeurt. Het matcht tekstpatronen.
De Nederlandse vertaalslag
Voor Nederlandse organisaties onder de NIS2-richtlijn, en dat zijn er sinds de Cyberbeveiligingswet fors meer, is dit paper belangrijker dan het lijkt. IT-Grundschutz is geen ver-van-mijn-bedshow. Het is een internationaal gerespecteerd framework. Het sluit naadloos aan op de BIO2 en de NIS2-maatregelen. De BIO2 kent dezelfde modulaire structuur. De NIS2 eist dezelfde strengheid. En beide vragen bewijs. Niet scores. Niet waarschijnlijkheden. Maar concrete, controleerbare implementatie.
95% zeker is niet genoeg: waarom probabilistische AI-audits botsen met NIS2
Dit artikel is exclusief beschikbaar voor nieuwsbrief-abonnees. Schrijf je in voor toegang tot 880+ artikelen.
Geen spam. Uitschrijven op elk moment.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.