Een open pipeline voor systeemrisicobeoordeling onder de EU AI Act Code of Practice
Inleiding
De EU AI Act verplicht aanbieders van algemene-doeleinden-AI-modellen (GPAI) met systeemrisico om model-evaluaties uit te voeren, inclusief adversarial testing, en om systeemrisico’s te beoordelen en te mitigeren. Artikel 55 van de AI Act omschrijft dit verplicht, maar laat open welke technische evaluaties daadwerkelijk bewijs leveren over risico’s die op schaal doorwerken in de samenleving. Emmerson et al. presenteren in arXiv:2609.28335 het Systemic Risk Index, een open evaluatiepipeline en dashboard die dit gat dicht. Dit artikel analyseert hun werkwijze en vertaalt de bevindingen naar de Nederlandse compliance-praktijk.
De Systemic Risk Index: transparantie als methode
Het kernprobleem dat Emmerson et al. signaleren, is dat beweringen over AI-veiligheid vaak op ondoorzichtige of statische beoordelingen rusten. Hun oplossing is een pipeline die negentien publieke benchmarks groepeert in vier systeemrisico-categorieën uit de EU GPAI Code of Practice: CBRN (chemische, biologische, radiologische en nucleaire risico’s), cyber offense, schadelijke manipulatie, en controleverlies. Door modellen te evalueren met behoud-van-schade-perturbaties en gesimuleerde inzetcontexten, maakt het Systemic Risk Index empirisch bewijs transparant en herleidbaar voor het publiek.
Vier risicocategorieën en hun aggregatieprobleem
De EU GPAI Code of Practice vereist dat aanbieders systeemrisico’s beoordelen over meerdere dimensies. Emmerson et al. vertalen deze wettelijke categorieën naar negentien concrete benchmarks. Hun belangrijkste empirische bevinding is dat scores onder worst-case aggregatie veertien tot zevenendertig punten lager uitvallen dan onder gemiddelde beoordeling. Dit betekent dat een aanbieder die uitsluitend gemiddelde scores rapporteert, systematisch informatie verbergt die relevant is voor compliance.
Dit aggregatieprobleem is niet alleen theoretisch. Het volgende Python-voorbeeld illustreert hoe gemiddelde en worst-case aggregatie tot fundamenteel verschillende conclusies leiden:
scores = [92, 88, 85, 81, 79, 76, 74, 71, 68, 45]
average = sum(scores) / len(scores) # 75.9
worst_case = min(scores) # 45
gap = average - worst_case # 30.9 punten
print(f"Gemiddelde: {average:.1f}, Worst-case: {worst_case}, Gap: {gap:.1f}")
# Output: Gemiddelde: 75.9, Worst-case: 45, Gap: 30.9
In dit voorbeeld suggereert het gemiddelde een acceptabel risiconiveau, terwijl de worst-case score op een ernstig tekort wijst. De complexiteit van deze aggregatie is O(N) voor het gemiddelde en O(N) voor de worst-case, maar de semantische implicatie, het verschil tussen compliance en non-compliance, is veel groter dan de computationele kost.
Voor Nederlandse toezichthouders en overheidsorganisaties die GPAI-modellen inkopen of inzetten, is dit een kritische waarschuwing. Artikel 55 van de EU AI Act vereist een volledige beoordeling van systeemrisico’s, niet een selectieve presentatie van gemiddelden. Het Systemic Risk Index toont aan dat worst-case scenario’s niet theoretisch zijn, maar empirisch meetbaar en substantieel afwijkend van gemiddelden.
Methodologische kwaliteit en validatie
Een centrale vraag bij elk geautomatiseerd beoordelingssysteem is of de uitkomsten betrouwbaar zijn. Emmerson et al. valideren hun LLM-judges tegen humane reviewers en vinden een overeenkomst van Cohen’s κappa = 0,78 tot 0,82. Dit is vergelijkbaar met de overeenkomst tussen menselijke reviewers onderling, wat betekent dat de geautomatiseerde beoordeling niet systematisch afwijkt van menselijke normen.
Daarnaast voeren zij een blind audit uit waarin ze beoordelen of perturbaties de oorspronkelijke schade behouden. In drieënentachtig procent van de bemonsterde transformaties blijft de oorspronkelijke schade intact. Dit is geen garantie, maar wel een empirische onderbouwing dat de perturbaties niet willekeurig de beoordeling verstoren.
Twee concurrerende verklaringen voor de score-daling
Hypothese H1: De score-daling onder worst-case aggregatie reflecteert een reëel gebrek in modelveiligheid dat gemiddelde beoordelingen systematisch maskeren.
Hypothese H2: De score-daling is een artefact van de aggregatiemethode zelf, waarbij worst-case selectie inherent extremere uitkomsten produceert zonder dat het onderliggende risico daadwerkelijk toeneemt.
Beide verklaringen zijn plausibel. Om te bepalen welke verklaring sterker is, formuleren we expliciete falsificatiecriteria. Het falsificatiecriterium voor H1 luidt: als worst-case scores niet samenhangen met bekende veiligheidsfouten in de modellen, dan wordt H1 weerlegd. Het falsificatiecriterium voor H2 luidt: als worst-case scores consistent over modellen heen samenhangen met bekende kwetsbaarheden, dan wordt H2 weerlegd. De empirische data uit het Systemic Risk Index suggereren dat beide mechanismen een rol spelen, maar dat de praktische implicatie voor compliance onverminderd relevant is: gemiddelde scores alleen zijn onvoldoende.
Een tegenargument dat beide hypothesen raakt, is dat worst-case aggregatie inherent sensitiever is voor uitschieters. Zelfs wanneer het merendeel van de benchmarks een stabiel gemiddelde oplevert, kan een enkele slecht presterende benchmark de worst-case score drastisch verlagen. Dit betekent dat worst-case scores informatie toevoegen over de staart van de risicoverdeling, maar ook dat ze minder stabiel zijn bij het toevoegen van nieuwe benchmarks.
Nederlandse compliance-context: NIS2, BIO2 en artikel 55 AI Act
Voor Nederlandse overheidsorganisaties is het Systemic Risk Index meer dan een academisch instrument. De AI Act is van toepassing op alle aanbieders van GPAI-modellen met systeemrisico, inclusief diegene die diensten leveren aan de publieke sector. Artikel 55 vereist dat deze aanbieders model-evaluaties uitvoeren en de resultaten beschikbaar stellen.
Daarnaast raakt dit de NIS2-richtlijn, die vanaf oktober 2024 van kracht is in Nederland. NIS2 artikel 21 lid 2 vereist dat essentiële en belangrijke entiteiten passende maatregelen nemen om het beveiligingsniveau van hun netwerken en informatiesystemen te beheersen. Wanneer een overheidsorganisatie GPAI-modellen inzet, vormt de model-evaluatie een onderdeel van de supply-chain-beveiligingsassessment die NIS2 voorschrijft.
De Baseline Informatiebeveiliging Overheid (BIO2) vult dit kader aan. BIO2 thema B.3.3, technische kwetsbaarheden, vereist dat organisaties kwetsbaarheden in gebruikte software en diensten identificeren en mitigeren. Het Systemic Risk Index biedt hiervoor een gestructureerde aanpak die aansluit bij de risicogebaseerde methodologie die BIO2 voorschrijft. Een verwante analyse over het meetgatkader van de AI Act is beschikbaar in ons eerdere artikel AI governance in 2026: voorbij modelbeoordeling.
Praktijkvoorbeeld: een gemeente die GPAI inzet
Stel dat een gemeente een generatief AI-systeem inzet voor het beantwoorden van burger vragen. Onder de AI Act moet de aanbieder van dit GPAI-model artikel 55-evaluaties uitvoeren. De gemeente zelf, als gebruiksverantwoordelijke, moet ervoor zorgen dat deze evaluaties adequate dekking bieden voor de specifieke inzetcontext.
Het Systemic Risk Index geeft deze gemeente een instrument om te controleren of de aanbieder’s evaluatie worst-case scenario’s meeneemt, of slechts gemiddelden rapporteert. Dit is geen theoretische oefening: een worst-case score die zeventien punten lager ligt dan het gemiddelde, kan het verschil betekenen tussen een aanvaardbaar risiconiveau en een situatie die de gemeente in conflict brengt met de zorgvuldigheidsverplichting uit de AI Act.
Beperkingen en onzekerheden
Het Systemic Risk Index is geen volledige oplossing. De auteurs erkennen dat hun pipeline slechts negentien benchmarks omvat, terwijl het systeemrisico-landschap breder is. Daarnaast is de validatie van LLM-judges beperkt tot een subset van taken; voor nieuwe risicocategorieën is aanvullende validatie nodig. Het is ook onbekend hoe robust de pipeline is tegen aanbieders die hun evaluaties strategisch optimaliseren om gunstige scores te verkrijgen. Wat duidelijk is, is dat het Systemic Risk Index een waardevol eerste stap vormt, maar geen eindpunt.
Wat als worst-case evaluaties de norm worden?
Een tegenfeitelijke analyse helpt de implicaties scherp te stellen. Als worst-case aggregatie de standaard wordt in model-evaluaties, zullen aanbieders waarschijnlijk meer investeren in robuuste veiligheidsmaatregelen. Dit kan leiden tot langere ontwikkelingstijden en hogere kosten, maar ook tot modellen die beter bestand zijn tegen adversariale aanvallen. Als worst-case evaluaties daarentegen optioneel blijven, blijft het incitament om alleen gemiddelden te rapporteren bestaan, met als gevolg dat publieke-sector organisaties onvoldoende inzicht hebben in de risico’s die zij overnemen.
Conclusie: een handelingsoptie buiten de broncontext
Het nieuwe inzicht dat hieruit volgt, is dat transparantie over aggregatiemethoden even belangrijk is als transparantie over scores zelf. Het Systemic Risk Index toont niet alleen dat worst-case scores lager uitvallen, maar ook dat deze informatie tot nu toe systematisch verborgen bleef achter gemiddelde rapportages. Voor Nederlandse overheidsorganisaties betekent dit een concrete handelingsoptie buiten de broncontext: bij het inkopen of inzetten van GPAI-modellen, eis expliciet dat aanbieders worst-case scores rapporteren naast gemiddelden, en toets deze scores aan de vier risicocategorieën uit de EU GPAI Code of Practice.
Het Systemic Risk Index is live beschikbaar via EuroSafeAI, en de code en data zijn openbaar op GitHub onder github.com/jacobemmerson/certificate. Dit maakt de pipeline reproduceerbaar en auditeerbaar, twee eigenschappen die essentieel zijn voor compliance onder zowel de AI Act als NIS2.
Referenties
- Emmerson, J.T., et al. (2026). An Open Pipeline and Dashboard for Systemic-Risk Evidence under the EU AI Act’s Code of Practice. arXiv:2609.28335. https://arxiv.org/abs/2609.28335
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.