Waarom SHAP niet genoeg is: Trust Scores voor EU AI Act conformity
SHAP en LIME zijn inmiddels standaardtools voor het interpreteren van black-box voorspellingen. Maar hun output kan substantieel variëren wanneer de input met kleine hoeveelheden ruis wordt verstoord. Die variabiliteit roept een fundamentele vraag op: kunnen zulke verklaringen überhaupt vertrouwd worden?
Dat is de kern van een formeel methodologisch framework voor het auditen van robustness en fidelity in explainable AI (arXiv:2608.23817). Het levert een meetbare methode om XAI-claims te valideren, iets wat Nederlandse toezichthouders (AP, ACM) steeds vaker eisen onder de EU AI Act.
Formeel: de Trust Score
Het paper definieert een auditing-protocol dat twee eigenschappen van elke post-hoc explainer meet. Laat een model f en een explainer e op input x een verklaring φ = e(x) produceren.
Robustness meet hoe stabiel φ is onder input-perturbatie. Laat x' een perturbatie van x zijn met ‖x' − x‖ ≤ ε. Dan is de robustness van e op x:
R(x) = 1 − d(e(x), e(x')) genormaliseerd naar [0,1]
waarbij d een afstandsfunctie over verklaringen is. Een hoge R(x) betekent dat kleine input-variaties de verklaring niet radicaal veranderen.
Fidelity meet of de als belangrijk gemarkeerde features daadwerkelijk de voorspelling drijven. Laat F de set gemarkeerde features zijn. Fidelity:
Fid(x) = mate waarin F de voorspelling f(x) bepaalt
Deze twee grootheden worden gecombineerd in een enkele Trust Score:
Trust(x) = g(R(x), Fid(x))
waarbij g een aggregatiefunctie is die beide dimensies weegt.
De kernstelling: auditing is noodzakelijk
De centrale bijdrage is niet de exacte aggregatiefunctie, maar de empirische bevinding dat auditing noodzakelijk is. Het protocol is gedraaid op een multi-sectorale dataset uit Madagaskar (83 features, 253 records, 4 ondervoedingsklassen) met drie classifiers en twee explainers, plus hun regularized tegenhangers. De resultaten:
- Modellen met AUC boven 0,99 kunnen numeriek gedegenereerde of vlak oninformatieve verklaringen produceren
- Fidelity-scores verliezen discriminerend vermogen wanneer het model overfitted is
Dit is de scherpe paradox: een model met uitstekende voorspelling (AUC boven 0,99) kan tegelijkertijd verklaringen produceren die niet te vertrouwen zijn. Voorspellingskwaliteit en verklaringskwaliteit zijn ontkoppeld.
Dit leidt tot de centrale hypothese.
H1, de ontkoppelingshypothese. Voorspellingskwaliteit en verklaringskwaliteit van een AI-systeem zijn onafhankelijk; een model met hoge AUC kan onbetrouwbare (numeriek gedegenereerde of oninformatieve) verklaringen produceren.
H1 is falsifieerbaar. De hypothese faalt wanneer kan worden aangetoond dat hoge AUC altijd correleert met betrouwbare verklaringen, in welk geval auditing overbodig zou zijn. De empirische resultaten (AUC boven 0,99 met gedegenereerde verklaringen) ondersteunen H1.
H2, de overfit-degradatiehypothese. Overfitted modellen verliezen het discriminerend vermogen van fidelity-scores, waardoor fidelity alleen geen betrouwbare maatstaf is voor verklaringskwaliteit.
H2 is falsifieerbaar. De hypothese faalt wanneer fidelity-scores hun discriminerend vermogen behouden bij overfitted modellen. De observatie dat fidelity-scores discriminerend vermogen verliezen bij overfit ondersteunt H2.
Wat dit betekent voor Nederlandse organisaties
Voor organisaties die high-risk AI-systemen onder de EU AI Act moeten aantonen, is dit direct relevant. Artikel 13 eist transparantie en robuustheid; Artikel 15 eist accuracy, robustness en cybersecurity. Veel organisaties gebruiken SHAP/LIME-outputs als bewijs van transparantie zonder robustness te testen.
Als de uitleg instabiel is onder kleine input-variaties, is het hele conformity-dossier niet houdbaar. Bestaande DPIA's missen deze kwetsbaarheid systematisch. Een "XAI Trust Score assessment" als plugin bij bestaande DPIA's en AI Act conformity assessments biedt een meetbare methode om XAI-claims te valideren.
Dit sluit aan bij een breder patroon dat wij eerder identificeerden: verklaringen zijn een narratief, geen bewijsstuk. De Trust Score biedt een kwantitatieve grondslag om te bepalen wanneer een verklaring als bewijs kan dienen.
Een minimale audit-gate-set voor XAI-conformity
| Gate | Te bewijzen eigenschap |
|---|---|
| G1, Robustness-meting | De Trust Score is gemeten over input-perturbaties, niet alleen één verklaring |
| G2, Fidelity-meting | De gemarkeerde features drijven daadwerkelijk de voorspelling |
| G3, Overfit-check | Fidelity-scores zijn gevalideerd tegen de overfit-status van het model |
| G4, Drempelvaststelling | Een organisatie heeft een minimale Trust Score vastgesteld als dekkingsgrens |
| G5, Documentatie | De Trust Score is gedocumenteerd als onderdeel van het conformity-dossier |
Conclusie
De les is helder: een verklaring die niet robuust is onder kleine input-variaties, is geen betrouwbaar bewijs van transparantie. Voor EU AI Act conformity is het meten van de Trust Score van XAI-output een noodzakelijke stap, niet een optionele verfijning.
De H1-hypothese, dat voorspellingskwaliteit en verklaringskwaliteit ontkoppeld zijn, is de kern. Organisaties die alleen naar AUC kijken als bewijs van kwaliteit, verwaarlozen een dimensie die het conformity-dossier kan ondermijnen.
Beperkingen
De validatie is gebaseerd op één dataset (Madagaskar, 253 records) en een beperkte set classifiers/explainers. De generaliseerbaarheid naar andere domeinen en grotere datasets vereist verdere validatie. Het paper is peer-reviewed en gepresenteerd op ICAI 2026, maar niet in de proceedings opgenomen. De exacte vorm van de aggregatiefunctie g(R, Fid) is niet in de abstract gespecificeerd en vereist raadpleging van het volledige paper.
Bronnen
- Ralinirina, Ralaivao, Ralaivao, Ratovondrahona, Mahatody, A Formal Methodological Framework for Auditing Robustness and Fidelity in Explainable AI: From Application to Trust Certification, arXiv:2608.23817, ingediend 24 aug 2026, ICAI 2026.
Waarom SHAP niet genoeg is: Trust Scores voor EU AI Act conformity
Dit artikel is exclusief beschikbaar voor nieuwsbrief-abonnees. Schrijf je in voor toegang tot 880+ artikelen.
Geen spam. Uitschrijven op elk moment.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.