Machine unlearning als backdoor-trigger: een nieuw AI-veiligheidsrisico
Machine unlearning wordt steeds vaker gepositioneerd als de technische oplossing voor het GDPR-recht op vergetelheid. Een organisatie ontvangt een verwijderverzoek, draait unlearning op het getrainde model, en de data is "vergeten". Maar een nieuwe studie1 onthult een verontrustende bijwerking: unlearning kan sluimerende backdoors activeren die tijdens de training ondetecteerbaar waren.
Hoe het werkt
De aanval, beschreven in arXiv:2607.27936, gebruikt een clean-label backdoor die inactief blijft na training. De backdoor is ontworpen met "removable camouflage", specifieke trainingsrecords maskeren de backdoor zolang ze in de dataset blijven. Pas wanneer die records worden verwijderd via unlearning, wordt de backdoor actief.
De keten:
-
Training: Een attacker injecteert een clean-label backdoor in het model via ogenschijnlijk normale trainingsdata. De backdoor is inactief, standaard evaluatie toont geen anomalie (lage ASR = Attack Success Rate).
-
Unlearning: Een legitiem GDPR-verwijderverzoek komt binnen. De organisatie draait unlearning om de specifieke records te verwijderen. De "removable camouflage" verdwijnt.
-
Activatie: De backdoor wordt actief. Het model gedraagt zich normaal voor legitieme inputs, maar reageert op de trigger met kwaadaardige output, data-exfiltratie, misclassificatie, of denial-of-service.
Waarom dit relevant is voor Nederlandse overheden
Machine unlearning groeit als compliance-tool. Organisaties die AI-modellen trainen op persoonsgegevens, denk aan de Belastingdienst, UWV, gemeenten met AI-beslissystemen, krijgen GDPR-verwijderverzoeken. Unlearning lijkt de ideale oplossing: efficiënter dan hertrainen, compliant met de AVG.
Maar dit paper toont aan dat unlearning een beveiligingsrisico introduceert dat niemand op de radar heeft:
- BIO2 heeft geen controle voor post-unlearning model integriteit
- AI Act Artikel 15 (robustness) vereist bescherming tegen model-tampering, maar dit is een nieuw aanvalsvector
- NIS2 Artikel 20 (supply chain security) dekt model poisoning niet in deze vorm
- GDPR-implementaties gaan ervan uit dat unlearning alleen voordelen heeft, geen security-impact
Wat DjimIT adviseert
-
Model Integrity Assessment voor unlearning pipelines, Voordat een organisatie unlearning inzet voor GDPR-conformiteit, moet het model worden gescand op sluimerende backdoors die door unlearning geactiveerd kunnen worden.
-
Unlearning met security-monitoring, Unlearning mag geen blinde operatie zijn. Na elke unlearning-run moet het model opnieuw worden geëvalueerd op backdoor-activatie. Dit is vergelijkbaar met hoe penetration testing na infrastructure-wijzigingen wordt herhaald.
-
Bewustwording bij DPIA's, Data Protection Impact Assessments voor AI-systemen die unlearning gebruiken moeten dit risico meenemen. Een DPIA die unlearning alleen als GDPR-voordeel beschrijft zonder security-impact is incompleet.
Conclusie
Machine unlearning is een krachtig instrument voor GDPR-compliance, maar introduceert een nieuw beveiligingsrisico: het kan backdoors activeren die tijdens training ondetecteerbaar waren. Voor Nederlandse overheden die AI-modellen trainen op persoonsgegevens betekent dit dat unlearning niet zonder security-toezicht mag worden ingezet.
De combinatie van twee compliance-drukken, GDPR (unlearning verplicht) en AI Act (robustness verplicht), creëert een spanningsveld dat nog niet is opgelost. DjimIT adviseert organisaties om unlearning-pipelines te laten auditen voordat ze in productie gaan.
Footnotes
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.