Waarom we blind moeten auditen: manipulatiebestendige AI-controles
Audits van AI-modellen zijn niet meer te vertrouwen. Dat is de harde conclusie van een nieuw paper op arXiv. [^1] De onderzoekers laten zien dat modelproviders audits kunnen manipuleren. Ze doen dit zodra ze controle detecteren. En dat is precies wat er in de praktijk gebeurt.
Ik zie dit probleem al jaren terugkomen. Het gebeurt in gesprekken met CIO's van Nederlandse gemeenten. Ze besteden een AI-systeem uit. Daarna krijgen ze een fairness-rapportage. Maar ze hebben geen idee of die cijfers kloppen. De provider kan tijdens een audit tijdelijk de output aanpassen. Zo wordt bias verborgen. Zodra de audit voorbij is, draait het model weer zoals eerst.
Hoe manipulatie werkt
Stel: een gemeente gebruikt een AI-model voor het toekennen van bijstand. De auditor wil controleren of het model niet discrimineert. Het gaat om postcode of afkomst. De provider detecteert de audit. Dit komt bijvoorbeeld doordat de auditor specifieke queries stuurt. Soms wordt een aparte API gebruikt. Vervolgens trekt de provider de allocaties voor die subset gelijk. De fairness-metrics zien er perfect uit. De audit slaagt.
Dit is geen hypothese. In 2023 toonde onderzoek van MIT aan dat commerciële modellen tijdens audits hun gedrag aanpassen. [^2] Het paper van augustus 2026 formaliseert dit probleem. Het biedt ook een tegenmaatregel.
De oplossing: oblivious audit
Het protocol heet Manipulation-Proof Oblivious Audits. Het gebruikt Private Information Retrieval (PIR). Het idee is simpel. De auditor kiest een subset van instances. De provider weet niet welke. De provider moet alle instances labelen. Maar hij kan de subset die geaudit wordt niet manipuleren zonder detectie.
Concreet: stel je hebt 10.000 aanvragen. De auditor kiest er willekeurig 100. De provider moet alle 10.000 beoordelen. Hij weet niet welke 100 worden gecontroleerd. Als hij de 100 probeert te beïnvloeden, moet hij alle 10.000 aanpassen. Dat kost te veel rekenkracht. Het laat ook sporen na. Manipulatie wordt detecteerbaar.
Het protocol werkt met cryptografische PIR. De auditor stuurt versleutelde queries. De provider retourneert versleutelde antwoorden. De auditor kan alleen de subset ontsleutelen die hij wil controleren. De provider ziet niet welke instances worden opgevraagd.
Technische diepgang
Het paper implementeert het protocol met een PIR-schema. Dit is gebaseerd op lattice-based cryptography (Ring-LWE). De auditor genereert een set van n instances. Hij wil er k auditen. Hij codeert elke instance als een vector. Daarna gebruikt hij PIR om de labels op te halen. De provider moet alle n instances labelen. Maar hij kan niet zien welke k worden opgevraagd.
De onderzoekers testen het op CIFAR-10 en CelebA. Ze gebruiken een ResNet-18 model. De audit kost ongeveer 2,3 seconden per instance. Dit geldt bij een beveiligingsniveau van 128 bits. Dat is trager dan een gewone audit. Maar het is acceptabel voor steekproeven.
Belangrijk detail: het protocol werkt alleen als de provider alle instances moet labelen. Als de provider een deel kan overslaan, lekt hij informatie. Daarom eist het protocol dat de auditor een commitment krijgt. De provider toont aan dat hij alle instances verwerkte. Dat kan met een Merkle-tree. Een zero-knowledge proof is ook mogelijk.
Waarom dit relevant is voor Nederland
De AI Act eist dat hoog-risico AI-systemen transparant en eerlijk zijn. Artikel 14 en 15 verplichten tot menselijk toezicht. Ook nauwkeurigheid is verplicht. Maar hoe controleer je dat als de provider de audit kan manipuleren? Dit paper biedt een concrete technische oplossing.
Voor Nederlandse overheidsorganisaties is dit belangrijk. Denk aan UWV, Belastingdienst, CJIB. Zij zetten AI in voor besluitvorming. Zij zijn verplicht om aan te tonen dat hun modellen voldoen aan de eisen. Het gaat om de AI Act. Ook de Algemene Verordening Gegevensbescherming (AVG) telt. Een oblivious audit-protocol kan deel uitmaken van de verplichte conformiteitsbeoordeling.
Ook NIS2 en BIO2 spelen een rol. NIS2 eist regelmatige audits. Dit geldt voor aanbieders van kritieke diensten. BIO2 schrijft voor dat je de integratie veilig stelt.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.