AI Watermarking Fouten Licht Op: Forensisch Vertrouwen Verloren
Er is een grote kloof ontstaan tussen de hoop die we legden op AI-watermarking en de realiteit. In een recent onderzoek heeft men aangetoond dat alle drie de belangrijkste LLM-watermerkmethoden, KGW, Unigram, en SynthID-Text, volledig falen bij de Daubert-admissibility criteria voor forensisch bewijs.1 Dit betekent niets minder dan dat de huidige techniek niet te vertrouwen is als het gaat om het identificeren van AI-generatieve content. Waar we op rekenden, was een solide manier om AI-generateerde teksten te markeren; in plaats daarvan vinden we ons nu geconfronteerd met een situatie waarin de watermerken simpelweg verdwijnen na paraphrasing.
Laatst bij een klant, een grote Nederlandse overheidsinstantie die zich op Bio-2 richt, hebben we besproken hoe ze AI-watermarking kunnen implementeren om te voldoen aan de EU AI Act. De discussies gingen in diepe details over hoe de watermerken konden worden geïmplementeerd en hoe betrouwbaar ze zouden zijn. Het was duidelijk dat er verwachtingen waren, maar nu zien we deze verwachtingen niet ingaan.
De Daubert criteria vragen om een bewijs die vertrouwd is in de wetenschappelijke gemeenschap en wordt toegepast door experts met kennis van zaken. In het geval van AI-watermerking hebben we echter te maken met false-negative rates tot 83% voordat zelfs maar een aanval plaatsvindt.1 Dit betekent dat bijna de helft van alle AI-teksten die markeren zou moeten worden, niet gemarkeerd blijven. En als je het watermerk nog probeert te detecteren na paraphrasing, dan verdwijnt het volledig.
Deze ontdekkingen hebben directe implicaties voor de Nederlandse overheid en andere sectoren die onder Bio-2 vallen. De EU AI Act vereist namelijk "sufficiently reliable and robust" markering van AI-generatieve content, een eis waar de huidige techniek duidelijk niet aan voldoet.1 Dit betekent dat overheidsinstanties die op dit moment al plannen hebben om watermerk-requirements in te voeren, mogelijk op een onbetrouwbare basis bouwen.
Dit is geen tijd voor paniek, maar het is wel een tijdstip waarop we hard moeten nadenken over hoe we vorderingen maken in AI-governance. In een eerdere blogpost hebben wij al aangegeven dat de EU AI Act zorgvuldig moet worden gevolgd en dat er geen ruimte is voor onnauwkeurigheden.2 We staan nu voor een nieuwe uitdaging: hoe kunnen we ervoor zorgen dat AI-generatieve content betrouwbaar kan worden geverifieerd?
Als je op zoek bent naar specifieke stappen die je kunt nemen om te reageren op deze ontdekking, dan is het moment gekomen voor een grondige controle van de huidige AI-governance structuren in jouw organisatie. Wil je weten of jouw AI-systemen onder de AI Act vallen? Gebruik onze AI Act Self-Check, het is een eenvoudige manier om snel te kijken waar jij staat en wat er nog moet gebeuren.
Teksten Gemaakt Met AI
Dit artikel is gemaakt met hulp van een AI-assistent. Als je vragen hebt over de bovenstaande informatie, wil je weten hoe we dit kunnen toepassen in jouw organisatie, of je gewoon meer wilt weten over AI en compliance, neem dan contact op via info@djimit.nl.
Footnotes
-
<https://arxiv.org/abs/2607.16010> (Abstract & PDF) ↩ ↩2 ↩3
-
/blog/hoe-de-eu-ai-act-je-ondersteunt-in-compliance ↩
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.