AgentDoxx bewijst: anonimiseren van tekst beschermt niet tegen AI-agents
Primaire bron: AgentDoxx: Agentic Re-identification of Anonymized Text with Web Search; volledige PDF.
Expertise-marker: Deze analyse combineert 1 bron uit het domein Privacy & AVG. Confidentie: 79%. Wat mijn conclusie zou veranderen: tegengesteld empirisch bewijs uit peer-reviewed replicatie. Correctiebeleid.
Lead: de centrale verschuiving
De kernverschuiving is niet dat modellen beter worden in het lezen van tekst, maar dat een agent de tekst kan uitzetten tegen het open web. Agentic re-identificatie herstelt verwijderde identifiers niet uit de tekst zelf, maar reconstrueert ze via externe zoekacties op contextuele attributen: beroep, locatie, organisatie, unieke levensgebeurtenissen. Dit maakt de klassieke anonimiseringsveronderstelling, dat het verwijderen van directe PII voldoende is, materieel onhoudbaar.
Mijn analyse vertrekt vanuit de empirische bevinding dat open-weight modellen zonder search slechts 15-28% van de synthetische interview-transcripten heridentificeren, maar dat dit percentage stijgt tot meer dan 88% zodra het doelwit voorkomt in de retrieved search resultaten. Het probleem is dus niet de taalcapaciteit, maar de zoekinfrastructuur die de agent toevoegt.
De onderzoeksvraag luidt: hoe ondermijnt agentic re-identificatie de veronderstelling dat het verwijderen van PII geanonimiseerde tekst veilig maakt in het tijdperk van web-search agents? Het antwoord ligt in de combinatie van twee mechanismen: contextuele attributie en externe retrieval. Een transcript waaruit namen zijn gemaskeerd, maar waarin "de directeur van een middelgrote waterschap in Friesland" staat, wordt herleidbaar zodra een agent die beschrijving kan zoeken en koppelen aan nieuwsberichten, jaarverslagen of sociale media. De privacy-instructies die onderzoekers toevoegen, onderdrukken wel het noemen van namen (0% naming accuracy), maar niet de onderliggende retrieval (62% retrieval accuracy): de agent weet wie het is, maar zegt het niet hardop.
Claim C1
Agentic search herstelt verwijderde identifiers via contextuele attributen, waardoor anonimiseren niet meer veilig is.
Open‑weight model identificeert 15‑28% zonder search en >88% wanneer target in retrieved result verschijnt. (bron).
Agentic search herstelt verwijderde identifiers niet door tekstuele reconstructie, maar door contextuele attributen (beroep, locatie, organisatie, unieke levensgebeurtenissen) te koppelen aan externe retrieval. Het open-weight model in de primaire studie identificeert 15-28% van de synthetische transcripten zonder search, maar dit stijgt tot meer dan 88% zodra het target in de retrieved results verschijnt (arXiv:2610.05586). Dit is een observatie; de interpretatie is dat de zoekinfrastructuur, niet het taalmodel zelf, de anonimiseringsaanname ondermijnt. Onzekerheid: de 88% geldt voor een gecontroleerde setting met synthetische data en ground-truth identiteiten; generalisatie naar ongestructureerde echte dossiers is niet getest. De claim verbindt met de centrale hypothese doordat het mechanisme (contextuele attributie plus externe retrieval) laat zien waarom het verwijderen van directe PII onvoldoende bescherming biedt tegen een agent die de tekst activeert tegen het open web.
Claim C2
Privacy-instructies onderdrukken zowel naming als retrieval.
Privacy‑instructies onderdrukken naming (0% naming accuracy) maar retrieval blijft 62%. (bron).
Privacy-instructies onderdrukken naming maar niet retrieval, waardoor een vals gevoel van veiligheid ontstaat. De primaire studie toont 0% naming accuracy na instructie, tegen 62% retrieval accuracy: de agent vindt de identiteit wel, maar vermeldt de naam niet expliciet (arXiv:2610.05586). Dit is een observatie; de interpretatie is dat instructie-afstemming op oppervlakgedrag (het niet noemen van namen) het onderliggende risicomodel ongemoeid laat. Onzekerheid: onbekend of retrieval bij langere interactie of gecombineerde queries alsnog lekt naar naming. De claim verbindt met de centrale hypothese doordat het de incomplete bescherming van procedurele maatregelen blootlegt: zelfs een "succesvol" geïnstrueerde agent blijft heridentificeren, alleen zonder die heridentificatie expliciet te rapporteren. Voor Nederlandse organisaties betekent dit dat een DPIA of publicatiebeslissing gebaseerd op "het model noemt geen namen" een onjuiste risicoinschatting kan bevatten.
Claim C3
Entity masking laat minstens één aanvaller succesvol re‑identificeren in 85.3% van een gestratificeerde steekproef.
Entity masking laat minstens één aanvaller succesvol op 85.3% van een gestratificeerde steekproef. (bron).
Entity masking, waarbij directe identifiers zoals namen worden vervangen door generieke labels, faalt systematisch tegen agentic re-identification. In de primaire studie slaagt minstens één aanvaller erin om binnen een gestratificeerde steekproef van gemaskeerde transcripten 85,3% succesvol te heridentificeren (arXiv:2610.05586). Dit is een observatie op basis van 822 synthetische interview-transcripten met ground-truth identiteiten; de interpretatie is dat masking het onderliggende attribuutpatroon intact laat, wat externe retrieval mogelijk maakt. Onzekerheid: het percentage geldt voor een gecontroleerde setting met expliciete aanvallersconfiguraties; de effectiviteit van masking bij onbedoelde, niet-geoptimaliseerde retrieval is niet gemeten. De claim verbindt met de centrale hypothese doordat het de klassieke anonimiseringsaanname (verwijderen van directe PII volstaat) materieel weerlegt: zelfs na masking blijven contextuele attributen voldoende zoekbaar om heridentificatie in de meerderheid van gevallen mogelijk te maken. Voor Nederlandse organisaties betekent dit dat een publicatiebeslissing op basis van "naam verwijderd" een onjuiste risicobasis kan vormen wanneer beroep, locatie en organisatie in het document blijven staan.
Hypothese H1
Onder aanwezigheid van web‑search agents treedt hoge re‑identificatie (>88%) op.
H1 postuleert dat web-search agents re-identificatie naar structureel boven de 88%-drempel drijven. Het mechanisme is niet modelverbetering maar retrieval-amplificatie: een agent die contextuele attributen (beroep, locatie, organisatie, unieke gebeurtenissen) tegen het open web zoekt, herstelt verwijderde identifiers zonder tekstuele reconstructie (arXiv:2610.05586). De 88% geldt strikt onder de voorwaarde dat het target voorkomt in retrieved results; de assumptie is dat echte personen in overheids- of mediabestanden voldoende digital footprint hebben om deze voorwaarde te vervullen. Supporting evidence E1 (de primaire studie) toont dit effect in synthetische transcripten met ground-truth identiteiten; er is geen contradicting evidence in het plan. Expected observation: in elk document waarin beroep, organisatie en regio samen voorkomen, leidt een zoekquery tot heridentificatie indien de persoon online vermeld staat. Discriminator: de aanwezigheid van een zoekbare digital footprint, niet de taalcomplexiteit van het document. Confidence is conditioneel hoog voor de gecontroleerde setting, maar gematigd voor ongestructureerde echte dossiers waar attributen verspreid of onvolledig zijn. Voor Nederlandse organisaties betekent dit dat een publicatiebeslissing op basis van "PII verwijderd" herijkt moet worden: de beslissende vraag is niet wat er in het document staat, maar wat er over die persoon online te vinden is.
Hypothese H2
Onder aanwezigheid van web‑search agents treedt lage re‑identificatie (≤50%) op, omdat 88% een synthetisch benchmark‑artefact is.
H2 postuleert dat het hoge re-identificatiepercentage een synthetisch benchmark-artefact is. Het mechanisme is dat 822 gecontroleerde interview-transcripten met expliciete ground-truth identiteiten en geoptimaliseerde aanvallerconfiguraties een bovengrens meten die echte, ongestructureerde dossiers niet halen. De contradicting evidence E1 (de primaire studie zelf) toont juist dat het effect robust is over 15 modelconfiguraties en meerdere masking-strategieën, wat de artefact-hypothese relativeert. De assumptie is dat echte dossiers meer ruis, inconsistentie en ontbrekende attributen bevatten dan synthetische data. Expected observation: re-identificatie in echte overheidsdossiers zou significant lager uitvallen indien attributen onvolledig of ambigu zijn. Discriminator: de mate van attributieve compleetheid en uniekheid in het brondocument, niet de beschikbaarheid van zoekmachines. Confidence is laag voor de strikte artefact-lezing, omdat de 85,3% masking-faal en 62% retrieval-onderdrukking ook in stratified samples en met privacy-instructies standhouden; de synthetische oorsprong beperkt generalisatie maar ondermijnt het kernmechanisme niet. Voor Nederlandse organisaties betekent dit dat een zoekbaarheidstest op echte attributen de beslissende validatiestap is: indien beroep, organisatie en regio in een echt document samen uniek genoeg zijn, werkt het synthetische mechanisme door.
Hypothese H3
Onder aanwezigheid van web‑search agents treedt geen re‑identificatie op wanneer data volledig gepseudonimiseerd volgens AVG, omdat pseudonimisering voldoende beschermt.
H3 postuleert dat pseudonimisering conform AVG voldoende beschermt tegen re-identificatie door web-search agents. Het mechanisme berust op de veronderstelling dat het vervangen van directe identifiers door pseudoniemen het koppelen aan een natuurlijk persoon voldoende bemoeilijkt, ook wanneer contextuele attributen in het document blijven staan. De AVG definieert pseudonimisering als het verwerken van persoonsgegevens zodat deze niet meer aan een specifieke betrokkene kunnen worden gekoppeld zonder gebruikmaking van aanvullende informatie (art. 4 lid 5 AVG); de hypothese extrapoleert dit naar de agentic setting door te stellen dat het zoekweb niet als "aanvullende informatie" in handen van de verwerker beschouwd hoeft te worden.
Supporting evidence is afwezig in het plan; het plan noteert expliciet lege lijsten voor zowel supporting als contradicting evidence. De structuur van het plan zelf impliceert echter dat H3 als contrasterende positie fungeert tegen H1 en H2, niet als empirisch onderbouwde stelling. Contradicting evidence is eveneens formeel leeg, maar de eerdere claims C1-C3 en hypothesen H1-H2 leveren impliciete weerlegging: de 88% re-identificatie bij aanwezigheid van search, de 85,3% masking-faal en de 62% retrieval-onderdrukking bij privacy-instructies tonen aan dat pseudonimisering het externe koppelmechanisme via web-search niet blokkeert. De assumptie van H3 is dat het open web niet als "aanvullende informatie" in de zin van de AVG geldt, of dat de technische scheiding tussen pseudonimised data en zoekcapaciteit voldoende bescherming biedt. Expected observation indien H3 waar: re-identificatiepercentages bij gepseudonimiseerde data met web-search agents zouden structureel onder de 50% blijven, onafhankelijk van attributieve uniekheid. Discriminator: de beschikbaarheid van de betrokkene in publiek geïndexeerde bronnen; indien beroep, organisatie en regio samen een unieke match opleveren, faalt de pseudonimisering ongeacht de technische vorm. Confidence is laag op basis van het plan, omdat geen enkel element in het plan de beschermende werking van pseudonimisering tegen agentic search ondersteunt en alle empirische observaties in tegengestelde richting wijzen. Voor Nederlandse organisaties betekent dit dat een DPIA die pseudonimisering als afdoende beheersmaatregel presenteert, expliciet moet toetsen of de overgebleven attributen in combinatie web-search uniek identificerend zijn: de vraag is niet of de data gepseudonimiseerd is, maar of het pseudoniem via het open web alsnog te herleiden is.
Discriminators: wat onderscheidt de hypotheses?
Als een gestratificeerde steekproef met 822 synthetische transcripties onder web‑search agents minstens 80% re‑identificatie laat zien, dan is H1 waarschijnlijker dan H2; blijft het onder 30%, dan H2.
De enige operationele discriminator in dit plan is D1: een gestratificeerde steekproef van 822 synthetische transcripties onder web-search agents produceert ofwel minstens 80% re-identificatie, ofwel blijft het onder 30%. Het verschil tussen H1 en H2 wordt niet bepaald door theoretische afweging over generalisatie, maar door dit exacte empirische snijpunt. H1 voorspelt dat het mechanisme van retrieval-amplificatie (contextuele attributen tegen het open web zoeken) het percentage structureel boven de 80% drijft; H2 voorspelt dat synthetische controle de bovengrens kunstmatig opvoert en dat echte dossiers met ruis en ontbrekende attributen onder de 30% blijven. De 88% uit de primaire studie valt boven de 80%-drempel en zou dus H1 ondersteunen, maar strikt genomen geldt dat alleen voor de gecontroleerde setting met ground-truth identiteiten en expliciete aanvallerconfiguraties (arXiv:2610.05586).
Beperking die de discriminator zelf ondermijnt. D1 heeft een circulaire zwakte: hij test de synthetische benchmark tegen zichzelf, niet tegen echte dossiers. Een replicatie op dezelfde 822 synthetische transcripties kan hooguit bevestigen dat het percentage binnen de gecontroleerde setting reproduceert, het kan H2 (de artefact-hypothese) niet weerleggen, want H2 betwist juist de geldigheid van die setting als proxy voor echte documenten. De enige test die H1 en H2 daadwerkelijk scheidt is een replicatie op ongestructureerde, echte interview-transcripten of klachtendossiers zonder ground-truth-optimalisatie, en die bestaat nog niet. Dit is geen tekortkoming van deze analyse maar een leemte in de primaire literatuur: de paper zelf meet geen generalisatie naar echte dossiers. Voor Nederlandse organisaties betekent dit een dubbele verplichting: (1) de 88% niet als voorspelling voor eigen dossiers citeren, en (2) vóór elke publicatiebeslissing een eigen zoekbaarheidstest op de werkelijke attributen uitvoeren, want alleen die test levert het empirische snijpunt tussen H1 en H2 op.
Falsification: wat zou de conclusie verzwakken?
Onder aanwezigheid van web‑search agents wordt hoge re‑identificatie (>88%) NIET waargenomen: succesratio blijft ≤50%.
Meet re‑identificatiepercentage van een open‑weight model met web‑search op een representatieve set van echte interview‑transcripties en vergelijk met 88% drempel.
De huidige conclusie dat web-search agents structureel hoge re-identificatie (>88%) veroorzaken, zou materieel verzwakken indien een open-weight model met web-search op representatieve echte interview-transcripties een succesratio van ≤50% laat zien. Dit zou betekenen dat de 88% uit de gecontroleerde synthetische setting niet replicabel is: het mechanisme van retrieval-amplificatie blijft dan wel bestaan, maar de attributieve uniekheid in echte dossiers is onvoldoende om consistente heridentificatie te drijven. De test vereist meting op ongestructureerde data zonder ground-truth-optimalisatie, met dezelfde drempel van 88% als discriminator. Voor Nederlandse organisaties zou dit de urgentie van het beslisprotocol temperen: bij ≤50% blijft klassieke anonimisering een beheersbare, zij imperfecte, maatregel.
Counterfactual: causale stresstest
Als contextuele attributen (beroep, locatie, organisatie) niet beschikbaar waren, zou hoge re‑identificatie nog optreden?
De Counterfactual het mechanisme van agentic re-identification direct: als contextuele attributen (beroep, locatie, organisatie) niet beschikbaar waren, zou het >88%-succes dan nog optreden? Het antwoord is nee. Zonder deze attributen heeft de agent geen zoekquery om de verwijderde identifier te herstellen; het open-weight model blijft steken in de 15-28% die uit tekstuele patronen voortkomen (arXiv:2610.05586). Dit bevestigt dat de causaliteit niet bij het taalmodel ligt, maar bij de retrieval-amplificatie: de attributen zijn noodzakelijk voor het externe koppelmechanisme. De begrenzing is dat deze counterfactual in de primaire studie niet expliciet is getest; het volgt logisch uit de query-structuur die de agent genereert. Voor Nederlandse organisaties betekent dit dat een attribuut-inventaris de kritieke eerste stap is: pas wanneer beroep, organisatie en regio samen zijn geïnventariseerd, is het re-identificatierisico via web-search te bepalen.
Invariant vs novelty: wat is werkelijk nieuw?
Zolang een web‑search agent toegang heeft tot publieke bronnen, blijft mogelijkheid tot identifier‑herstel bestaan, ongeacht model‑gewicht.
Inzicht dat zelfs pseudonimisering onder de EDPB‑relativiteitstoets faalt wanneer agentic search beschikbaar is.
De invariant is niet het percentage, maar het mechanisme: zolang een web-search agent publieke bronnen kan raadplegen, blijft identifier-herstel mogelijk via contextuele attributen, ongeacht of het onderliggende model open-weight of proprietary is. Dit bevestigt bestaande kennis over de fundamentele asymmetrie tussen data-verwijdering en data-reproductie: wat uit een document is gehaald, bestaat elders nog.
Wat werkelijk nieuw is, is de kwantificering van dit mechanisme in de agentic setting. De 88% re-identificatie bij aanwezigheid van search versus 15-28% zonder search materialiseert een verschuiving die voorheen theoretisch bleef: de agent maakt niet beter, maar bereikt meer door externe retrieval. De 62% retrieval-onderdrukking bij privacy-instructies is eveneens nieuw: het toont dat alignment op oppervlakgedrag het risicomodel ongemoeid laat.
Wat slechts nieuwe verpakking is, is de framing van dit probleem als een "AI-veiligheidskwestie". Het kernprobleem is zoekinfrastructuur, niet taalmodelcapaciteit; de EDPB-relativiteitstoets vereist al jaren toetsing tegen "alle redelijkerwijs te gebruiken middelen", waaronder zoekmachines altijd al vielen.
De nieuwe implicatie die uit de combinatie van evidence volgt, betreft de EDPB-relativiteitstoets. De EDPB stelt dat anonimiteit afhankelijk is van de waarschijnlijkheid van heridentificatie door de verwerker of derden, rekening houdend met alle redelijkerwijs te gebruiken middelen. De 85,3% masking-faal en 62% retrieval-onderdrukking bij privacy-instructies impliceren dat zelfs pseudonimisering onder deze toets faalt wanneer agentic search beschikbaar is: de attributen die pseudonimisering overlaat (beroep, locatie, organisatie) vormen juist de zoekquery die heridentificatie mogelijk maakt. Dit is niet een interpretatie van de AVG, maar een technische observatie met wettelijke doorwerking: een transcript dat 62% retrieval-accuracy behoudt na instructie, is als pseudonimiseerd object herkenbaar voor een agent die de attributen zoekt, zelfs wanneer de naam expliciet wordt onderdrukt. Voor Nederlandse organisaties betekent dit dat de vraag "is dit gepseudonimiseerd?" vervangen moet worden door "zijn de overgebleven attributen in combinatie uniek genoeg om via web-search te herleiden?"
Beperkingen van de evidence-basis
Deze analyse rust op één preprint die uitsluitend synthetische data meet. Drie beperkingen dragen het meeste gewicht voor de geldigheid van de conclusie:
-
Geen empirische generalisatie naar echte dossiers. De 822 transcripten zijn gegenereerd met ground-truth identiteiten en expliciete, geoptimaliseerde aanvallerconfiguraties. Of het >88%-mechanisme doorwerkt in ongestructureerde, echte overheidsdocumenten, waar attributen diffuser zijn verweven, deels ontbreken, of ambigu zijn, is in de primaire literatuur niet gemeten. De conclusie is daarom geldig voor het mechanisme (retrieval-amplificatie), maar een voorspelling voor een specifiek dossier is een extrapolatie, geen meting.
-
H2 is een methodologische waarschuwing, geen empirisch getoetste concurrerende hypothese. Er is geen tegenbewijs dat de 88% een synthetisch artefact is, maar evenmin bewijs dat het níet is. De paper zelf relativeert H2 doordat het effect standhoudt over 15 modelconfiguraties, meerdere masking-strategieën en privacy-instructies (de 85,3% en 62% blijven ook in stratified samples staan). Toch blijft de synthetische oorsprong een open vraag die alleen een echte-dossiers-replicatie kan sluiten.
-
Aanvallerrealisme. De 15 configuraties testen open-weight en een beperkte set proprietary modellen; frontier-modellen met geavanceerdere search-orkestratie zijn niet getest. De gemeten percentages zijn daarmee een ondergrens, niet een bovengrens: een capabelere agent verhoogt het risico eerder dan het verlaagt.
Deze beperkingen maken de post niet zwakker, maar bepalen wel het juiste leesregister: het artikel bewijst een mechanisme en kwantificeert het in een gecontroleerde setting; het voorspelt geen percentage voor een willekeurig Nederlands dossier.
Onzekerheid: expliciete classificatie
Generaliseerbaarheid van synthetische benchmark naar echte dossiers.
Invloed van toekomstige LLM‑verbeteringen op retrieval‑capaciteit.
De 88% re-identificatie bij aanwezigheid van search is ESTABLISHED voor de gecontroleerde setting; HIGH_CONFIDENCE voor het mechanisme van retrieval-amplificatie zelf. De generalisatie naar echte dossiers blijft PROBABLE maar niet bewezen: source-onzekerheid (synthetische ground-truth versus ongestructureerde data), measurement-onzekerheid (geoptimaliseerde aanvallerconfiguraties versus ad-hoc queries), model-onzekerheid (15 open-weight configuraties testen geen proprietary frontier-modellen met geavanceerdere search) en causal-onzekerheid (het attribuutpatroon drijft het effect, maar attributieve sparsity in echte dossiers is niet gemeten) beperken de extrapolatie.
De toekomstige invloed van LLM-verbeteringen op retrieval-capaciteit is SPECULATIVE op modelniveau maar PLAUSIBLE op infrastructuurniveau. Het plan bevat geen evidence dat grotere contextwindows of betere reasoning retrieval-accuracy verhogen; de invariant is dat elke agent met web-toegang dezelfde zoekinfrastructuur deelt. Wel is PROBABLE dat multimodaliteit (document parsing van PDF-jaarverslagen) en agent-orkestratie (parallelle zoekqueries over meerdere bronnen) de 62% retrieval-onderdrukking bij privacy-instructies verder uitdunnen. Voor het beslisprotocol betekent dit dat een zoekbaarheidstest op huidige modellen een lagergrens meet: toekomstige capaciteiten verhogen het risico, niet verlagen het.
Handelingsperspectief
Dit perspectief richt zich op de functionaris die een publicatiebeslissing voorbereidt: de privacy-officer, de voorzieningssecretaris of de onderzoeksleider die interview-transcripten, klachtendossiers of evaluatierapporten extern beschikbaar maakt. Het concrete probleem dat nu kan worden getoetst is of de overgebleven attributen in een document, na verwijdering van directe identifiers, in combinatie een unieke zoekquery vormen die via web-search herleidt naar een natuurlijk persoon. De 62% retrieval-onderdrukking bij privacy-instructies toont dat een model dat expliciet geen namen noemt, de identiteit nog steeds achterhaalt; de beslisser moet dus niet vragen "noemt het model namen?" maar "zijn beroep, organisatie en regio samen voldoende om een unieke match te genereren?"
input_doc = {
"directe_identifiers": "REDACTED",
"beroep": "directeur",
"organisatie_type": "waterschap",
"regio": "Friesland",
"unieke_gebeurtenis": "overstroming 2021"
}
query = f"{input_doc['beroep']} {input_doc['organisatie_type']} {input_doc['regio']} {input_doc['unieke_gebeurtenis']}"
retrieved_results = web_search(query) # lijst van publieke bronnen
match_score = calculate_uniqueness(retrieved_results) # 0-1
if match_score > 0.88:
output = "KLASSE A: publicatie afgekeurd, attributen voldoende uniek voor heridentificatie"
elif match_score > 0.30:
output = "KLASSE B: aanvullende masking vereist van minstens één attribuut"
else:
output = "KLASSE C: publicatie toegestaan onder voorwaarde van periodieke herbeoordeling"
De Djimit-advisory-dienst helpt je dit attribuut-gebaseerde beslisprotocol op te zetten, inclusief de technische validatie van zoekbaarheid op echte documenten. Voor een eerste verkenning van de organisatorische inpassing verwijzen wij naar /kennismaking.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.