PrivDrift: user-secret leakage onder topic drift in actieve LLM-conversaties
Wanneer een gebruiker een geheim deelt met een large language model in een gesprek van meerdere beurten, verwacht hij dat dat geheim begraven blijft in het verleden. Maar wat gebeurt er als het gesprek afdwaalt? Als de gebruiker van onderwerp wisselt, van werkgever praat, of simpelweg een andere richting inslaat? Blijft het geheim dan veilig in de context, of komt het boven water zodra iemand de juiste drak uitoefent?
Onderzoekers van West Virginia University stellen met PrivDrift een helder en hard antwoord op deze vraag. Hun bevinding is ongemakkelijk in haar eenvoud: topic drift is geen privacy-grens. Zelfs wanneer het gesprek ver weg is gedreven van het oorspronkelijke onderwerp, blijven gevoelige informatie en gedeelde secrets leesbaar en extraheerbaar voor een aanvaller die de juiste persuasie toepast.
De PrivDrift-benchmark
De onderzoekers bouwden een gecontroleerde benchmark van duizend multi-turn dialogen. In elk gesprek werd een geheim gezaaid, denk aan een creditcardnummer, een persoonlijk identificatienummer of een medische aanduiding. Vervolgens introduceerden ze content-dense drift turns: bewuste afwijkingen van het onderwerp die het gesprek op een volledig ander spoor zetten. Na afloop voerden ze gestandaardiseerde extractieprobes uit om te testen of het model het geheim nog kon reproduceren.
De opzet is methodologisch strak. In plaats van op geluk te varen, controleerden de onderzoekers voor model, secret type en persuasion intensity. Dat maakt de resultaten vergelijkbaar over drie verschillende LLMs met extended context windows. De benchmark meet niet of een model in het algemeen loslippig is; hij meet of een specifiek geheim in een specifieke conversatie terugkomt, ondanks dat het gesprek van onderwerp is veranderd.
Dialoogniveau leakage: het cijfer
De centrale uitkomst is een dialoogniveau hybrid leakage van 38,7% tot 54,6% over de drie geteste modellen. Dat wil zeggen dat in bijna de helft van alle gesprekken waarin een geheim werd gedeeld en het onderwerp vervolgens afdwaalde, dat geheim alsnog kon worden onttrokken. De variatie is sterk afhankelijk van het specifieke model, het type geheim en de intensiteit van de persuasiepoging, maar de ordegrootte is consistent. Het is geen uitzondering; het is een structureel gedragspatroon.
Dit cijfer raakt aan het hart van het privacy-debat rond LLMs. De gangbare veronderstelling is dat gevoelige informatie veilig is zolang het gesprek niet expliciet op die informatie terugkomt. PrivDrift toont dat die veronderstelling fout is. Een secret blijft niet veilig door de afstand in het gesprek; het blijft actief in de context window, ongeacht hoeveel tussenliggende beurten er zijn.
Topic drift als valse vriend
Een tweede, scherpere bevinding is dat extra topic drift leakage niet betrouwbaar reduceert. Meer afleiding, meer onderwerpverandering, meer context tussen geheim en extractiepoging, het maakt voor de geteste modellen geen consistent verschil. Het privacy-risico is geen kwestie van onmiddellijke jailbreak of van training-data memorization alleen. Het is een persistent behavioral failure mode: het model vergeet het geheim niet, ook niet wanneer het gesprek ver weg is van het oorspronkelijke onderwerp.
Voor organisaties die LLMs inzetten voor klantcontact, zorg of overheidsdiensten is dit een fundamentele waarschuwing. Je kunt niet vertrouwen op topic drift als natuurlijke privacybescherming. Het feit dat een gesprek van richting verandert, betekent niet dat eerder gedeelde informatie uit het geheugen van het model verdwijnt.
Nederlandse en Europese relevantie
De bevindingen zijn direct relevant voor de toepassing van de Algemene Verordening Gegevensbescherming (AVG) en de General Data Protection Regulation (GDPR). Artikel 5 van de AVG eist data minimalisatie: alleen die persoonsgegevens verwerken die noodzakelijk zijn voor het doel. Artikel 32 verplicht passende technische en organisatorische maatregelen om verwerking te beveiligen. Als een LLM in een multi-turn sessie gevoelige informatie retaineert die niet meer noodzakelijk is voor het huidige onderwerp, ontstaat de vraag of aan artikel 5 voldaan wordt.
Voor de gezondheidssector komt daar NEN 7510 bij, de norm voor informatiebeveiliging in de zorg. Die norm eist dat vertrouwelijke informatie beschermd blijft tegen ongeautoriseerde toegang, ook in transit en in verwerking. Een model dat medische gegevens vasthoudt na topic drift voldoet niet automatisch aan die eis, ongeacht of het gesprek oorspronkelijk beveiligd leek.
De implicatie is dat een organisatie die multi-turn LLM-conversaties gebruikt moet kunnen aantonen dat eerder gedeelde PII niet langer beschikbaar is dan strikt noodzakelijk. Dat vereist expliciete context-isolatie, geheugenwisseling of retentiebeperking, niet het vertrouwen dat topic drift vanzelf opruimt.
Implicatie voor overheids-AI
Overheden die AI-systemen inzetten voor burgercontact, sociale zaken of gezondheidsdiensten moeten dit risico expliciet in hun privacy-impactanalyses opnemen. Een multi-turn gesprek met een burger is geen reeks losse vragen en antwoorden. Het is een doorlopende context waarin eerder gedeelde persoonsgegevens actief blijven, ook wanneer het gesprek van richting verandert. Topic drift is geen natuurlijke grens die die informatie opsluit.
De implicatie is technisch en organisatorisch. Technisch betekent het dat context-window management, data-retentiebeleid en expliciete geheugenwisseling tussen onderwerpen noodzakelijk zijn. Organisatorisch betekent het dat gebruikers niet alleen geïnformeerd moeten worden over het verwerken van hun gegevens, maar ook over het feit dat topic drift de bescherming van eerder gedeelde informatie niet garandeert.
Conclusie
PrivDrift maakt meetbaar wat tot nu toe vermoed werd: topic drift in actieve LLM-conversaties is geen privacy-grens. Met leakage percentages van 38,7% tot 54,6% is het risico van user-secret exposure structureel en persistent. Voor organisaties die onder de AVG, GDPR en NEN 7510 vallen, betekent dit dat de inzet van multi-turn LLMs zonder expliciete context-isolatie en retentiebeleid een aantoonbaar privacy-risico vormt. De vraag is niet of dit risico bestaat, maar of organisaties het erkennen en mitigeren voordat de toezichthouder het voor hen doet.
Referenties
Maldonado Romero, PrivDrift: Auditing User-Secret Leakage Under Topic Drift in Active LLM Conversations, arXiv:2609.30094, West Virginia University. https://arxiv.org/abs/2609.30094
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.