Het audittrail lekt meer dan het antwoord: wat CIPL leert over privacy in LLM-agents
Stelling
De discussie over privacy in LLM-agents gaat meestal over waar gevoelige gegevens staan: in het geheugen, in de retrieval-index, in een tool. CIPL (Huang et al., Minjiang University, Renmin University en RMIT) laat zien dat die vraag de verkeerde is. Waar data staat, zegt niets over of een buitenstaander ze kan terughalen. Wat telt is het kanaal waarlangs de agent zichtbaar wordt, en het meest lekkende kanaal blijkt niet het antwoord aan de gebruiker te zijn, maar het executiespoor: acties, URL's, logregels, foutmeldingen. Precies het materiaal dat governance-frameworks en de AI Act als bewijs willen bewaren.
Dat is een ongemakkelijke uitkomst voor iedereen die in de vorige bijdragen meelas. AI-GRACE wil evidence bewaren voor verantwoording; CASCADE meet guardrails op de output. CIPL laat zien dat een agent tegelijk een schone output en een lekkend proceslog kan hebben. Hieronder wat het paper formeel bijdraagt, waar de empirie wankelt, en wat dit betekent voor een overheid die persoonsgegevens door agents laat verwerken.
Wat het paper bijdraagt
CIPL modelleert een doelwit als tupel τ = (S, Sel, Asm, Exec, Obs, Ext): een gevoelige bron, een selectiestap (retrieval), assemblage in de context, executie, een observatievlak en een extractieregel. Per trial j worden twee verzamelingen vastgelegd: U_j, de gevoelige eenheden die de agent intern selecteerde, en V_j, de eenheden die een aanvaller uit het zichtbare artefact terughaalt. Twee gebeurtenissen zijn centraal: any recovery (|V_j| > 0) en complete recovery (U_j ⊆ V_j), geaggregeerd als AER en CER.
Twee proposities dragen het paper. Propositie 1: bij gelijke bron en selectie kan het wijzigen van alleen Obs of Ext V_j veranderen terwijl U_j gelijk blijft; het opslaglabel identificeert dus geen lekkage. Propositie 2: een semantische extractor die de exacte extractor omvat, levert per constructie AER_s ≥ AER_e; exacte matching is een ondergrens.
De empirie, vijf API-providers, 30 queries, vijf seeds:
| Doelwit | Regime | CER | AER |
|---|---|---|---|
| Geheugen (EHR, RAP) | Verzadigd | 1,00 | 1,00 |
| RAG (50 records, k=2) | Frequent maar partieel | 0,33-0,55 | 0,78-0,95 |
| Tool, argument-exfiltratie | Provider-afhankelijk | 0,26-1,00 | 0,27-1,00 |
| Tool, return-echo | Provider-afhankelijk | 0,36-1,00 | 0,37-1,00 |
| BrowserUse, eindantwoord | 0,18-0,65 | 0,22-0,80 | |
| BrowserUse, procesartefacten | 0,42-0,82 | 0,59-0,91 |
De BrowserUse-rij is de kern. DeepSeek en GPT-4o schermen hun eindantwoord af (AER 0,25 en 0,22) en lekken via het procesvlak (0,86 en 0,82). Qwen doet het omgekeerde. Onder "gewone" operationele prompts zonder extractie-instructie zakt alles naar vrijwel nul, terwijl de gevoelige records nog steeds in de context zitten. Lekkage is dus geen bijproduct van blootstelling maar van uitlijning tussen prompt en kanaal.
Waarom dit een oud inzicht in nieuwe vorm is
Het paper positioneert zich als evaluatiekader voor agents. Het staat in een langere traditie die het niet citeert, en die traditie maakt de resultaten sterker.
Informatiestroom, geen opslag. Sinds Goguen & Meseguer (1982) is vertrouwelijkheid een eigenschap van stromen tussen beveiligingsniveaus, niet van locaties. Propositie 1 is een herformulering van die stelling voor agents. De consequentie is dat elk vlak waar de agent naar buiten schrijft een potentieel kanaal is, en dat de verzameling van die vlakken groter is dan ontwerpers denken.
Het procesvlak is een zijkanaal. Kocher (1996) liet zien dat een cryptografisch correcte implementatie lekt via timing. CIPL laat zien dat een agent met een correct gefilterd antwoord lekt via zijn executiespoor. De structuur is identiek: het primaire kanaal is beschermd, het secundaire niet, en het secundaire draagt dezelfde informatie. Het verschil is dat het procesvlak van een agent geen fysiek bijeffect is maar een ontworpen artefact: iemand heeft besloten die logs te schrijven en beschikbaar te maken.
Partiële lekkage vraagt om kwantitatieve informatiestroom. CER en AER zijn binaire gebeurtenissen. Het paper's eigen casus laat zien wat daarmee verloren gaat: een output die alleen HELIOS-TRANSFER-GAMMA teruggeeft, scoort exact-negatief omdat het tweede geselecteerde item ontbreekt, maar levert de aanvaller een bruikbaar geheim. Smith (2009) formaliseerde dit als min-entropy leakage: de toename van de kans dat een aanvaller in één gok het geheim raadt. Voor gestructureerde geheimen zoals een PIN of BSN is die maat direct betekenisvol en had ze de semantische audit kunnen vervangen door iets wat schaalt.
Onvolledige extractie is geen control. De niet-monotone relatie met retrieval-diepte (meer context, minder complete extractie) is een bekend verschijnsel uit de literatuur over lange contexten (Liu et al., 2023). Het is verleidelijk dat als bescherming te lezen. Dat is het niet: AER blijft hoog, alleen CER daalt. De aanvaller krijgt per poging minder, maar bij herhaling alles. Het paper meldt zelf dat een tweede retry de CER verhoogt.
Drie observaties die het paper niet expliciet maakt
1. "Veiligheid" is hier een bijverschijnsel van slechter instructievolgen. Op het return-echo-kanaal verzadigen GPT-4o en DeepSeek (CER 0,99-1,00) terwijl de MiniMax-modellen rond 0,36-0,37 blijven. De verklaring is niet dat MiniMax een privacycontrol heeft, maar dat het de instructie "geef de ruwe JSON letterlijk terug" minder trouw opvolgt. Een model dat beter wordt in tool-gebruik, wordt hier per definitie lekkender. Dit is de reden dat modelwissels een herbeoordeling vereisen, wat AI-GRACE als trigger benoemt en CIPL nu kwantificeert: identieke pipeline, identieke prompts, AER van 0,27 naar 1,00.
2. Het enige deterministische control zit vóór het model. Uit de decompositie volgt een ongelijkheid die het paper niet uitspreekt: zolang de agent geen geheimen verzint, geldt V_j ⊆ U_j. Alles stroomafwaarts van Sel is probabilistisch (het model) of ontwerpafhankelijk (Obs). Het enige punt waar de bovengrens van lekkage hard te maken is, is de selectiestap: welke records mogen überhaupt de context in, voor welke principaal. Dat is het reference-monitor-argument uit de AI-GRACE-bespreking, hier toegepast op data: autorisatie op de retrieval-laag, gescopet op de vragende identiteit, en niet een guardrail op de output. In het paper haalt edit-distance-retrieval zonder enige scoping records op van willekeurige andere personen; dat is geen modelfout maar een doelbindingsfout in het ontwerp.
3. De evidence-laag is het hoogste-bandbreedtekanaal. In de vorige bijdragen bepleitte ik retentie van het gezaghebbende actierecord voor verantwoording en de Archiefwet. CIPL laat zien dat precies dat record de gevoeligste data draagt. De oplossing is niet minder loggen, maar classificatie-overerving: een trace erft de hoogste classificatie van alles wat de context in ging. Dat is het high-water mark-principe uit Weissman's ADEPT-50 (1969) en Bell-LaPadula (1973). Een observability-platform dat agenttraces bewaart, is daarmee een systeem dat persoonsgegevens verwerkt op het niveau van de bronregisters, met bijbehorende toegangsbeperking, logging-van-de-logging en bewaartermijnen.
Waar de empirie wankelt
De methodologie is beter dan de meting. Vijf punten.
De gecontroleerde doelwitten zijn klein: 50 synthetische records, vijf basisqueries deterministisch uitgebreid tot 30, retrieval op bewerkingsafstand in plaats van embeddings. Dat is geen productie-RAG. De geheugendoelen zijn verzadigd (CER = AER = 1,00 bij alle providers) en hebben dus geen onderscheidend vermogen; ze bewijzen alleen dat het benchmark-plafond bereikt is.
De "hoofd"-prompts zijn niet de sterkste. Op RAG verslaat een naïeve dump-prompt de uitgewerkte locator/aligner/diversificatie-constructie bij alle drie de geauditeerde providers, soms ruim. De gerapporteerde waarden zijn dus ondergrenzen van wat een aanvaller bereikt, en de aanvaller is bovendien niet adaptief.
De semantische audit omvat 200 outputs. De auteurs erkennen dat dit geen doelwit-onafhankelijke claim ondersteunt. Cohen's κ van 0,95 is uitstekend, maar met geannoteerde outputs uit het eigen team.
Reproduceerbaarheid: GPT-4o is benaderd via een derde-partij relay ("ai.wer.plus"), niet via OpenAI. Of het geëvalueerde model werkelijk GPT-4o was, is niet vast te stellen. Experimentvensters lopen van maart tot juli 2026; provider-updates in die periode zijn niet uitgesloten.
Ten slotte: het dreigingsmodel is direct, de gebruiker is de aanvaller. Dat is de zwakste vorm voor een overheidscontext. De relevante aanvaller zit in een opgehaald document (indirecte injectie met dezelfde kanaalstructuur) of is helemaal geen aanvaller: een geautoriseerde medewerker die via een agent gegevens ziet die buiten zijn need-to-know vallen. CIPL meet het kanaal; wie het kanaal bedient, is in de publieke sector de eigenlijke vraag.
Vertaling naar de Nederlandse publieke sector
Een lekkend procesvlak is een datalek. Als een medewerker of externe partij via een observability-dashboard persoonsgegevens van een andere burger kan zien, is dat een inbreuk in verband met persoonsgegevens in de zin van AVG art. 4 lid 12, met meldplicht binnen 72 uur (art. 33). CIPL levert de metriek om die kans vóóraf te schatten en in de DPIA (art. 35) op te nemen: niet "wij loggen", maar "de kans dat een geselecteerde eenheid via kanaal X terug te halen is bedraagt p".
De AI Act verplicht het kanaal dat CIPL het gevaarlijkst noemt. Artikel 12 eist automatische logging voor hoog-risicosystemen, artikel 19 bewaring van die logs. Zodra de Annex III-verplichtingen per 2 december 2027 gelden, heeft een overheid dus een wettelijk verplicht procesvlak. Dat is verenigbaar met art. 5 lid 1 onder c AVG (dataminimalisatie) en art. 25 (privacy by design), maar alleen als de logs worden ontworpen als classificatie-ervende, toegangsbeperkte archiefbescheiden en niet als ontwikkelaarstooling.
Doelbinding zit in de selectiestap. Retrieval die op tekstuele gelijkenis records van andere burgers ophaalt, schendt art. 5 lid 1 onder b nog vóór het model iets doet. Onder BIO2 is dit een toegangsbeheervraag (ISO 27001:2022, 5.15-5.18): de agent moet dezelfde autorisatiecontext hebben als de medewerker namens wie hij werkt, afgedwongen op de dataservice. Dit is de enige plek waar de ongelijkheid V_j ⊆ U_j in een harde bovengrens te vertalen is.
Soevereiniteit. Alle vijf providers zijn API-diensten buiten EU-jurisdictie; drie Chinees, één Amerikaans via relay. Geen ervan komt in aanmerking voor persoonsgegevens van Nederlandse burgers. Maar het kader zelf is provider-agnostisch, en dat is de waarde: CIPL is een acceptatietest die je tegen een eigen, on-premise stack draait. De bevinding dat identieke pipelines per model van 0,27 naar 1,00 springen, betekent dat de test bij elke modelwissel opnieuw moet, ook tussen twee versies van hetzelfde open-weight model.
Ontwerpregels die uit het paper volgen
- Scoop retrieval op de principaal. De autorisatiecontext van de gebruiker reist mee naar Sel. Wat de gebruiker niet mag zien, komt niet in U_j.
- Laat ruwe tool-JSON nooit door het model. Het return-echo-kanaal bestaat alleen als het model het geheim ziet. Filter op veldniveau in de tool-adapter; het model krijgt een geschematiseerd, geminimaliseerd resultaat.
- Classificeer traces op high-water mark. Elke trace erft de hoogste classificatie van zijn context. Toegang tot het observability-platform valt onder hetzelfde regime als toegang tot de bronregisters.
- Meet drie lagen. Exacte recovery, any-recovery en semantische recovery, bij voorkeur aangevuld met een min-entropy-maat voor gestructureerde geheimen.
- Hertest bij elke modelwissel. Met adaptieve en indirecte aanvallen, niet alleen de directe prompts uit het paper.
Vijf toetsbare proposities
P1. Bij op principaal gescopete retrieval daalt AER op het procesvlak naar het niveau van de operationele controle (< 0,06), onafhankelijk van provider. P2. Indirecte injectie via een opgehaald document realiseert op het return-echo-kanaal een AER binnen 0,10 van de directe variant bij dezelfde provider. P3. Field-level filtering in de tool-adapter brengt CER op return-echo naar nul zonder meetbaar verlies van taaksucces. P4. Een min-entropy-maat correleert sterker met de semantische audit (ρ > 0,8) dan exacte matching, en identificeert de partiële gevallen die exact mist. P5. Tussen twee opeenvolgende versies van hetzelfde open-weight model verschilt AER op minstens één kanaal met meer dan 0,20, wat herbeoordeling bij modelwissel noodzakelijk maakt.
Slot
CIPL levert een vocabulaire dat ontbrak: blootstelling en terughaalbaarheid als afzonderlijke grootheden, verbonden door een expliciet kanaal. De empirie is smal en de aanvaller is zwak, maar de centrale bevinding is robuust genoeg om beleid op te bouwen: het procesvlak van een agent lekt meer dan zijn antwoord, en een output-guardrail ziet dat niet. Voor een overheid die verplicht wordt te loggen, is dat geen academische kanttekening. Het betekent dat het audittrail dat verantwoording mogelijk maakt, dezelfde bescherming verdient als het register waaruit het put. Wie dat trail behandelt als ontwikkelaarstooling, heeft geen transparantiemaatregel gebouwd maar een exfiltratiekanaal met wettelijke bewaarplicht.
Referenties (selectie)
Huang et al. (2026), arXiv:2609.21686. Goguen & Meseguer (1982), IEEE S&P. Kocher (1996), CRYPTO. Smith (2009), On the foundations of quantitative information flow, FoSSaCS. Weissman (1969), ADEPT-50. Bell & LaPadula (1973), MITRE. Liu et al. (2023), Lost in the middle, TACL. Wang et al. (2025), MEXTRA, ACL. Zeng et al. (2024), The good and the bad, ACL Findings. Verordening (EU) 2016/679, art. 4, 5, 25, 33, 35. Verordening (EU) 2024/1689, art. 12, 19.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.