ReDiR: multi-turn decompositie-aanvallen op AI-agents neutraliseren
Tool-using LLM-agents verplaatsen security-risico's van gegenereerde tekst naar acties die externe systemen beïnvloeden. Onder multi-turn decompositie-aanvallen kan een schadelijke doelstelling worden verspreid over individueel plausibele requests en tool calls, die pas zichtbaar wordt vanuit het geaccumuleerde traject. Elke losse actie is veilig; de som is kwaadaardig.
Dat is de kern van het ReDiR-paper (arXiv:2608.25711). Bestaande defensies vertrouwen op hulp-reasoning om long-horizon security evidence te herstellen, of beoordelen acties na generatie, vaak met extra inference-kost of afhankelijkheid van runtime-specifieke actie-representaties. ReDiR (Reassembling Distributed Risk) is een generation-time defense die dit anders aanpakt.
Formeel: het decompositie-probleem
Om de bijdrage scherp te maken, definiëren we een multi-turn aanval formeel. Laat een agent een traject τ uitvoeren van n acties a₁, a₂, ..., aₙ. Een single-turn safety filter evalueert elke actie onafhankelijk:
Safe(aᵢ) ⟺ aᵢ voldoet aan beleid op zichzelf
Een decompositie-aanval verdeelt een schadelijke doelstelling G over een reeks acties zodanig dat:
∀ i : Safe(aᵢ) = true (elke actie is op zichzelf veilig)
maar: Exec(τ) leidt tot G (het traject bereikt het doel)
Een reactieve guardrail die alleen Safe(aᵢ) evalueert, mist G volledig. De veiligheid is een eigenschap van het traject, niet van de individuele actie:
Safety(τ) = f(τ) , niet f(aᵢ) per actie
Dit is dezelfde structurele beperking die wij eerder identificeerden bij trajectory-level dreigingen: de schade zit in het pad, niet in één stap.
De ReDiR-aanpak: traject-geconditioneerde actie-generatie
ReDiR conditioneert actie-generatie op traject-level security evidence. Vóór elke actie:
- Comprimeert ReDiR het huidige traject τ tot een compacte latente safety-representatie z
- Injecteert z in het frozen base model
De representatie z wordt geleerd via same-model, cross-view supervision: veilig gedrag uit een expliciete task view biedt supervisie voor het herstellen van gedistribueerde safety evidence uit het originele multi-turn traject.
Formeel:
z = Encode(τ) (traject → latente safety-representatie)
aₙ₊₁ = Model(context, z) (actie-generatie geconditioneerd op z)
Het cruciale verschil met alternatieve defensies: ReDiR integreert cross-turn security-informatie direct in het generatieproces, zonder een aparte action-level safety module. Er is geen post-generation beoordeling met extra inference-kost, maar een conditionering van de generatie zelf.
Dit leidt tot de centrale hypothese.
H1, de in-band-safety-hypothese. Multi-turn decompositie-aanvallen kunnen effectiever worden geneutraliseerd door traject-level security evidence in de actie-generatie zelf te conditioneren (in-band), dan door post-generation beoordeling met een aparte safety module (out-of-band).
H1 is falsifieerbaar. De hypothese faalt wanneer een out-of-band safety module dezelfde attack success rate-reductie behaalt tegen lagere computationele overhead. De evaluatie toont dat ReDiR attack success rates onder 8% brengt met lage overhead, wat H1 ondersteunt, maar de directe vergelijking met de beste out-of-band baseline is een open empirische vraag.
De resultaten
ReDiR is geëvalueerd op twee agent-safety benchmarks over drie model-families en acht held-out tool-domeinen:
| Metriek | Resultaat |
|---|---|
| Attack success rate | Onder 8% |
| Transfers naar onzichtbare tool-domeinen | Ja |
| Benigne fidelity | Behoud |
| Computationele overhead | Laag |
De overdracht naar onzichtbare tool-domeinen is methodologisch belangrijk: het toont aan dat de latente safety-representatie z generaliseert naar domeinen die niet in de training zaten, niet dat het een per-domein lookup is. Dit versterkt de claim dat z daadwerkelijk een traject-level veiligheidsconcept codeert.
De epistemische dimensie: latentie als onzekerheid
Een latente safety-representatie z is per definitie een compressie van het traject. Compressie verwijdert informatie. De relevante epistemische vraag is: welke safety-relevante informatie gaat verloren in z?
Dit is geen academische terzijde. Een representatie die het traject zodanig comprimeert dat een specifieke decompositie-aanval onzichtbaar wordt, is zelf een single point of failure. De cross-view supervisie, veilig gedrag uit een task view gebruiken om de latente veiligheid te herstellen, is een poging om dit te mitigeren, maar de volledigheid van de codering blijft een empirische vraag.
H2, de compressie-volledigheidshypothese. De latente safety-representatie z van ReDiR behoudt voldoende traject-level security informatie om decompositie-aanvallen te detecteren die in geen van de individuele acties zichtbaar zijn.
H2 is falsifieerbaar. De hypothese faalt wanneer een specifieke decompositie-aanval bestaat die door z wordt gecomprimeerd tot een onzichtbaar punt, terwijl de aanval wel detecteerbaar is door het ongecomprimeerde traject te inspecteren. De acht held-out tool-domeinen bieden deels ondersteuning, maar een volledige falsificatie-test over een bredere aanvalsruimte ontbreekt.
Wat dit betekent voor Nederlandse organisaties
Voor organisaties die LLM-agents uitrollen met tool access (documentverwerking, IT-automatisering, burger-service) is dit een directe waarschuwing. Bestaande safety-evaluaties testen single prompts; multi-turn decompositie-aanvallen vallen door de mazen. Elk overheidsdeploy met tool-using agents heeft een blinde vlek voor trajectory-level dreigingen.
Onder NIS2/BIO2, waar systematische beveiliging van AI-infrastructuur wordt geëist, is traject-level safety een relevante architectuurkeuze. De in-band benadering, veiligheid in de generatie conditioneren in plaats van erna te beoordelen, is een patroon dat organisaties kunnen evalueren tegen hun specifieke threat model.
Een minimale gate-set voor tool-using agents
| Gate | Te bewijzen eigenschap |
|---|---|
| G1, Traject-bewustzijn | De safety-verdediging evalueert het traject, niet alleen individuele acties |
| G2, Decompositie-resistentie | De verdediging is getest tegen aanvallen verspreid over meerdere turns |
| G3, Domein-transfer | De safety-representatie generaliseert naar onzichtbare tool-domeinen |
| G4, Fidelity | De verdediging blokkeert geen legitieme acties (benigne fidelity behouden) |
| G5, Overhead | De safety-conditionering introduceert geen onacceptabele latentie |
Conclusie
ReDiR demonstreert dat multi-turn decompositie-aanvallen niet alleen detecteerbaar zijn, maar dat de verdediging in het generatieproces zelf kan worden ingebouwd. Voor organisaties die tool-using agents in productie brengen, is traject-level safety een noodzakelijke aanvulling op single-request filters.
De H1-hypothese, dat in-band conditionering effectiever is dan out-of-band beoordeling, is de kern. En de H2-onzekerheid, wat gaat er verloren in de compressie, is de epistemische discipline die organisaties moeten bewaren bij het vertrouwen op latente safety-representaties.
Beperkingen
De resultaten zijn gebaseerd op twee benchmarks en acht tool-domeinen; de generaliseerbaarheid naar productie-workloads met complexere tool-ecosystemen vereist verdere validatie. De latente safety-representatie is model-specifiek en vereist per-model training. De directe vergelijking met de beste out-of-band baseline (H1) en een volledige compressie-volledigheidstest (H2) zijn open vragen.
Bronnen
- Dai, Ji, Li, Wang, Reassembling Distributed Risk: Trajectory-Conditioned Action Generation for Multi-Turn Agent Safety, arXiv:2608.25711, ingediend 26 aug 2026.
ReDiR: multi-turn decompositie-aanvallen op AI-agents neutraliseren
Dit artikel is exclusief beschikbaar voor nieuwsbrief-abonnees. Schrijf je in voor toegang tot 880+ artikelen.
Geen spam. Uitschrijven op elk moment.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.