ReDiR: multi-turn decompositie-aanvallen op AI-agents neutraliseren
Tool-using LLM-agents verplaatsen security-risico's van gegenereerde tekst naar acties die externe systemen beïnvloeden. Onder multi-turn decompositie-aanvallen kan een schadelijke doelstelling worden verspreid over individueel plausibele requests en tool calls, die pas zichtbaar wordt vanuit het geaccumuleerde traject.
Dat is de kern van het ReDiR-paper (arXiv:2608.25711). Bestaande defensies vertrouwen op hulp-reasoning om long-horizon security evidence te herstellen, of beoordelen acties na generatie, vaak met extra inference-kost of afhankelijkheid van runtime-specifieke actie-representaties.
De oplossing: traject-geconditioneerde actie-generatie
ReDiR (Reassembling Distributed Risk) is een generation-time defense die actie-generatie conditioneert op traject-level security evidence. Vóór elke actie:
- Comprimeert ReDiR het huidige traject tot een compacte latente safety-representatie
- Injecteert die in het frozen base model
De representatie wordt geleerd via same-model, cross-view supervision: veilig gedrag uit een expliciete task view biedt supervisie voor het herstellen van gedistribueerde safety evidence uit het originele multi-turn traject. Dit stelt ReDiR in staat cross-turn security-informatie direct in het generatieproces te integreren, zonder een aparte action-level safety module.
De resultaten
ReDiR is geëvalueerd op twee agent-safety benchmarks over drie model-families en acht held-out tool-domeinen. Het reduceert attack success rates tot onder 8%, transfereert naar onzichtbare tool-domeinen, en behoudt benigne fidelity met lage computationele overhead.
Wat dit betekent voor Nederlandse organisaties
Voor organisaties die LLM-agents uitrollen met tool access, documentverwerking, IT-automatisering, burger-service, is dit een directe waarschuwing. Bestaande safety-evaluaties testen single prompts; multi-turn decompositie-aanvallen vallen door de mazen. Elk overheidsdeploy met tool-using agents heeft een blinde vlek voor trajectory-level dreigingen.
Onder NIS2/BIO2, waar systematische beveiliging van AI-infrastructuur wordt geëist, is dit een relevant architectuurpatroon: safety die niet per actie maar over het traject werkt.
Conclusie
ReDiR demonstreert dat multi-turn decompositie-aanvallen niet alleen detecteerbaar zijn, maar dat de verdediging in het generatieproces zelf kan worden ingebouwd. Voor organisaties die tool-using agents in productie brengen, is traject-level safety een noodzakelijke aanvulling op single-request filters.
Beperkingen
De resultaten zijn gebaseerd op twee benchmarks en acht tool-domeinen; de generaliseerbaarheid naar productie-workloads met complexere tool-ecosystemen vereist verdere validatie. De latente safety-representatie is model-specifiek en vereist per-model training.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.