Je AI-agent leert van zijn fouten. Dat is precies het probleem.
AI-agenten die leren van hun eigen interacties zijn geen sciencefiction meer. Ze draaien bij gemeenten als balieassistenten, bij zorginstellingen als triage-systemen, en bij financiële instellingen als compliance-checkers. Het verkoopverhaal klinkt aantrekkelijk. De agent wordt beter naarmate hij meer doet, omdat hij ervaring destilleert naar herbruikbare skills. Dat verhaal klopt niet.
Nieuw onderzoek op arXiv toont aan dat deze zelf-evoluerende systemen een ernstige kwetsbaarheid hebben. Je moet dit kennen voordat je ze in een NIS2-kritisch proces zet. Met een minimale bijdrage van 10% kwaadaardige data kan een aanvaller schadelijk gedrag inbedden in 91% van de gevallen. Dat is geen randgeval. Dat is een structureel probleem.
Het betreft het paper Trajectory Poisoning in Self-Evolving Agent Skill Systems, dat de kwetsbaarheid over zes mainstream LLM's en twee evolutie-architecturen aantoont.
Wat is trajectory poisoning precies?
Ik leg eerst het mechanisme uit, want het is subtieler dan traditionele prompt injection of data poisoning.
Een self-evolving agent systeem werkt in drie fasen:
- Trajectory capture: de agent voert taken uit en logt elke stap. Dit noemen we de trajectories.
- Skill distillation: een LLM destilleert terugkerende patronen uit die trajectories naar herbruikbare skills.
- Skill retrieval: bij nieuwe taken selecteert de agent relevante skills uit zijn groeiende bibliotheek.
De kwetsbaarheid zit in fase 2. De distillatiestap gaat ervan uit dat de trajectories representatief zijn voor legitiem gebruik. Een aanvaller die een klein deel van de interacties kan beïnvloeden, kan die aanname breken.
Formeel gedefinieerd: laat ( T = {t_1, ..., t_n} ) de verzameling trajectories zijn en ( S ) de gegenereerde skill. De distillatiefunctie ( f: T \rightarrow S ) is deterministisch gegeven de context. Een aanvaller wil een subset ( T' \subset T ) met ( |T'| \leq 0.1|T| ) zodanig dat ( f(T \cup T') ) een skill produceert die schadelijk gedrag vertoont bij retrieval.
Het onderzoek toont aan dat deze aanval slaagt in 546 van de 600 trials. Zes mainstream LLM's, twee verschillende evolutie-architecturen. Dit is geen theoretisch model.
Waarom distillatie de aanval niet filtert
Je zou denken dat de distillatiestap het oplost. Het is zelf een LLM, die kan toch kwaadaardige patronen herkennen? Het onderzoek laat zien dat het tegendeel waar is. De distillatiestap is juist de zwakste schakel.
De reden is dat distillatie patronen zoekt in vorm, niet in intentie. Een skill die efficiënt omgaan met klantgegevens heet, maar stiekem een regel bevat die bepaalde verzoeken anders afhandelt, ziet er voor het distillatie-model identiek uit aan een legitieme skill. De kwaadaardige variant is niet te onderscheiden op basis van de tekstuele representatie alleen.
Het onderzoek gebruikte een specifieke aanvalsmethode genaamd skill poisoning. De aanvaller injecteert trajectories die een bestaande skill subtiel wijzigen, niet vervangen. Het resultaat is een skill die bij retrieval normaal lijkt, maar onder specifieke omstandigheden afwijkend gedrag vertoont. Denk aan bepaalde gebruikers of vragen.
Dit is geen prompt injection. De skill is geen losse prompt die je kunt filteren. Het is een gedestilleerde representatie van gedragspatronen, opgeslagen in vector databases en opgehaald via embedding similarity.
De aanval in de praktijk
Het onderzoek gebruikte een specifieke opzet die ik hier kort samenvat, omdat de details relevant zijn voor je eigen risico-inschatting.
De onderzoekers bouwden een self-evolving agent systeem met twee architecturen: een op Reflectie gebaseerde en een op Plan-and-Execute gebaseerde variant. Ze gebruikten zes LLM's, waaronder GPT-4o, Claude 3.5 Sonnet en Llama 3.1 405B. De agenten voerden taken uit in een gesimuleerde omgeving met een taakverdeling die lijkt op enterprise workflows: data ophalen, transformeren, en rapporteren.
De aanval verliep in drie stappen:
- De aanvaller observeert het systeem en identificeert veelgebruikte skills.
- De aanvaller injecteert 10% extra trajectories die een bestaande skill subtiel wijzigen.
- De agent haalt de gemanipuleerde skill op en voert deze uit.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.