Proactieve guardrails: waarom jouw LLM-agenten een risk-aware world model nodig hebben
De meeste guardrails voor LLM-agenten werken als brandblussers. Ze kijken naar de actie die de agent nu wil uitvoeren, beoordelen die op gevaar en grijpen in als het misgaat. Maar wat als het gevaar niet in één actie zit, maar in het pad dat de agent bewandelt? Een ogenschijnlijk onschuldige API-call, een simpele database-query of een nette e-mail naar een collega. Geen van die acties is op zichzelf riskant. Samen vormen ze een traject dat langzaam maar zeker afbuigt naar een state waar de agent toegang heeft tot persoonsgegevens die hij niet mag zien. Of hij neemt een beslissing die onder de AI Act als high-risk wordt geclassificeerd.
Dat is het probleem dat DreamGuard aanpakt. Het paper DreamGuard: Runtime Guardrail voor LLM-Agenten, dat op arXiv verscheen, introduceert een runtime guardrail die niet reactief per actie werkt, maar proactief over de hele trajectorie kijkt. Het bouwt een risk-aware world model dat voorspelt waar de agent over vijf, tien of twintig stappen uitkomt. Precies dit vraagt Artikel 14 van de EU AI Act van je: human oversight die verder kijkt dan de volgende actie.
Waarom reactieve guardrails structureel tekortschieten
Laat ik eerst scherp krijgen wat er mis is met de huidige aanpak. De meeste guardrails volgen een eenvoudig principe: je hebt een policy, je hebt een actie en je checkt of de actie binnen de policy past. Denk aan een regex die creditcardnummers filtert, een blocklist voor IP-adressen of een LLM-based classifier die de intentie van een prompt beoordeelt. Die systemen werken prima voor individuele acties, maar ze missen de context van het traject.
Stel je een agent voor die een zorgverleningsproces ondersteunt. Hij heeft toegang tot een API met patiëntgegevens, een e-mailsysteem en een documentgenerator. Elke individuele actie is veilig: een GET-request op een endpoint, een e-mail naar een intern team of een PDF-generatie. Maar als de agent in een bepaalde volgorde die acties combineert, kan hij een dossier samenstellen dat hij niet mag inzien. Ook kan hij een beslissing voorbereiden die onder de AI Act valt zonder dat er een mens aan te pas komt. Een reactieve guardrail ziet alleen de losse acties. DreamGuard ziet het pad.
Het paper formaliseert dit met een Markov decision process (MDP). De agent beweegt door een state space en elke actie is een transitie. Een guardrail is een functie die bij elke state een actie goed- of afkeurt. Een reactieve guardrail keurt alleen de volgende actie goed op basis van de huidige state. DreamGuard gebruikt daarentegen een wereldmodel dat de kans op een gevaarlijke state in de toekomst schat. Het keurt een actie af als die de kans op een toekomstige schending boven een drempel brengt, zelfs als de actie zelf onschuldig is.
Het wereldmodel: risico over de horizon
Het kernidee van DreamGuard is een world model dat de transitiedynamiek van de agent leert. Formeel heb je een verzameling states S, een verzameling acties A en een transitiefunctie T(s, a) -> s'. Een wereldmodel is een geschatte transitiefunctie T_hat, getraind op eerdere interacties van de agent. Daarnaast heb je een risk-functie R(s) die aangeeft hoe gevaarlijk een state is. Dit gaat bijvoorbeeld over toegang tot een verboden resource of een actie die onder de AI Act valt.
DreamGuard combineert die twee. Bij elke stap berekent het niet alleen R(s_current), maar ook de verwachte risico's over een horizon H. Het gebruikt een value-achtige benadering: V(s) = R(s) + gamma * max_a V(T_hat(s, a)). Die V-waarde is de expected cumulative risk. Als V(s_current) boven een drempel ligt, grijpt de guardrail in, ook al is R(s_current) laag. Het punt is dat V rekening houdt met paden die via ogenschijnlijk veilige acties naar gevaarlijke states leiden.
Het paper toont aan dat dit significant beter presteert dan reactieve methoden op benchmarks met long-horizon taken. In experimenten met een agent die een virtuele omgeving verkent, ving DreamGuard 78% meer traject-level violations dan een state-of-the-art reactieve guardrail.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.