Ajar: Open Privilege als Derde Dimensie bij het Meten van Agent Defenses
Een AI-agent die banktransacties uitvoert, mag alleen betalen wanneer de gebruiker dat expliciet vraagt. Dat lijkt evident, maar de manier waarop we agent defenses vandaag meten vertelt slechts een deel van het verhaal. Benchmarks als AgentDojo beoordelen verdedigingen op twee assen: slaagt de aanval (attack success) en werkt de agent nog steeds goed voor legitieme taken (benign utility). Een defense kan op beide assen uitstekend scoren, terwijl het onderwater een transfer, een verwijdering of een brede leesoperatie mogelijk maakt die geen enkele taak ooit nodig had. Deze blinde vlek is precies wat Sharma, Jiang, Lin en Chen in Ajar: Measuring Open Privilege in Agent Defenses blootleggen.
De Grens tussen Agent en Tool
Agent defenses zitten op de grens tussen het taalmodel en de tools die het aanroept. Ze moeten access control afdwingen, informatiestromen isoleren en ervoor zorgen dat een agent niet doet wat de gebruiker niet gevraagd heeft. Dat is hard genoeg in een traditioneel systeem, maar bij AI-agents wordt het extra complex omdat het model zelf interpreteert welke acties bij een taak horen. De data die de agent leest terwijl hij werkt, kan via indirect prompt injection de agent op een ander spoor zetten.
Het klassieke voorbeeld uit AgentDojo illustreert dit scherp. Een agent leest een huurverhogingsbericht van een verhuurder en moet het vaste huurbedrag aanpassen. Dat bericht bevat echter ook een geinjecteerde tekst die de agent vraagt om hetzelfde betaalcommando te gebruiken, maar gericht op een ander bedrag en een andere begunstigde dan de gebruiker ooit heeft genoemd. Het commando dat de taak nodig heeft en het commando dat de aanvaller wil, gebruiken dezelfde tool met verschillende argumenten. De benchmark herkent beide als aparte calls, maar de defense ziet slechts een tool-aanroep.
Dit is waar de huidige evaluatie faalt. Als een defense een aanval blokkeert, wordt dat gescoord als succes. Als de agent zijn taak voltooit, wordt dat gescoord als utility. Maar wat als de defense structureel meer privileges toestaat dan de taak ooit vereist? Dan is er sprake van open privilege: onnodige toegang die latent aanwezig is en door elke aanval, direct of indirect, kan worden uitgebuit.
Ajar: Directe Meting van Open Privilege
Ajar meet open privilege direct, zonder af te leiden uit andere metrics. Het werkt als een plug-in op een bestaande benchmark zoals AgentDojo. Voor elke benigne taak bouwt Ajar kandidaat-tool-calls die de taak niet nodig heeft. Als de defense zo'n call toestaat, telt dat als open privilege. Deze calls worden aangeboden op elk punt waar de agent zou kunnen handelen, zodat de defense geen enkele beslismoment kan ontlopen.
Het resultaat is een derde as naast attack success en benign utility. Een defense kan theoretisch alle aanvallen blokkeren en alle taken voltooien, terwijl het tegelijkertijd een enorm oppervlak aan onnodige privileges openhoudt. Die combinatie is gevaarlijk omdat het een vals gevoel van veiligheid geeft. De defense lijkt goed te presteren, maar de onderliggende architectuur is breed toegankelijk voor toekomstige aanvallen die de huidige evaluatie niet dekken.
De methodologie is elegant omdat ze bestaande benchmark infrastructuur hergebruikt. Ajar neemt de taken, tool schemas, referentie-oplossingen en goal states over van AgentDojo en voegt daar de privilege-meting aan toe. Er is geen nieuwe benchmark nodig, geen nieuwe taakset, geen nieuwe aanvalscollectie. Open privilege wordt gemeten met dezelfde precisie als de andere twee assen, wat directe vergelijkbaarheid mogelijk maakt.
Vijf Defenses op de Drie Assen
De auteurs testen vijf defenses: Progent, CaMeL, AC4A, Permission Assistant en Claude Code Auto mode. De resultaten tonen dat open privilege sterk verschilt tussen defenses die op attack success en utility vergelijkbaar lijken.
Twee defenses laten bijna evenveel privilege lekken, maar verschillen sterk in het aantal benigne taken dat ze voltooien. Dat betekent dat de ene defense zijn strakheid betaalt met lagere utility, terwijl de andere zijn utility behoudt door meer onnodige toegang toe te staan. Dit is een essentieel inzicht voor auditors: utility alleen zegt niets over veiligheid, en lage attack success alleen zegt niets over de onderliggende privilege-expositie.
Een defense koopt een deel van zijn strakheid door benigne calls te weigeren die de taak wel degelijk mocht uitvoeren. Dat leidt tot lagere utility, maar ook tot lager open privilege. Het dilemma is duidelijk: strakkere access control kost functionaliteit. Maar zonder expliciete meting van open privilege blijft die afweging onzichtbaar. Auditteams kunnen dan niet beoordelen of een defense echt strakker is, of simpelweg conservatiever in wat het toestaat.
Het belangrijkste resultaat is dat open privilege niet af te leiden is uit attack success of benign utility. De correlatie is te zwak om de ene metric uit de andere te infereren. Dit maakt Ajar onmisbaar voor een volledige veiligheidsbeoordeling. Een defense die op papier uitstekend presteert, kan in de praktijk een privilege-oppervlak aanhouden dat elke nieuwe aanvalsvorm tot een kritiek incident maakt.
Implicaties voor de Publieke Sector
Voor overheidsorganisaties die AI-agenten inzetten, heeft dit directe gevolgen. De EU AI Act vereist risicobeheersing en adequate beveiligingsmaatregelen voor high-risk AI-systemen. De NIS2-richtlijn legt nadruk op beveiliging van digitale infrastructuur en incidentrapportage. Het BIO2-kader (Baseline Informatiebeveiliging Overheid 2) vraagt expliciet om passende beheer-maatregelen op het grensvlak tussen systemen.
Agent defenses vallen precies in dit snijvlak. Ze zitten tussen het AI-model en de operationele tools, en moeten zorgen dat de agent zijn mandaat niet overschrijdt. Maar als die evaluatie alleen gebeurt op basis van attack success en utility, mist de auditor het feitelijke privilege-oppervlak. Een systeem kan voldoen aan de letter van de beveiligingseis, terwijl het de geest ervan schendt door onnodige toegang open te houden.
Ajar biedt hier een bruikbaar raamwerk. Door open privilege als derde as toe te voegen, krijgt een auditteam een vollediger beeld van de werkelijke veiligheidspositie. Dit is met name relevant voor risicoacceptatie onder BIO2, waarbij een beheerder expliciet moet verantwoorden welke risico's worden geaccepteerd en welke worden gemitigeerd. Zonder meting van open privilege is die verantwoording onvolledig.
In de praktijk betekent dit dat agent-security audits voor overheidsprojecten drie metrics moeten rapporteren, niet twee. Attack success laat zien of bekende aanvallen worden gestopt. Benign utility laat zien of het systeem nog functioneert voor legitieme taken. Open privilege laat zien hoeveel aanvalssurface er onnodig bestaat, onafhankelijk van wat er momenteel mee gebeurt. Alleen met die drie metrics samen kan een auditteam een gefundeerd oordeel geven over de acceptabiliteit van het systeem.
Daarnaast biedt Ajar een methode om regressies bij te houden. Wanneer een agent defense wordt bijgewerkt, kan een auditteam niet alleen controleren of de nieuwe versie meer aanvallen stopt of meer taken voltooit, maar ook of het onbedoeld meer privileges openzet. Dit voorkomt dat beveiligingsupdates leiden tot een groter impliciet risico, iets wat zonder expliciete privilege-meting onzichtbaar zou blijven.
Conclusie
De huidige evaluatie van agent defenses is onvolledig zolang open privilege ontbreekt als meetbare dimensie. Ajar lost dit op door onnodige tool-toegang direct te meten, met behulp van bestaande benchmark infrastructuur. De empirische resultaten op vijf defenses bewijzen dat attack success en benign utility onvoldoende zijn om het werkelijke privilege-oppervlak te beoordelen. Voor de publieke sector, waar AI-agenten onder NIS2, BIO2 en de EU AI Act moeten voldoen aan strikte audit-eisen, biedt Ajar een noodzakelijke uitbreiding van de beoordelingsmethodiek. Open privilege verdient een vaste plek in het auditprotocol voor agent-security.
Referenties
Sharma, R. K., Jiang, L., Lin, Z., & Chen, S. (2026). Ajar: Measuring Open Privilege in Agent Defenses. arXiv:2609.26900. https://arxiv.org/abs/2609.26900
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.