AgentXploit: van repository tot runtime - AI-agent red teaming als compliance-product
AgentXploit: van repository tot runtime, AI-agent red teaming als compliance-product
Analyse van arXiv:2609.31318, AgentXploit: Autonomous Repository-to-Runtime Red-Teaming for AI Agents. Liang et al., 2026.
1. De kernvraag: wat test je als je een AI-agent test?
AI-agents verbinden grote taalmodellen met externe tools: bestanden wijzigen, API's aanroepen, code uitvoeren. De traditionele beveiligingsaanpak richt zich op de prompt-laag, system prompts, tool-manifesten, guardrails. Maar als een aanvaller het omringende software-ecosysteem kent, kan die aanval via de taak-gedefinieerde interface plaatsvinden zonder de agent zelf te hoeven breken.
AgentXploit formaliseert dit als een two-role auditing framework dat de repository-scoping (wat is kwetsbaar?) scheidt van de runtime-exploitatie (hoe bewijs je dat?). De Analyzer Agent traceert aanvaller-gecontroleerde inputs naar gevoelige operaties en noteert code-ondersteunde aanvalspaden; de Exploiter Agent zet deze paden om in concrete aanvallen en verfijnt ze met runtime-feedback.
2. Empirische resultaten
Het framework wordt geëvalueerd op AgentXploit-Bench: 72 reproduceerbare kwetsbaarheden verdeeld over 12 open-source AI-agent systemen en frameworks. De resultaten over drie runs:
| Metric | AgentXploit | Codex (baseline) | Token-matched Codex |
|---|---|---|---|
| End-to-end succes | 59,3% | 38,4% | 46,3% |
Op AgentDojo (waar injectiepunten al bekend zijn) bereikt de Exploiter Agent 79,2% aanvalssucces tegen 52,7% voor AgentVigil.
Drie observaties vallen op:
-
Repository-discovery en runtime-exploitatie zijn verschillende uitdagingen. Het vinden van een kwetsbaar pad in de codebase vereist structuur-begrip; het omzetten in een werkende aanval vereist runtime-feedback. Eén model dat beide doet, presteert significant slechter dan een gespecialiseerde tweerollen-opzet.
-
White-box auditing vereist geen black-box breach. De auditor heeft volledige toegang tot de repository en een gecontroleerde runtime, maar succesvolle aanvallen moeten via de taak-gedefinieerde attacker-interface verlopen en worden bevestigd door een externe verifier. Dit maakt het framework bruikbaar voor pre-deployment auditing zonder dat de productie-omgeving wordt aangetast.
-
De omvang van het aanvalsoppervlak is groter dan verwacht. Path traversal, command injection en andere klassieke webkwetsbaarheden passeren de agent-interface ongedetecteerd wanneer ze via de tool-use pipeline worden geactiveerd.
3. Nederlandse context: NIS2, BIO2 en EU AI Act
Voor Nederlandse overheidsorganisaties en vitale-infrastructuurbedrijven heeft dit directe implicaties:
NIS2 artikel 21 vereist passende beveiligingsmaatregelen tegen kwetsbaarheden. Een organisatie die AI-agents in productie neemt zonder repository-level auditing voldoet niet aan dit artikel wanneer aanvallers via de software-omgeving inbreken, ongeacht hoe sterk de prompt-guardrails zijn.
BIO2 controleobject 7.2 (patchmanagement) en 7.4 (kwetsbaarheidsbeheer) krijgen een nieuwe dimensie: het is niet meer voldoende om afhankelijkheden bij te werken; de interactie tussen het model en de omringende code moet worden geauditeerd.
EU AI Act artikel 15 (robustheid, cybersecurity) vereist pre-deployment evaluatie voor high-risk AI-systemen. Voor agents die toegang hebben tot gevoelige data of kritieke infrastructuur is een red-teaming-rapport dat alleen prompt-level tests bevat, onvoldoende onderbouwd.
De meldplicht Cyberbeveiligingswet (Cbw) wordt relevant wanneer een succesvolle aanval op een AI-agent leidt tot toegang tot interne systemen. De vraag "hebben we een incident?" verschuift van "is de agent gehackt?" naar "heeft de agent een kwetsbaarheid in de omgeving geëxploiteerd?"
4. Consulting-kansen
- Agent security audit-service voor overheidsorganisaties die AI-agents in productie nemen. Scope: repository-analyse, runtime-exploitatie, rapportage tegen NIS2/BIO2/EU AI Act. Geschatte waarde: €40.000-€80.000 per audit.
- Pre-deployment compliance-toets voor gemeenten, ZBO's en ministeries die agentic AI-piloten draaien. Dit omvat een gap-assessment van de huidige security-architectuur tegen het AgentXploit-framework.
- Training en capaciteitsopbouw voor interne security-teams om zelf repository-to-runtime audits uit te voeren.
5. Wat te doen
Organisaties die AI-agents overwegen of al inzetten, kunnen vandaag beginnen met drie stappen:
-
Inventariseer de agent-omgeving. Welke tools, API's en bestandssystemen heeft de agent toegang? Welke klassieke kwetsbaarheden (path traversal, command injection, SSRF) zitten in de omringende software?
-
Evalueer de huidige testing. Test je alleen de prompt-laag, of ook de code-interactie? Een agent die correct weigert een kwaadaardig verzoek, kan alsnog worden gecompromitteerd via een kwetsbaarheid in een tool die het wél mag aanroepen.
-
Eis white-box auditing bij inkoop. Bij aanbesteding van AI-agent-systemen moet de leverancier aantonen dat pre-deployment auditing op repository-niveau is uitgevoerd, niet alleen op model-niveau.
6. Conclusie
AgentXploit markeert een verschuiving in AI-agent security: van black-box adversarial testing naar white-box repository auditing die runtime-exploitatie als aparte uitdaging behandelt. Voor de Nederlandse publieke sector, waar NIS2 en de EU AI Act harde eisen stellen, is dit de volgende laag van compliance die organisaties moeten implementeren.
De vraag is niet meer of AI-agents veilig zijn, maar of de organisatie die ze inzet, kan aantonen dat de hele pipeline, van repository tot runtime, is geauditeerd.
Bron: Liang, W. et al. (2026). AgentXploit: Autonomous Repository-to-Runtime Red-Teaming for AI Agents. arXiv:2609.31318. Code en benchmark beschikbaar.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.