SecProbe: waarom statische security-benchmarks falen en adaptieve evaluatie ze vervangt
SecProbe: waarom statische security-benchmarks falen en adaptieve evaluatie ze vervangt
Analyse van arXiv:2609.33763, SecProbe: Adaptive Evaluation of Coding Agents on Cybersecurity Vulnerabilities. Luo et al., 2026.
1. Het probleem: benchmarks die niet meegroeien
LLM-gebaseerde coding agents navigeren steeds vaker door grote repositories, redeneren over bestanden heen en implementeren complexe wijzigingen met behulp van tools en tests. Deze capaciteit versterkt de consequentie van onveilig redeneren: functioneel correcte code kan nog steeds kwetsbaarheden bevatten die de agent niet herkent of aanpakt.
De centrale vraag voor de Nederlandse publieke sector, waar NIS2 en BIO2 aantoonbare beveiligingsmaatregelen eisen, is: hoe meten we efficiënt en betrouwbaar het cybersecurity-bewustzijn van een coding agent?
Bestaande evaluaties gebruiken vaste security-taken uit echte repositories of door experts geschreven taken. Ze hebben drie structurele beperkingen:
- Moeilijkheid is statisch. Dezelfde taken aan agents met verschillende capaciteit toewijzen verspilt inspanning aan taken die te makkelijk, te moeilijk of redundant zijn, terwijl belangrijke capaciteiten onontgonnen blijven.
- Uitbreiding is duur. Repositories met reproduceerbare kwetsbaarheden, betrouwbare patches en security-tests zijn schaars; nieuwe taken schrijven vereist aanzienlijke expertise.
- Veroudering. Naarmate agents verbeteren en benchmark-artefacten in trainingsdata belanden, worden vaste evaluaties minder betrouwbaar.
2. SecProbe: observe-then-act
Luo et al. introduceren SecProbe, een framework dat Item Response Theory (IRT) combineert met on-demand synthese van repository-schaal kwetsbaarheids-reparatietaken.
Het kernprincipe is een observe-then-act-lus:
- Uit geobserveerde prestaties schat SecProbe de ability van de agent, de moeilijkheid van taken en de discriminatie (onderscheidend vermogen).
- Deze schattingen bepalen welke taken de meeste aanvullende informatie opleveren.
- Wanneer geschikte taken ontbreken, coördineert SecProbe gespecialiseerde agents om nieuwe taken te synthetiseren, geconditioneerd op een target CWE-klasse en software-context.
Dit maakt taakconstructie responsief op evaluatie-uitkomsten. Het assessment-budget wordt geconcentreerd op onopgeloste capaciteitsgaten, en de taakpool vernieuwt zich naarmate agents evolueren. De centrale inzicht: de informatieve taken die een assessment nodig heeft, bestaan misschien nog niet, selectie alleen kan die gaten niet vullen.
3. De evaluatie: 353 taken, 151 CWE-types, 28,33%
Als use case bouwt SecProbe 353 taken over zes programmeertalen en 151 CWE-types, evalueert negen frontier-modellen met twee agent-harnesses.
De vergelijking met bestaande benchmarks spreekt boekdelen over CWE-dekking:
| Benchmark | # Taken | # CWE's | Moeilijkheidscontrole | Kostencontrole |
|---|---|---|---|---|
| CVE-Bench | 509 | 16 | ✗ | ✗ |
| SEC-bench | 200 | 25 | ✗ | ✗ |
| CyberGym | 1.507 | 88 | ✗ | ✗ |
| CVE-Factory | 190 | 74 | ✗ | ✗ |
| AutoBaxBuilder | 40 | 11 | ✗ | ✗ |
| SecProbe | 353 | 151 | ✓ | ✓ |
SecProbe is de enige die zowel moeilijkheids- als kostencontrole biedt, terwijl het met 151 CWE-types de breedste dekking levert.
De primaire succesmetriek is of de reparaties van de agent exploitatie-samples blokkeren die specifiek voor de geïnjecteerde kwetsbaarheden zijn ontworpen; referentie-patches leveren aanvullend bewijs van reparatie-correctheid.
Het resultaat is ontnuchterend: success rates pieken op 28,33%. Zelfs de sterkste geëvalueerde configuratie faalt in meer dan zeven van de tien kwetsbaarheids-reparatietaken.
4. Efficiëntie: tot 29,5% minder taken
De tweede bevinding betreft de efficiëntie van adaptieve evaluatie. Vergeleken met random en one-shot baselines bereikt SecProbe vergelijkbare agent-ability-schattingen terwijl het agents tot 29,5% minder taken laat oplossen.
Dit is geen marginale winst. Voor organisaties die coding agents inzetten, vertaalt dit zich direct naar lagere evaluatiekosten en snellere feedback-loops. Meer nog: het betekent dat een adaptief assessment een even nauwkeurig beeld van capaciteit geeft met minder inspanning, een cruciaal punt voor wie capaciteitsmeting wil integreren in een continue assurance-cyclus.
5. Nederlandse context: NIS2, BIO2 en de inzet van coding agents
Voor de Nederlandse publieke sector heeft SecProbe directe implicaties:
NIS2 artikel 21 vereist aantoonbare, herhaalbare beveiligingsmaatregelen. Organisaties die coding agents inzetten voor softwareontwikkeling, moeten kunnen aantonen dat zij de kwetsbaarheids-awareness van die agents hebben getest. Een statische benchmark die slechts 16-25 CWE-types dekt, is onvoldoende, de SecProbe-aanpak met 151 CWE-types biedt een betere basis.
BIO2 controleobject 7.4 (kwetsbaarheidsbeheer) vereist dat organisaties kwetsbaarheden identificeren en mitigeren. De 28,33% succesratio toont aan dat frontier-modellen nog niet betrouwbaar zijn voor autonome kwetsbaarheids-reparatie. Menselijke review blijft onmisbaar.
De opkomst van agentic software development, waar agents autonoom code schrijven, testen en repareren, creëert een nieuw compliance-vraagstuk. Wie is verantwoordelijk wanneer een coding agent een kwetsbaarheid introduceert die een menselijke developer had herkend? De SecProbe-methodologie biedt een meetinstrument om deze vraag te beantwoorden.
6. Wat te doen
Organisaties die coding agents inzetten of overwegen:
-
Evalueer niet op statische benchmarks. Een agent die 90% scoort op een benchmark met 16 CWE-types, zegt weinig over zijn vermogen om een SQL-injectie in jouw specifieke codebase te herkennen.
-
Meet repair-capaciteit, niet alleen detectie. Het identificeren van een kwetsbaarheid is niet hetzelfde als het repareren ervan zonder functionaliteit te breken. SecProbe meet beide.
-
Eis exploit-gebaseerde validatie. Een "reparatie" die geen exploitatie-sample blokkeert, is geen reparatie. Reference patches zijn aanvullend bewijs, geen primaire metriek.
-
Adopteer adaptieve evaluatie. Naarmate je agent verbetert, moet je evaluatie meebewegen. Een statische benchmark veroudert; een adaptieve aanpak blijft informatief.
-
Houd menselijke review in de lus. Met 28,33% piek succesratio is autonome kwetsbaarheids-reparatie door frontier-modellen nog niet betrouwbaar voor productieomgevingen.
7. Conclusie
SecProbe markeert een verschuiving in hoe we de cybersecurity-bewustheid van coding agents meten. Door IRT-gebaseerde adaptieve selectie te combineren met on-demand synthese, lost het de drie structurele beperkingen van statische benchmarks op: moeilijkheid wordt adaptief, uitbreiding wordt gesynthetiseerd, en veroudering wordt tegengegaan door een zichzelf vernieuwende taakpool.
Maar de meest urgente boodschap is de 28,33%. Voor organisaties die coding agents inzetten onder NIS2 en BIO2, is dit geen academisch cijfer maar een compliance-signaal: de huidige frontier-modellen kunnen nog geen betrouwbare autonome kwetsbaarheids-reparatie leveren. Wie dat wel veronderstelt, bouwt een valse assurance.
De vraag is niet of coding agents kwetsbaarheden introduceren, dat doen ze. De vraag is of uw organisatie de instrumenten heeft om dat te meten, en of zij de 28,33% serieus neemt.
Bron: Luo, X., Huang, Y., Guo, K., He, P., Zou, C., Gao, C., Li, L., Ma, Y., Xu, Z., Chen, Z., Han, Y. & Zhang, X. (2026). SecProbe: Adaptive Evaluation of Coding Agents on Cybersecurity Vulnerabilities. arXiv:2609.33763.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.