Security Agents: waarom per-stadium validatie faalt onder distribution shift
We bouwen security-agents als staged pipelines. Eerst detectie, dan triage, dan response. Elk stadium valideren we apart met eigen testdata, metrics en acceptatiecriteria. Vervolgens zetten we het in productie. We hopen dat het geheel werkt.
Dat is een fout. Een nieuwe preprint op arXiv legt uit waarom. Trajectory-level garanties zijn niet composable. Je kunt per stadium een perfect gekalibreerd model hebben, toch ontspoort de agent in de praktijk volledig. De paper demonstreert dit met een cross-dataset deployment test. Single-step miscoverage bereikt 100%. De raw accuracy blijft steken op 78%. [^1]
Dit raakt de Nederlandse publieke sector direct. Overheden zetten AI-gebaseerde security-agenten in, soms voor SOC-doeleinden of geautomatiseerde compliance-checks. Ze moeten weten dat hun validatiestrategie niet klopt. NIS2 dwingt risicomanagement af. BIO2 vereist logging en monitoring. De AI Act eist robuustheid. Geen van die kaders helpt als je validatieparadigma zelf incorrect is.
Het probleem: traject-risico is niet composable
Formeel definieer ik een security-agent als een sequentie van functies. Laat ( f_1, f_2, \ldots, f_k ) de stadia zijn, elk met een eigen invoerruimte ( \mathcal{X}_i ) en uitvoerruimte ( \mathcal{Y}_i ). Het volledige traject is ( F = f_k \circ \cdots \circ f_1 ). De invoer voor stadium ( i ) is de uitvoer van stadium ( i-1 ), plus eventuele externe context.
De paper introduceert trajectory-risk. Dit is de kans dat het volledige traject een fout maakt die leidt tot een onveilige actie. Dit verschilt van per-stadium foutkans. Een stadium kan een fout maken die door een later stadium wordt gecorrigeerd. Omgekeerd kan een correct stadium een fout van een eerder stadium doorgeven en versterken.
Het belangrijkste inzicht is simpel. Als je per stadium een kans voorspelt en die kansen gebruikt om een actie uit te voeren, dan moet de gezamenlijke kalibratie kloppen. Dat is iets anders dan per-stadium kalibratie. De paper bewijst dat de compositie van gekalibreerde voorspellers niet noodzakelijk gekalibreerd is. Ze geeft een formeel raamwerk om dit te analyseren.
Wat de paper concreet laat zien
De auteurs testen een modulaire security-agent op meerdere datasets. De agent bestaat uit drie stadia: een detector die verdachte events identificeert, een classifier die het type aanval bepaalt, en een response-module die een actie voorstelt. Elk stadium is getraind en gevalideerd op een brondataset. Vervolgens deployen ze de agent op een andere dataset met een andere verdeling.
De resultaten zijn vernietigend. De single-step accuracy blijft op 78%, wat binnen de acceptatiecriteria van de meeste organisaties zou vallen. Maar de miscoverage bereikt 100%. Dit is de kans dat het traject een actie voorstelt die buiten de veilige envelop valt. Het systeem doet het op papier goed, maar in de praktijk is elke gegenereerde actie onveilig.
Dit is geen edge case. De distribution shift tussen de datasets is niet extreem. Het is vergelijkbaar met wat je ziet tussen een testomgeving en productie, of tussen twee verschillende organisaties binnen dezelfde sector. De paper toont aan dat de kalibratie van de confidence-scores volledig instort, lang voordat de raw accuracy significant daalt.
Waarom dit gebeurt: covariate shift en compositie
De onderliggende oorzaak is tweeledig. Ten eerste is er covariate shift: de invoerverdeling ( P(X) ) verandert tussen training en deployment. Ten tweede is er compositie-effect: de fout die stadium ( i ) maakt, verandert de invoerverdeling voor stadium ( i+1 ). Dit is geen onafhankelijke ruis. Het is een systematische vervorming die zich door de pipeline voortplant.
Stel dat stadium 1 een detector is die 95% van de events correct classificeert. In de training-set is de fout uniform verdeeld over de klassen. In de deployment-set blijkt de fout geconcentreerd te zijn op specifieke klassen. Hierdoor krijgt stadium 2 invoer die afwijkt van de training.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.