Trident: waarom AI-cyberdefensie faalt tegen adaptieve aanvallers
We dachten lang dat autonome cyberverdediging met Deep Reinforcement Learning (RL) veilig was. Die gedachte klopt niet meer. Een nieuw arXiv-paper introduceert Trident. Deze adaptieve aanvaller breekt RL-systemen systematisch. [^1]
Trident gebruikt een LLM. Training gebeurt via Reinforcement Learning with Verifiable Rewards (RLVR). Het doel is zwaktes in de RL-verdediger vinden en uitbuiten. De verdediger trainde alleen tegen statische, heuristische red-teamers. Trident bewijst dat die robuustheid niet bestaat.
Dit raakt Nederlandse overheidsorganisaties direct. Zij overwegen AI-gedreven security. Gemeenten, uitvoeringsorganisaties en zorginstellingen kijken naar autonome incident response. Vertrouwen op deze systemen zonder vragen is riskant. Dit paper bewijst het tegendeel.
Wat is Deep RL-cyberdefensie?
Een RL-verdediger volgt een beleid π: S → A. Een toestand zoals netwerkverkeer of systeemlogboeken leidt tot een actie. Denk aan blokkeren, quarantaine of een alert. Training gebeurt door interactie met een omgeving. Vaak is dat een simulatie. De beloningsfunctie R beloont het stoppen van aanvallen. False positives krijgen een straf.
Formeel definieer je een Markov Decision Process (S, A, P, R, γ). Dit omvat toestandsruimte S, actieruimte A, transitiekansen P(s'|s,a), beloningsfunctie R(s,a) en discountfactor γ. Het doel is een beleid π. Deze maximaliseert de verwachte cumulatieve beloning: J(π) = E[Σ γ^t R(s_t, a_t)]
Traditioneel train je zo'n beleid met algoritmes als PPO of SAC. De omgeving bevat een gesimuleerde aanvaller. Vaak is dat een script met vaste patronen. Die aanvaller blijft statisch. Hij verandert zijn strategie niet tijdens de training.
Trident: de adaptieve tegenstander
Trident is geen statische red-teamer. Het is een tweede RL-agent. Deze leert de verdediger verslaan. Het verschil zit in de actieruimte. Trident gebruikt een LLM om acties te genereren. RLVR verifieert die acties.
Concreet werkt Trident zo:
- De LLM genereert een reeks acties. Denk aan een exploit-payload, laterale beweging of privilege-escalatie.
- Een verifier controleert de geldigheid. De beloningsfunctie past zich aan op basis van succes tegen de verdediger.
- Het RL-algoritme, bijvoorbeeld PPO, traint het LLM-beleid. Het doel is acties genereren die de verdediger consequent verslaan.
De training verloopt in dezelfde omgeving als die van de verdediger. Trident heeft toegang tot dezelfde toestandsrepresentaties en actieprimitieven. Er is één verschil. Trident leert adaptief. De verdediger trainde tegen een vaste tegenstander.
Het paper toont iets opmerkelijks. Trident verslaat een verdediger binnen 5000 episodes. Die verdediger trainde met 1 miljoen episodes tegen statische red-teamers. Tegen de statische aanvaller haalt de verdediger 99% succes. Tegen Trident zakt dit naar 12%.
Waarom de verdediger faalt
Het probleem ligt elders. RL-beleid generaliseert naar de distributie van trainingsomgevingen. Niet naar alle mogelijke omgevingen. Een verdediger trainde tegen een beperkte set aanvalspatronen. Het beleid leert die patronen herkennen. Een robuuste representatie van "aanval" in het algemeen ontbreekt.
Trident ontdekt die blinde vlekken. Het LLM genereert acties buiten de trainingsdistributie. Ze vallen wel binnen de actieruimte van de omgeving. De RLVR-verifier zorgt dat alleen acties met positieve beloning versterken. Zo ontstaat een aanvaller. Deze vindt precies die gaten in de verdediging.
Een voorbeeld uit het paper maakt dit duidelijk. Een verdediger getraind op netwerkverkeer herkent portscans en brute-force aanvallen. Trident genereert een slowloris-achtige aanval. Deze valt binnen de normale verkeersdistributie. Toch veroorzaakt het een denial-of-service. De verdediger classificeert het als normaal verkeer.
Formele analyse van de zwakte
Laat D het beleid van de verdediger zijn. Training gebeurde met een omgeving E_train. De aanvaller zoekt nu een strategie die de verwachte beloning van D minimaliseert. Dit formele kader legt de wiskundige grenzen bloot.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.