Laag op laag: wat CASCADE leert over gestapelde jailbreakverdediging, en waarom de cijfers voor de overheid anders lezen
Stelling
Iedereen die een LLM-toepassing bouwt, weet inmiddels dat één guardrail niet volstaat. Wat niemand systematisch had onderzocht, is welke combinatie van verdedigingen wél volstaat, tegen welke prijs. CASCADE (Luo & Han, National University of Singapore, Findings of EMNLP 2026) vult dat gat met een gecontroleerde vergelijking van 19 aanvallen tegen 15 verdedigingen en hun combinaties over drie pijplijnfasen. De methodologische bijdrage is degelijk. De aanbevelingen zijn dat minder, en voor een Nederlandse overheidsorganisatie zijn ze op vier punten zelfs misleidend: het dreigingsmodel sluit de relevantste aanvaller uit, de aanvaller is statisch, de meetruis is groter dan de verschillen die het paper rapporteert, en elke aanbevolen laag is een Amerikaans model met een ingebakken Amerikaanse definitie van "schadelijk". Hieronder het argument.
Wat het paper doet
CASCADE ordent verdediging langs zes fasen: training, input guard, inputmodificatie, inferentie, outputverfijning en output guard. Alleen de drie fasen die zonder modelgewichten toepasbaar zijn worden geëvalueerd: input guard, inputmodificatie en output guard. De methode doorloopt vier stappen. Eerst worden aanvallen per subcategorie tegen onverdedigde modellen getest en de sterkste als representant gekozen (vijf blijven over: Adaptive, DSN, Refusal, SeqBreak, ReNeLLM). Daarna worden verdedigingsconfiguraties per fase op nutsbehoud gefilterd. Vervolgens worden de overgebleven configuraties tegen de representanten getest. Ten slotte worden cross-fase combinaties vergeleken.
De belangrijkste methodologische keuze is één uniforme succesmaat: ASR@max_q, het aandeel schadelijke doelen dat binnen een vast querybudget per subcategorie door ten minste één poging of variant wordt bereikt. Dat corrigeert een reëel probleem in de literatuur: ASR-definities verschillen zo sterk dat vergelijkingen tussen papers weinig betekenen (Chouldechova et al., 2025).
De drie aanbevolen pijplijnen:
| Scenario | Combinatie | ASR-reductie | Nutsverlies | Parameters | Extra latentie |
|---|---|---|---|---|---|
| Security | {PromptGuard, gpt-oss-safeguard} ⇒ Self-Reminder ⇒ {LlamaGuard, WildGuard, GuardReasoner} | 97,4% | −9,2% | 43,1 B | +2,16 s |
| Utility | {PromptGuard, gpt-oss-safeguard} ⇒ {LlamaGuard, WildGuard} | 94,6% | −7,8% | 35,1 B | +0,48 s |
| Efficiency | {PromptGuard, WildGuard} | 86,7% | −9,6% | 7,1 B | ≈ 0 s |
De sterkste empirische bevinding staat niet in die tabel maar in de residuen. Output guards alleen laten SeqBreak op ruim 50% staan; input guards alleen laten ReNeLLM op circa 50% staan. Gecombineerd zakken beide onder de 10%. De fasen vangen verschillende aanvallen. Dat is het eigenlijke argument voor stapeling, en het is beter onderbouwd dan de aggregaatcijfers.
Vier redenen waarom de cijfers niet overdraagbaar zijn
1. Het dreigingsmodel sluit de aanvaller uit die ertoe doet
CASCADE beperkt zich tot directe, black-box, single-turn aanvallen: de gebruiker is de aanvaller en levert zelf de kwaadaardige prompt. De auteurs noemen dit het fundamentele primitief en stellen dat technieken uit deze setting ook in ruimere settings gelden. Dat is waar voor aanvallen, niet voor verdedigingen.
In een agentische overheidstoepassing is de gebruiker zelden de aanvaller. De aanvaller zit in een geüpload document, een opgehaalde webpagina, een e-mailbijlage of het resultaat van een toolcall. Dat heet indirecte prompt injection, en NIST AI 100-2e2025 onderscheidt het uitdrukkelijk van directe aanvallen. Twee gevolgen. Ten eerste: een input guard die op gebruikersprompts is getraind, staat op de verkeerde plek. De schadelijke instructie komt de pijplijn binnen na de input guard, via retrieval of tools. Ten tweede: de zesfasenpijplijn van het paper kent geen fase "tool-output guard". Voor een chatbot die alleen praat is dat een detail. Voor een agent die bestanden leest en acties uitvoert is het de belangrijkste ontbrekende laag. Wie de Security-configuratie kopieert naar een agent, heeft 43 miljard parameters aan classifiers op de ingang gezet en niets op de zijdeur.
Multi-turn aanvallen (Crescendo, Russinovich et al., 2025) vallen eveneens buiten scope, terwijl een burgerdialoog per definitie multi-turn is.
2. De aanvaller staat stil
De aanvallen zijn in stap P1 geselecteerd tegen onverdedigde modellen. De auteurs erkennen dat dit aanvallen mist die op specifieke verdedigingen mikken, en verdedigen de keuze als de minst slechte. Dat is eerlijk, maar de consequentie moet scherp gesteld worden: elke ASR-reductie in het paper is een bovengrens onder een aanvaller die de verdediging niet kent. Kerckhoffs' principe zegt dat je de tegenstander volledige kennis van je systeem moet toedichten. Nasr et al. (2025) laten zien wat er dan gebeurt: adaptieve aanvallen die de verdediging in hun optimalisatie meenemen, omzeilen vrijwel alle gepubliceerde guardrails.
Het theoretische punt achter "defense in depth" verdient precisie. Als k lagen elk met kans p_i falen, is de kans op volledige omzeiling alleen ∏p_i wanneer de faalkansen onafhankelijk zijn. LlamaGuard, WildGuard en GuardReasoner zijn LLM-classifiers, getraind op overlappende datasets met overlappende taxonomieën. Hun fouten zijn gecorreleerd. Een aanval die het ene semantische filter passeert, passeert waarschijnlijk ook het andere. Wat wél werkt is stapeling over heterogene mechanismen: een perplexiteitsfilter, een kleine encoder-classifier (PromptGuard, 86M) en een generatieve guard falen om uiteenlopende oorzaken. Diversiteit, niet aantal, is de variabele die telt. Het paper meet dit impliciet maar benoemt het niet.
3. De meetruis is groter dan de gerapporteerde verschillen
Drie bronnen van onzekerheid worden in het paper gemeld maar niet doorgerekend.
De dataset bevat 100 schadelijke doelen. Eén doel is dus één procentpunt ASR. Een Wilson-betrouwbaarheidsinterval bij n = 100 en ASR rond 50% is ruwweg ±10 procentpunt; bij ASR rond 5% nog altijd ±4. Het verschil tussen de Security- en Utility-configuratie (97,4% versus 94,6% reductie) ligt binnen die marge.
De judge (HarmBench) haalt tegen menselijke labels een Cohen's κ van 0,64 in de onverdedigde en 0,80 in de verdedigde setting, gemeten op 500 door de auteurs zelf geannoteerde outputs, zonder externe annotatoren. Een κ van 0,64 is matig; dat betekent dat een substantieel deel van de "jailbroken"-labels betwistbaar is.
De aggregatie %↓ASR is een gemiddelde over vijf aanvallen en twee modellen. Dat verbergt staarten. De Efficiency-configuratie scoort 86,7% gemiddeld, maar laat ReNeLLM op 43% (Vicuna) en 57% (GPT-3.5) staan, en in de generalisatietest 57% op Gemini 3.1 Flash Lite. Een verdediging die tegen één van vijf aanvalsklassen faalt, is geen 87%-verdediging. Het is dezelfde fout die ik in de AI-GRACE-bespreking aan de kaak stelde: een geaggregeerde score verbergt een kleine, onaanvaardbare set.
Dit maakt de methode van CASCADE niet waardeloos, maar het maakt de rangorde van aanbevelingen zwak. De eerlijke lezing is: gecombineerde verdediging over fasen brengt de ASR onder gecontroleerd budget van ~95% naar enkele procenten. Welke van de drie combinaties beter is, kan dit experiment niet onderscheiden.
4. Elke laag is een Amerikaans normatief besluit
De aanbevolen stapels bestaan uit PromptGuard en LlamaGuard (Meta), WildGuard (AI2), gpt-oss-safeguard (OpenAI) en GuardReasoner. Een guard model is geen neutraal filter. Het codeert een taxonomie van wat "schadelijk" is: LlamaGuard 3 volgt de MLCommons-gevarencategorieën, WildGuard zijn eigen risicoschema. Die taxonomieën zijn geschreven vanuit een Amerikaans beleids- en aansprakelijkheidskader.
Voor een Nederlandse overheid levert dat concrete fricties op. Euthanasie, abortus, cannabisbeleid, wapenvergunningen en seksuele gezondheid zijn onderwerpen waarover een gemeente of uitvoeringsorganisatie moet kunnen informeren, en die in Amerikaans getrainde guards structureel als grensgeval scoren. De Security-configuratie weigert op XSTest 7,6 tot 8% van de goedaardige grensvragen. In een burgerdienst is dat geen nutsverlies van acht procent; het is een bestuursorgaan dat een informatievraag zonder motivering afwijst. Onder de Awb en de behoorlijkheidsnormen van de Nationale ombudsman is over-refusal een dienstverleningsgebrek, geen veiligheidsmarge. En het treft, net als bij mensen gebeurt, disproportioneel de burger met de moeilijke vraag.
Daar komt taal bij. De guards zijn primair op Engels getraind; LlamaGuard 3 noemt een handvol ondersteunde talen, Nederlands hoort daar voor zover ik weet niet bij. Het paper laat zelf zien dat taal uitmaakt: de meertalige aanval MultiJail slaagt op open-weight modellen in 71 tot 100% van de gevallen, tegenover duidelijk lagere succescijfers op propriëtaire modellen. Een Nederlandstalige pijplijn met Engelstalige guards is een pijplijn waarvan de effectiviteit niet gemeten is.
En dan de infrastructuur. De OpenAI-moderatie-API stuurt elke prompt naar een Amerikaanse endpoint; die valt af voor gegevens met BIO2-classificatie. De Security-stapel van 43 miljard parameters vraagt circa 86 GB GPU-geheugen in bf16, één H100 alleen voor de guards, vóór het eigenlijke model. Wie soeverein wil draaien, betaalt dat zelf.
Eén component verdient aparte vermelding: gpt-oss-safeguard is een beleidsgeconditioneerde classifier die de harm-taxonomie als invoer meekrijgt in plaats van ingebakken. Dat is architectonisch de juiste richting voor een overheid: bring-your-own-policy, waarbij de organisatie zelf definieert wat geweigerd wordt, in eigen taal, toetsbaar tegen eigen beleid. Het is de enige laag in de stapel waarvan de normatieve keuze bij de deployer ligt.
Waar dit in het regulatoire kader valt
Artikel 15 van de AI Act eist voor hoog-risicosystemen weerbaarheid tegen pogingen van onbevoegde derden om het gebruik of de output te wijzigen, en noemt adversarial examples en modelgebreken expliciet als te adresseren kwetsbaarheden. Die verplichtingen voor Annex III-systemen zijn via Verordening (EU) 2026/1744 verschoven naar 2 december 2027, maar de eis blijft, en de artikel 9-risicobeheerscyclus vraagt om testen tegen gedefinieerde dreigingsmodellen. CASCADE levert daarvoor iets bruikbaars: niet de drie aanbevolen stapels, maar het protocol. Vaste querybudgetten per aanvalsklasse, één ASR-definitie, expliciete fairness-regels en een open codebase vormen samen een reproduceerbaar testregime dat in een technisch dossier past.
De verbinding met use-case-governance is direct. In AI-GRACE-termen zijn guardrails controls van het detecterende type; CASCADE kwantificeert hun detectiekans. De residuele ASR van 2 tot 7% onder gecontroleerd budget, en onbekend onder adaptieve aanval, is precies het getal dat bepaalt of een consequente actie nog een deterministische poort nodig heeft. Het antwoord is ja. Guardrails verlagen de frequentie van schadelijke output; ze begrenzen de gevolgen niet.
Wat een overheidsorganisatie hiermee doet
- Neem het protocol over, niet de configuratie. Draai CASCADE opnieuw met Nederlandstalige aanvallen, de eigen beleidstaxonomie als weigercriterium en indirecte injectie via retrieval en tools als extra aanvalsklasse. De code is open.
- Stapel heterogeen. Combineer een statistisch filter, een kleine encoder-classifier en één generatieve guard. Drie generatieve guards van dezelfde familie zijn schijndiepte.
- Voeg de ontbrekende fase toe. Elke tool- en retrieval-output krijgt een eigen guard vóór hij de context in gaat.
- Meet over-refusal als dienstverleningsindicator. Rapporteer FPR op een eigen Nederlandstalige set grensvragen uit het echte dienstverleningsdomein, niet op XSTest.
- Leg de beleidsdefinitie bij de organisatie. Een beleidsgeconditioneerde guard met een door de eigen jurist en FG vastgestelde taxonomie is verdedigbaar tegenover toezichthouder en rechter; een ingebakken Amerikaanse taxonomie is dat niet.
Vijf toetsbare proposities
P1. Onder adaptieve aanval (Nasr et al., 2025) daalt de ASR-reductie van de Security-configuratie met ten minste 30 procentpunt ten opzichte van de gerapporteerde 97,4%.
P2. De correlatie tussen de fouten van LlamaGuard, WildGuard en GuardReasoner op dezelfde jailbreak-set is positief en substantieel (φ > 0,4); stapeling binnen de output-guard-fase levert daardoor minder op dan onafhankelijkheid voorspelt.
P3. Nederlandstalige varianten van de vijf representatieve aanvallen halen tegen de aanbevolen stapels een hogere ASR dan hun Engelstalige origineel.
P4. Op een set legitieme Nederlandse overheidsvragen over euthanasie, drugsbeleid en wapenvergunningen weigert de Security-configuratie meer dan 15%.
P5. Een beleidsgeconditioneerde guard met een organisatie-eigen taxonomie haalt op diezelfde set een lagere FPR bij gelijke ASR-reductie dan een guard met vaste taxonomie.
Slot
CASCADE is een verbetering van de meetlat, en dat is meer waard dan het klinkt in een veld waar tot nu toe niemand dezelfde meetlat gebruikte. De bevinding dat fasen complementaire aanvalsklassen vangen, is robuust en zou het ontwerp van elke LLM-pijplijn moeten sturen. De aanbevolen configuraties zijn dat niet: ze zijn gemeten tegen een statische, Engelstalige, directe aanvaller, met een ruis die de onderlinge verschillen opslokt, en ze bestaan uit componenten waarvan de normatieve kern niet van de deployer is. Voor een overheid is de les daarom niet "installeer deze drie modellen", maar "meet zo, met je eigen aanvallen, je eigen taal en je eigen definitie van schade". Wie dat overslaat, heeft geen verdediging in de diepte maar een importproduct met een onbekende faalkans.
Referenties (selectie)
Luo & Han (2026), arXiv:2609.21793. Chouldechova et al. (2025), Comparison requires valid measurement, NeurIPS. Nasr et al. (2025), The attacker moves second, arXiv:2510.09023. Russinovich, Salem & Eldan (2025), Crescendo, USENIX Security. Vassilev et al. (2025), NIST AI 100-2e2025. Wang et al. (2026), SoK: Evaluating jailbreak guardrails, IEEE S&P. Röttger et al. (2024), XSTest, NAACL. Inan et al. (2023), Llama Guard. Han et al. (2024), WildGuard, NeurIPS. Verordening (EU) 2024/1689, art. 9 en 15.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.