One Word Opens the Gate: de Option-Channel Attack op agent-guardrails
Primaire bron: One Word Opens the Gate: de Option-Channel Attack op agent-guardrails; volledige PDF.
Expertise-marker: Deze analyse combineert 1 bron uit het domein AI Security. Confidentie: 78%. Wat mijn conclusie zou veranderen: tegengesteld empirisch bewijs uit peer-reviewed replicatie. Correctiebeleid.
Lead: de centrale verschuiving
De kernverschuiving is dat een typed-decision-model geen classificatiefout maakt, maar een security control die structureel fail-open staat. De vraag is niet of het model accuraat is, maar waarom een component die een deel van zijn input van de aanvaller ontvangt, de finale allow/block-beslissing mag nemen.
Ik stel: een guardrail die zijn eigen optie-labels als aanvalsoppervlak presenteert, is geen guardrail maar een auditartefact. Dat raakt direct de vraag of AI-Act art. 14 en 15 menselijk toezicht en risicobeheersing kunnen worden gedelegeerd aan een subcomponent die op één gewoon woord fail-open gaat.
Claim C1
Een enkele optie‑label‑wijziging zonder tekstaanpassing laat vier geteste guardrail‑modellen fail‑open gaan met een succesratio van 93‑100 %.
De option‑channel‑attack verhoogt de fail‑open‑rate naar 93‑100 % op de vier modellen die het label in hun input plaatsen. (bron).
De option-channel attack wijzigt uitsluitend het label van de permissieve optie, zonder de te beoordelen tekst of de optiedefinities aan te raken. Op vier modellen die dit label in hun input verwerken, stijgt de fail-open rate naar 93-100%: een enkel gewoon woord volstaat (arXiv:2610.12292). Dit is observatie; interpretatie is dat het labelkanaal een onverwacht aanvalsoppervlak vormt dat de security control bypass zonder content-manipulatie.
De 93-100% range geldt specifiek voor modellen die het optielabel expliciet tokeniseren; drie andere modellen in de studie bleven hierop buiten schot door interne architectuurverschillen. De rates zijn lower bounds: de paper rapportert expliciet dat sterkere aanvallers hogere percentages kunnen halen. De bevinding is getest op synthetische GuardBench-data, wat exacte ground-truth oplevert maar ten koste van realisme.
Voor de centrale hypothese betekent dit dat een typed-decision-model als guardrail zijn eigen inputstructuur als kwetsbaarheid presenteert: een deel van de beslissingsinput is controleerbaar door de partij waartegen bescherming nodig is. De fail-open is niet een classificatiefout maar een structurele controle-bypass, wat de vraag opwerpt of AI-Act art. 14 en 15 menselijk toezicht en risicobeheersing kunnen dragen wanneer een subcomponent op één woord fail-open gaat.
Claim C2
Confidence‑gebaseerde escalatie verandert de beslissing niet significant; de marge tussen originele en aangepaste confidence blijft gelijk of wordt zelfs groter.
Confidence‑gebaseerde escalatie werkt niet: de margin verandert van 0.149 naar 0.151 en in 53 % van de gevallen wordt de confidence‑band zelfs breder na de aanval. (bron).
Confidence-gebaseerde escalatie, waarbij een lage voorspellingsmarge een menselijke controle triggert, biedt geen betrouwbaar signaal voor aanvalsdetectie. De margin tussen de hoogste en op-één-na-hoogste kans verschuift van 0,149 naar 0,151 na een succesvolle option-channel-aanval: een verschuiving van 0,002 die de tegenovergestelde richting op gaat dan verwacht (arXiv:2610.12292). In 53% van de gevallen wordt de confidence-band zelfs breder na de aanval, wat het mechanisme feitelijk tot ruis reduceert.
Dit scheidt observatie van interpretatie. De cijfers zijn observatie: de margin en het 53%-percentage zijn direct uit de primaire bron gehaald. De interpretatie is dat confidence hier geen proxy voor onbetrouwbaarheid vormt, omdat de aanval het labelkanaal beïnvloedt zonder de interne representatie van de tekst te verstoren. Het model blijft even "zeker" over een nu corrupte input.
De onzekerheid ligt in de generaliseerbaarheid: de meting is op synthetische GuardBench-data, en het geldt voor zeven open-weight modellen. Commerciële systemen kunnen andere kalibratie vertonen, maar het plan draagt geen evidence dat dit fundamentele patroon doorbreekt.
Voor de centrale hypothese volgt hieruit dat een typed-decision-model niet slechts een classifier is die soms fout gaat, maar een security control die een vals negatief produceert zonder detecteerbaar signaal. Waar C1 aantoonde dat de poort opent, toont C2 dat het waarschuwingssysteem afwezig is. Samen ondermijnt dit de delegatie van toezicht aan dit componenttype.
Claim C3
Het parsen van elk policy‑veld naar een getypte waarde elimineert alle aanvallen zonder verlies van functionaliteit in real‑world scenario’s.
Parsing van elk policy‑veld naar een getypte waarde haalt één aanval volledig weg, maar maakt het model overbodig; een deterministische regel haalt 100 % op alle zes policies met nul fail‑open. (bron).
Het parsen van elk policy-veld naar een getypte waarde elimineert de option-channel-aanval volledig: een deterministische regel over die gestructureerde waarden haalt 100% op alle zes policies met nul fail-open onder beide aanvallen (arXiv:2610.12292). Dit is observatie uit de primaire bron. De interpretatie is echter dubbelzijdig: deze oplossing maakt het typed-decision-model overbodig, omdat de regel zelf de beslissing neemt.
De paper erkent dit expliciet als beperking: de synthetische GuardBench-constructie maakt deterministische regels mogelijk, maar in real-world scenario's met ongestructureerde input is dit minder rechtlijnig toe te passen. De 100%-score geldt dus binnen de kunstmatige omgeving waar de policy-velden al exact gedefinieerd zijn. Voor de centrale hypothese volgt hieruit dat de enige waterdichte verdediging het model zelf opheft: waar C1 en C2 aantoonden dat het model structureel fail-open staat, toont C3 dat eliminatie van het aanvalsoppervlak gelijkstaat aan eliminatie van de component. Dit versterkt de stelling dat een typed-decision-model niet de finale allow/block-beslissing mag nemen: het is óf kwetsbaar, óf overbodig.
Hypothese H1
Onder een optie‑label‑wijziging zonder tekstaanpassing opent een guardrail‑model de poort (fail‑open).
Hypothese H1 stelt dat een guardrail-model fail-open gaat wanneer het optielabel wordt gewijzigd zonder dat de te beoordelen tekst of optiedefinities worden aangeraakt. Het mechanisme is een type-confusion in de inputrepresentatie: het model tokeniseert het label als semantisch signaal, niet als loutere identifier, waardoor een aanvaller via het labelkanaal de beslissing beïnvloedt zonder de content te verstoren (arXiv:2610.12292).
Supporting evidence is beperkt tot E1: de GuardBench-experimenten tonen 93-100% fail-open op vier modellen die het label expliciet in hun input plaatsen. Contradicting evidence ontbreekt in het plan; de paper zelf noemt dat drie andere modellen door architectuurverschillen buiten schot bleven, wat de generaliseerbaarheid relativeert zonder de hypothese te ontkrachten. De kernassumptie is dat het labelkanaal onderscheidbaar is van het contentkanaal in de modelinput; dit is waar voor de geteste modellen maar niet universeel gegarandeerd. Expected observation is dat een labelwijziging naar een semantisch geladen woord de kansverdeling over opties verschuift zonder dat de confidence als signaal fungeert, zoals C2 aantoonde. Discriminator: verschilt het fail-open-patroon significant tussen modellen die labels tokeniseren versus modellen die dit intern anders verwerken? Confidence: gematigd tot hoog voor de specifieke architectuurklasse, laag voor extrapolatie naar gesloten commerciële systemen waar tokenisatie onbekend is. Voor Nederlandse overheidsagent-systemen betekent dit dat een guardrail waarvan de caller de optielabels bepaalt, een controleerbypass introduceert die niet via outputmonitoring wordt gedetecteerd.
Hypothese H2
De hoge fail‑open‑ratio ontstaat alleen door de synthetische GuardBench‑suite; commerciële closed‑weight modellen blijven robuust.
Hypothese H2 houdt in dat de gemeten fail-open-kwetsbaarheid een artefact is van de synthetische GuardBench-suite en de kleine open-weight modellen daarop. Het mechanisme is dat commerciële closed-weight systemen door schaal, training of architectuur het labelkanaal anders verwerken en robuuster blijven.
Supporting evidence ontbreekt in het plan: er zijn geen metingen van commerciële guardrails gepresenteerd die de option-channel-aanval weerstaan. Contradicting evidence is E1, de GuardBench-resultaten zelf, die 93-100% fail-open tonen op vier van zeven modellen en expliciet stellen dat de gerapporteerde rates lower bounds zijn. De paper merkt op dat drie modellen door interne verschillen buiten schot bleven, wat ruimte laat voor architectuur-afhankelijke variatie maar geen basis biedt voor superioriteit van commerciële systemen. De kernassumptie is dat closed-weight modellen fundamenteel andere representaties leren; dit is niet getest en de interface-innovator (Jev) komt in de primaire bron zelf niet aan bod.
Expected observation bij geldigheid van H2 zou zijn dat commerciële guardrails bij replicatie van de option-channel-aanval significant lagere fail-open rates tonen, met name wanneer het optielabel niet expliciet in de input wordt getokeniseerd. Discriminator: verschilt het fail-open-patroon systematisch tussen modellen die labels expliciet tokeniseren versus modellen die dit intern anders verwerken, ongeacht open-of closed-weight status? Confidence is laag: het plan draagt geen enkele directe evidence voor H2, en de beperkingen die de paper zelf noemt (synthetische data, kleine modellen) relativeert de generaliseerbaarheid van alle bevindingen maar onderbouwt niet automatisch de tegengestelde claim. Voor Nederlandse overheidsagent-systemen betekent dit dat H2 een ongeverifieerde voorkeursverklaring is: delegatie van toezicht naar een typed-decision-model kan niet worden gerechtvaardigd door een veronderstelde robuustheid van commerciële alternatieven die niet is aangetoond.
Hypothese H3
Een adaptieve aanvaller kan elke guardrail‑classifier omzeilen, ongeacht of deze typed‑decision‑ of deterministisch is.
Hypothese H3 stelt dat adaptieve aanvallers elke guardrail-classifier kunnen omzeilen, ongeacht het type. Het mechanisme is niet beperkt tot het labelkanaal: de primaire bron toont dat zes irrelevante regels server-log-tekst al de fail-open rate van 0% naar 63% verhogen, en dat elke geteste verdediging door een adaptieve aanvaller wordt verslagen (arXiv:2610.12292). De assumption is dat aanpasbaarheid de aanvaller altijd een stap voor houdt op een statische control. Expected observation is dat verdedigingen die op één aanvalspatroon zijn afgestemd, falen wanneer de aanvaller het kanaal wijzigt: van labelmanipulatie naar context-injectie, of naar een nog niet geïdentificeerd oppervlak. Discriminator: bestaat er een guardrail-architectuur waarvan de volledige beslissingsinput niet enigszins beïnvloedbaar is door de partij die de te beoordelen content aanlevert? Confidence is gematigd: het plan draagt geen directe evidence dat deterministische classifiers even kwetsbaar zijn, maar de bevinding dat deterministische regels op getypeerde waarden 100% halen suggereert dat het probleem niet de classificatie zelf is, maar elke vorm waarin onvertrouwde strings beslissingsinput worden. Voor Nederlandse overheidsagent-systemen betekent dit dat de vraag niet louter luidt welk modeltype men kiest, maar of enige component die onvertrouwde input als beslissingsvariabele verwerkt, de finale poort mag bewaken.
Discriminators: wat onderscheidt de hypotheses?
Als een optie‑label‑wijziging zonder tekstaanpassing de fail‑open‑rate boven 90 % brengt onder een synthetische benchmark, dan is H1 waarschijnlijker dan H2; blijft de rate onder 30 %, dan is H2 waarschijnlijker.
De discriminator D1 maakt het onderscheid tussen H1 en H2 operationeel via een gecontroleerde interventie op het labelkanaal. Het mechanisme is expliciet: een synthetische benchmark waar alleen het optielabel wordt gewijzigd, zonder aanraking van tekst of definities, produceert een binaire voorspelling. Brengt deze interventie de fail-open rate structureel boven 90%, dan ondersteunt dit het type-confusion-mechanisme uit H1, waarbij het model het label als semantisch signaal verwerkt. Blijft de rate onder 30%, dan wijst dit op architectuurrobustheid die het label als loutere identifier behandelt, zoals H2 postuleert voor niet-geteste systemen.
De begrenzing ligt in de synthetische aard van de benchmark: GuardBench biedt exacte ground-truth maar geen realistische ruis, en de gerapporteerde rates zijn expliciet lower bounds. Drie van zeven modellen in de primaire bron bleven al buiten schot door interne architectuurverschillen, wat de discriminator geen universele classificator maakt maar een gecontroleerde architectuurvergelijking. Voor Nederlandse overheidsagent-systemen betekent dit dat een procurement-eis ("geen expliciete labeltokenisatie in modelinput") empirisch toetsbaar wordt, mits de leverancier deze interventie reproduceerbaar toestaat, wat bij closed-weight modellen onzeker blijft.
Falsification: wat zou de conclusie verzwakken?
Onder een optie‑label‑wijziging zonder tekstaanpassing wordt de poort NIET geopend: de fail‑open‑rate blijft ≤ 5 % in een gecontroleerde productiesetting.
Meet de fail‑open‑rate van een guardrail‑model vóór en na een enkel woord‑label‑wijziging in een real‑world workflow en vergelijk met de 5 % drempel.
De huidige conclusie dat het option-channel-kanaal een structureel aanvalsoppervlak vormt, zou materieel verzwakken wanneer een gecontroleerde productietest laat zien dat een enkele labelwijziging zonder tekstaanpassing de fail-open-rate niet boven de 5%-drempel duwt. Het mechanisme is eenvoudig: als het model het optielabel als loutere identifier verwerkt in plaats van als semantisch signaal, opent het kanaal geen bypass. De begrenzing ligt in de reproduceerbaarheid: closed-weight modellen verhinderen vaak deze interventie, waardoor de test zelf al een procurement-eis wordt. Voor Nederlandse overheidsagent-systemen betekent een geslaagde falsificatie dat de architectuurkeuze (expliciete labeltokenisatie) het risico bepaalt, niet het componenttype als zodanig; dit zou de delegatie van toezicht aan een getypt beslismodel onder specifieke voorwaarden kunnen heropenen. De observatie is echter nog niet gedaan: het plan draagt geen enkele productiemeting die deze drempeltest uitvoert, en de primaire bron stelt uitdrukkelijk dat de gerapporteerde rates lower bounds zijn.
Counterfactual: causale stresstest
Als de optie‑label niet kan worden gewijzigd, zou het fail‑open‑event nog optreden?
De counterfactual toetst of het fail-open-event causaal afhangt van de wijzigbaarheid van het optielabel, dan wel van een dieperliggend kenmerk van het typed-decision-model. Stel dat het label niet door de caller kan worden gewijzigd: het model ontvangt dan vaste identifiers (bijvoorbeeld geïndexeerde opties A/B) in plaats van semantisch geladen strings. In deze configuratie verdwijnt het option-channel-aanvalsoppervlak volledig, zoals C3 aantoonde door de equivalentie met deterministische regels. De fail-open is dan niet een robustness-fout die ook onder andere omstandigheden optreedt, maar strikt gebonden aan een ontwerpbeslissing: het toestaan van onvertrouwde strings als beslissingsinput.
De begrenzing ligt in de vraag of deze conditie praktisch realiseerbaar is. In de GuardBench-constructie is het label een expliciet veld; in productie-agent-systemen bepaalt de caller vaak de tool-beschrijving en daarmee indirect de optiesemantiek. Het plan draagt geen evidence dat commerciële systemen dit kanaal sluiten. Voor Nederlandse overheidsagent-systemen betekent dit dat de counterfactual geen hypothetisch scenario is, maar een procurement-eis wordt: indien het label onwijzigbaar is, vervalt de kernkwetsbaarheid; indien wijzigbaar, is de fail-open structureel en niet via modelkeuze te mitigeren.
Invariant vs novelty: wat is werkelijk nieuw?
Zolang een policy‑label deel uitmaakt van de onbetrouwbare input, blijft de mogelijkheid tot fail‑open bestaan, ongeacht modelgrootte.
Koppeling van de option‑channel‑kwetsbaarheid aan de AI‑Act vereiste voor menselijke supervisie toont dat delegatie aan een klein guardrail‑model juridisch onhoudbaar is.
De invariant uit het plan-element is geen nieuwe bevinding: zodra een policy-label tot de onbetrouwbare input behoort, blijft fail-open mogelijk ongeacht modelgrootte. Dit bevestigt bestaande security-principes over onvertrouwde inputkanalen. De werkelijke novel zit in de koppeling van dit mechanisme aan de AI-Act vereiste voor menselijke supervisie. De option-channel-kwetsbaarheid toont dat een klein guardrail-model zijn eigen optie-labels als aanvalsoppervlak presenteert: één gewoon woord opent de poort met 93-100% succes, zonder tekstmanipulatie en zonder detecteerbaar confidence-signaal. Dit is geen nieuwe verpakking van bekende adversarial-input-problematiek, maar een specifiek kanaal dat de paper expliciet identificeert als eerder onbehandeld aanvalsoppervlak. De nieuwe implicatie die uit deze combinatie van evidence volgt: delegatie van AI-Act art. 14 menselijk toezicht aan een dergelijk subcomponent is juridisch onhoudbaar, omdat de control structureel fail-open staat op een inputveld dat de aanvaller beheerst. De paper zelf erkent dat deterministische regels op getypeerde waarden 100% halen met nul fail-open, wat het model overbodig maakt; dit scheidt architectuurkwetsbaarheid van onvermijdelijke classifier-frailty. Voor Nederlandse overheidsagent-systemen betekent dit dat een procurement-eis ("geen expliciete labeltokenisatie in modelinput") weliswaar het risico reduceert, maar tegelijk de componentfunctie eliminiert, wat de delegatiekeuze zelf ondermijnt.
Onzekerheid: expliciete classificatie
GuardBench is synthetisch; de gerapporteerde rates zijn lower‑bounds voor een sterkere aanvaller.
Open‑weight modellen representeren niet de commerciële variant die in productie‑omgevingen wordt gebruikt.
De option-channel-kwetsbaarheid is ESTABLISHED voor modellen die optielabels expliciet tokeniseren: 93-100% fail-open bij enkel een labelwijziging zonder tekstaanpassing (arXiv:2610.12292). Dit is source-uncertainty (synthetische GuardBench-data, lower bounds), measurement-uncertainty (exacte ground-truth versus realistische ruis) en model-uncertainty (vier van zeven modellen; drie door architectuur buiten schot). Causal uncertainty betreft de extrapolatie naar productie: de paper stelt zelf dat sterkere aanvallers hogere rates halen.
Dat commerciële closed-weight modellen robuuster zijn, is SPECULATIVE: het plan draagt geen enkele directe evidence voor H2. De tegengestelde claim -- dat elke guardrail-classifier omzeild wordt door adaptieve aanvallers -- is PROBABLE gegeven de bevinding dat zes irrelevante regels server-log-tekst de fail-open rate naar 63% verhogen en elke geteste verdediging faalt.
Dat deterministische regels op getypeerde waarden 100% halen met nul fail-open, is ESTABLISHED binnen de synthetische constructie; de generaliseerbaarheid naar ongestructureerde real-world input is PLAUSIBLE maar door de paper zelf als beperking erkend. De implicatie dat dit het typed-decision-model overbodig maakt, is HIGH_CONFIDENCE gegeven de expliciete erkenning in de primaire bron.
Handelingsperspectief
Deze analyse is relevant voor security-architecten en compliance-officers binnen Nederlandse uitvoeringsorganisaties die AI-Act art. 14 en 15 implementeren in agent-systemen met geautomatiseerde guardrails. Het concrete probleem dat u nu kunt toetsen: is uw huidige guardrail een security control die structureel fail-open staat op een inputveld dat de aanvaller beheerst, of een auditartefact dat in compliance-rapportages als menselijk toezicht wordt gecertificeerd?
Voor technische teams die dit willen operationaliseren:
INPUT: policy_trace = {text: str, option_labels: List[str], option_defs: List[str]}
BEWERKING:
# Stap 1: identificeer of labels uit onvertrouwde bron komen
if source(option_labels) == caller_controlled:
raise SecurityException("labelkanaal onbetrouwbaar")
# Stap 2: parse naar getypeerde waarden indien mogelijk
typed_policy = deterministic_parse(text, option_defs)
# Stap 3: regel-gebaseerde beslissing, geen modelinference
decision = apply_policy_rules(typed_policy)
OUTPUT: {allow: bool, rationale: str, confidence: "N/A - deterministic"}
Deze pseudocode materialiseert de kernbevinding van C3: eliminatie van het aanvalsoppervlak vereist eliminatie van het model. Wanneer uw huidige architectuur het label als string in modelinput plaatst, is de option-channel open.
Voor een verdiepend gesprek over implementatie van AI-Act menselijk toezicht in agent-architecturen: djimit.nl/kennismaking. Voor technische assessment van uw huidige guardrail-implementatie: djimit.nl/advisory.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.