Guard-models overconfident waar base-models onzeker zijn - het gat in uw veiligheidsnet
Guard-models zijn overconfident waar base-models onzeker zijn, het gat in uw AI-veiligheidsnet
Analyse van arXiv:2609.36477, Guard Models Are Overconfident Where Base Models Are Uncertain. Hong, Jung & Kim, 2026.
1. Het probleem: confidence als proxy voor veiligheid
Guard-models fungeren als veiligheidsclassificatoren in LLM-deployment-pijplijnen. Ze beoordelen gebruikersinput en modeloutput tegen vooraf gedefinieerde veiligheidsbeleidslijnen. In veel deployments drijven confidence-scores downstream moderation-beslissingen: als de guard "zeker" is dat een input veilig is, wordt deze doorgezet naar het base-model.
De impliciete aanname is dat confidence een betrouwbare indicator is van correctheid. Hong et al. tonen aan dat deze aanname onder adversariale condities catastrofaal faalt.
2. De bevindingen: kalibratie die explodeert
2.1 Goede kalibratie op schone inputs
Op schone (niet-aanvallende) inputs zijn meerdere guard-models bijna perfect gekalibreerd. De confidence-score correspondeert met de werkelijke kans op correctheid. Dit is de situatie waarin organisaties hun guardrails testen en in productie nemen.
2.2 Adversarial aanvallen degraderen kalibratie met een orde van grootte
Onder adversarial condities, waarbij inputs subtiel worden gemanipuleerd om de guard te misleiden, verandert het beeld drastisch:
- Calibration degradeert met een orde van grootte. Een guard die op schone inputs 90% confidence had bij 90% accuracy, toont op adversariale inputs 90% confidence bij 10% accuracy.
- False negatives worden high-confidence errors. De guard is "zeker" dat een schadelijke input veilig is. Deze fout is ononderscheidbaar van een correcte detectie in de logs.
- Het onzekerheidssignaal blijft beschikbaar in het base-model. Waar de guard faalt, uit het base-model vaak onzekerheid uit over dezelfde input.
2.3 De guard-base divergentie lokaliseert in latere lagen
Layer-wise analyses tonen dat de divergentie tussen guard en base-model zich concentreert in latere lagen:
- Guard-models tonen sharper safe/unsafe separation, een scherpere grens tussen klassen.
- Guard-representaties zijn lower-rank, minder expressief voor subtiele adversariale patronen.
- Adversariale schadelijke inputs liggen dichter bij de clean-safe region, de guard kan ze niet onderscheiden van legitieme inputs.
3. Het risico: een valse veiligheid
De bevindingen creëren een specifiek risico voor organisaties die guardrails in productie hebben:
Automatische blocking op basis van confidence-thresholds ≥90% is een gangbare praktijk. Organisaties configureren hun pipeline zodat inputs met guard-confidence ≥90% automatisch worden doorgelaten. Hong et al. tonen aan dat dit threshold onder adversarial condities 90% false negatives produceert, negen van de tien schadelijke inputs worden als veilig geclassificeerd, met "hoge zekerheid".
Dit is geen theoretisch risico. Jailbreak-technieken, die de input subtiel manipuleren om veiligheidsfilters te omzeilen, zijn breed gedocumenteerd. De studie toont dat deze technieken niet alleen de guard omzeilen, maar de guard actief laten liegen over zijn eigen zekerheid.
4. Nederlandse context: EU AI Act artikel 15
EU AI Act artikel 15 vereist dat high-risk AI-systemen "aantoonbaar robuust" zijn tegen fouten, storingen en aanvallen. Een guard-model dat onder adversarial condities zijn kalibratie volledig verliest, voldoet niet aan deze eis.
De toezichthouder-controle zal vragen stellen als:
- Heeft u getest hoe uw guard presteert onder adversarial condities?
- Hoe weet u dat een "high confidence" output daadwerkelijk correct is?
- Wat is het verschil tussen de confidence van de guard en de onzekerheid van het base-model?
Organisaties die geen adversarial robustness-assessment hebben uitgevoerd, kunnen deze vragen niet beantwoorden.
5. Wat te doen
Organisaties die guardrails inzetten:
-
Test adversariale robustheid. Kalibratie op schone inputs is niet voldoende. Evalueer uw guard onder bekende aanvalsvectoren (jailbreaks, prompt injection, gradient-based attacks).
-
Gebruik guard-confidence niet als enkel besliscriterium. Combineer guard-output met base-model onzekerheidssignalen. Waar de guard "zeker" is en het base-model onzeker, is dit een waarschuwingssignaal.
-
Monitor de guard-base divergentie. Als de guard en het base-model systematisch van mening verschillen over dezelfde inputs, is de guard mogelijk overconfident.
-
Implementeer defense-in-depth. Geen enkele guard is voldoende. Layer multiple safety mechanisms: input filtering, output scanning, human-in-the-loop voor grensgevallen, en logging voor retrospectieve analyse.
-
Evalueer regelmatig. Guard-models verouderen naarmate aanvalsvectoren evolueren. Een halfjaarlijkse adversarial robustness-review is een minimum.
6. Conclusie
Guard-models zijn een essentiële veiligheidslaag in LLM-deployments, maar ze zijn geen vervanging voor kritisch denken. Hong et al. tonen empirisch aan dat adversariale aanvallen de kalibratie met een orde van grootte degraderen, false negatives worden high-confidence errors die onzichtbaar zijn in de logs.
Voor organisaties die afhankelijk zijn van automatische moderation op basis van guard-confidence, betekent dit: uw veiligheidsnet heeft een gat. Het gat is niet in de guard zelf, maar in het vertrouwen dat de organisatie in de guard stelt.
De vraag is niet of uw guard goed werkt op schone inputs. De vraag is of u weet hoe hij faalt wanneer aanvallers hem actief proberen te misleiden.
Bron: Hong, J., Jung, M. & Kim, M. (2026). Guard Models Are Overconfident Where Base Models Are Uncertain. arXiv:2609.36477.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.