AI Security Leaderboard: Waarom jouw volgende AI-inkoop een security-benchmark nodig heeft
De tijd dat je een AI-model koos op basis van alleen kwaliteit is voorbij. Security is nu het onderscheidende criterium. Een nieuwe onafhankelijke benchmark rangschikt frontier AI-modellen op weerbaarheid tegen jailbreaks. De resultaten zijn confronterend. Sommige modellen kosten meer dan $14.000 per succesvolle aanval. Andere zijn voor $24 te kraken. Voor Nederlandse overheden die AI inkopen, is dit geen theoretische discussie. De AI Act Artikel 15 eist robuustheid. BIO2 en NIS2 dwingen tot security-by-design. Maar hoe weet je welk model die eisen waarmaakt? Tot nu toe ontbrak een onafhankelijke maatstaf. Die is er nu.
De paper verscheen op arXiv op 4 augustus 2026. Het introduceert een "AI Security Leaderboard". Dit test frontier modellen op weerstand tegen geautomatiseerde jailbreak-aanvallen. Het is geen academische oefening. Het is een praktische tool. Je gebruikt het als inkoper om risico's te kwantificeren. De uitkomsten vallen anders uit dan de marketingclaims.
Wat is een jailbreak eigenlijk?
Een jailbreak is een aanval. Een aanvaller gebruikt specifieke prompts of technieken. Zo omzeil je de veiligheidsmechanismen van een AI-model. Het doel is het model laten doen wat niet mag. Denk aan het genereren van phishing-e-mails. Of malware. Soms lekt het gevoelige informatie. Formeel definieer ik een jailbreak als een invoerreeks (x). Toegepast op een model (f) produceert dit een output (f(x)). Deze output schendt een vooraf gedefinieerd veiligheidsbeleid (P). Terwijl (f) onder normale omstandigheden (P) respecteert.
De benchmark gaat verder dan individuele jailbreaks. Het test op universele jailbreaks. Dit is een enkele prompt die het model consequent laat falen. Ongeacht de context. Dit is de gevaarlijkste vorm. Het is namelijk schaalbaar. Een aanvaller vindt één keer een universele jailbreak. Daarna zet je die op grote schaal in.
Hoe de benchmark werkt
Onderzoekers bouwden een geautomatiseerd systeem. Het genereert en test systematisch jailbreaks. Het systeem gebruikt een combinatie van technieken. Denk aan gradient-gebaseerde optimalisatie. Ook genetische algoritmen. En een iteratief proces dat lijkt op fuzzing. Voor elk model genereert het duizenden potentiële jailbreaks. Elke jailbreak test je op effectiviteit. De kosten per jailbreak bereken je op basis van benodigde rekenkracht en API-calls.
De kern van het systeem is een optimalisatielus. In pseudo-code:
def generate_jailbreaks(model, policy, budget):
jailbreaks = []
for i in range(budget):
candidate = mutate(population)
if violates_policy(model(candidate), policy):
jailbreaks.append(candidate)
population = update_population(candidate)
return jailbreaks
De kosten per jailbreak zijn een proxy voor de moeilijkheidsgraad. Hogere kosten betekenen meer rekenkracht. Ook zijn meer iteraties nodig om een werkende aanval te vinden. Een model van $14.000 per jailbreak is veiliger. Veiliger dan een model van $24.
De resultaten: een tweedeling
De benchmark rangschikt vier modellen. Claude Fable 5, GPT-5.6 Sol, Grok 4.5 en Gemini 3.1 Pro. De resultaten zijn duidelijk.
- Claude Fable 5 en GPT-5.6 Sol weerstaan elke aanval. De onderzoekers vonden geen enkele universele jailbreak. Zelfs niet met een budget van $14.200 per poging. Deze modellen hebben een extreem hoge weerbaarheid.
- Grok 4.5 en Gemini 3.1 Pro hebben honderden universele jailbreaks. Elk voor minder dan $300. Grok's zwakste domein is kraakbaar voor $24.
Dit is geen subtiel verschil. Het is een orde van grootte. Het heeft directe implicaties voor inkoopbeslissingen.
Waarom dit relevant is voor Nederlandse overheden
Nederlandse overheden kopen steeds vaker AI-modellen in. Denk aan documentanalyse. Of chatbots voor burgercontact. Ook voor beslissingsondersteuning.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.