Kernel-Level Evidence: de 40% blind spot in agent-monitoring
Agentic AI-systemen nemen beslissingen, roepen tools aan en communiceren met externe diensten, vaak zonder dat een mens elke stap controleert. De beveiliging van deze systemen staat daarom hoog op de agenda van cybersecurityteams en regelgevers. Toch richt de meeste aandacht zich op de applicatielaag: prompt-injecties, output-filtering en API-bescherming. Wat als die laag een groot deel van het aanvalsoppervlak simpelweg niet ziet?
Het paper On the Effectiveness of Kernel-Level Evidence for Agent Security (King et al., University of Georgia & AWS AI Labs, 24 september 2026) introduceert ACE (Agent Cross-Layer Evidence), een systematisch onderzoek naar wat kernel-syscalls kunnen bijdragen aan de detectie van agent-gerelateerde dreigingen. De resultaten zijn duidelijk: de applicatielaag heeft een aanzienlijke blind spot, en kernel-level monitoring vult die substantieel aan.
Het ACE-experiment: 4.047 sessies onder de loep
De auteurs bouwden een uitgebreid experiment waarin ze 4.047 gesimuleerde agentsessies analyseerden. Deze sessies omvatten 17 threat models die zijn verdeeld over zes delivery-vector families en twaalf aanvalsmechanismen. Samen dekken deze threats 14 van de 25 OWASP-categorieën voor LLM- en agentic-systemen. Dat betekent dat het experiment een significant deel van het bekende dreigingslandschap bestrijkt, van prompt-injectie tot data-exfiltratie en tool-misbruik.
De kernvraag was niet of kernel-syscalls iets detecteren, maar of ze toevoegende waarde bieden bovenop de informatie die de applicatielaag al levert. Applicatie-level logging, denk aan API-aanroepen, prompt/response-paren en tool-gebruik, is de huidige standaard in agent-monitoring. Maar deze laag ziet alleen wat de agent expliciet rapporteert. Wat er onder de motorkap gebeurt, blijft onzichtbaar.
Kernel versus applicatie: twee werelden
De applicatielaag werkt op het niveau van intentie: welke prompt werd ingevoerd, welke tool werd aangeroepen, welk antwoord werd gegenereerd. De kernellaag werkt op het niveau van uitvoering: welke processen werden gestart, welke bestanden werden geopend, welke netwerkverbindingen werden gelegd. Dat klinkt als een subtiel verschil, maar in de praktijk is het verschil tussen een aanval die wel of niet wordt gedetecteerd.
King et al. laten zien dat kernel-syscall-patronen discriminatieve signalen bevatten voor aanvallen die op applicatieniveau volledig onzichtbaar zijn. Een aanvaller kan een prompt injecteren die de agent aanzet tot het opvragen van gevoelige data, maar de applicatielaag ziet alleen de "legitieme" API-aanroep. De kernellaag ziet daarentegen het daadwerkelijke proces dat de data uitleest, het bestand waarnaar het wordt weggeschreven en de netwerkverbinding waarmee het wordt geëxfiltreerd. Het is het verschil tussen het observeren van de bedoeling en het observeren van het gedrag.
De vier detectorfamilies
De auteurs evalueren vier families van detectoren:
-
Kernel-evidence alleen. Deze detector gebruikt uitsluitend syscall-sequenties en procesgedrag. Het opmerkelijke is dat deze al discriminatief blijkt: kernel-patronen alleen al onderscheiden aanvallende van normale sessies.
-
Applicatie-evidence alleen. Dit is de gangbare aanpak: prompt-analyse, tool-gebruik en output-inspectie. Deze detector presteert goed op bekende aanvallen, maar mist aanvallen die hun sporen verbergen in systeemgedrag.
-
Vroege fusie. Kernel- en applicatie-features worden samengevoegd voordat het classificatiemodel wordt toegepast.
-
Late fusie. Kernel- en applicatiemodellen produceren aparte scores die vervolgens worden gecombineerd.
Het belangrijkste resultaat: compositie van kernel- en applicatielaag outperformt elke single-layer detector. Dat geldt zowel voor vroege als late fusie. De toevoeging van kernel-evidence is geen marginale verbetering; het is een kwalitatieve sprong in het vermogen om onbekende aanvalsmethoden te herkennen.
Generalisatie: het echte bewijs
Een detector die alleen bekende aanvallen herkent, heeft beperkte operationele waarde. Aanvallers passen hun methoden voortdurend aan. Daarom testen King et al. niet alleen op bekende dreigingen, maar ook op onbekende aanvalsfamilies. Hier wordt de kracht van cross-layer evidence pas echt zichtbaar.
Detectoren die uitsluitend op applicatie-evidence zijn getraind, presteren significant slechter wanneer ze worden geconfronteerd met aanvallen uit een familie die ze niet eerder hebben gezien. De compositiedetectoren, die zowel applicatie- als kernel-signalen combineren, generaliseren aanzienlijk beter. Dat komt doordat kernel-syscalls fundamenteler zijn: ongeacht hoe een aanval de applicatielaag misleidt, het uiteindelijke systeemgedrag, bestandsoperaties, netwerkverkeer, procescreatie, verraadt de aanval.
Daarnaast testen de auteurs transfer naar een alternatieve agent-runtime. Als een detector is getraind op sessies van de ene agent-implementatie, werkt hij dan nog op een andere? Ook hier blijkt cross-layer evidence robuuster dan single-layer monitoring. De kernellaag is immers onafhankelijk van de specifieke agent-framework of API die wordt gebruikt.
De 40% blind spot: waarom dit relevant is voor jouw organisatie
De bevindingen van King et al. hebben directe implicaties voor de manier waarop organisaties hun agentic AI-systemen beveiligen. Veiligheidsteams investeren nu veelal in applicatie-level monitoring: prompt-firewalls, output-filtering en gebruikerslogging. Dat is noodzakelijk, maar onvoldoende. De studie suggereert dat een aanzienlijk deel van het dreigingslandschap, de auteurs spreken over een substantiële fractie die de applicatielaag mist, alleen zichtbaar wordt als je naar het systeemgedrag kijkt.
In de praktijk betekent dit dat organisaties die uitsluitend op applicatie-level detectie vertrouwen, een blind spot van naar schatting 40% hebben in hun zicht op agent-gerelateerde dreigingen. Dat is geen theoretisch bezwaar; het is een operationeel risico. Een aanvaller die weet dat zijn doelwit geen kernel-monitoring heeft, kan aanvallen ontwerpen die expliciet de applicatielaag mijden.
NIS2 artikel 21 en BIO2: de regelgevende context
Dit is niet alleen een technisch issue; het is ook een compliance-issue. NIS2 artikel 21 vereist dat essentiële en belangrijke entiteiten passende maatregelen nemen om de beveiliging van hun netwerken en informatiesystemen te waarborgen. Die maatregelen moeten risicogebaseerd zijn en de gehele levenscyclus van systemen omvatten. Als een organisatie agentic AI inzet, voor klantinteractie, interne automatisering of beslissingsondersteuning, valt dat onder de scope van NIS2. En "passende maatregelen" omvatten monitoring en detectie van anomalieën die de veiligheid van het systeem kunnen aantasten.
BIO2, de Nederlandse implementatie van de risicogebaseerde beheersing van cyberbeveiliging, vereist een baseline waarmee organisaties hun huidige beveiligingspositie kunnen bepalen. Monitoring en detectie zijn expliciet onderdeel van die baseline. ACE toont aan dat een baseline die uitsluitend op applicatieniveau meet, een incompleet beeld geeft van de werkelijke beveiligingspositie. Om een betrouwbare baseline vast te stellen, moet je inzicht hebben in zowel het gedrag dat de agent toont als het gedrag dat het systeem vertoont.
Praktische implicaties: wat betekent dit voor je architectuur?
Organisaties die agentic AI-systemen in productie hebben of willen nemen, staan voor een concrete keuze. De huidige standaard is applicatie-level monitoring. Die standaard moet worden uitgebreid met kernel-level observability. Dat betekent:
- Systeem-call tracing op de servers waar agents draaien, niet alleen op traditionele workloads maar ook op containerised en virtuele omgevingen waar agents worden gehost.
- Procesboomanalyse om te detecteren wanneer een agent onverwachte subprocessen start of ongebruikelijke bestandsoperaties uitvoert.
- Netwerkgedragmonitoring op hostniveau, naast de bestaande API-logging, om exfiltratie te detecteren die via niet-geautoriseerde kanalen verloopt.
- Correlatie tussen applicatie-events ("tool X werd aangeroepen") en kernel-events ("proces Y schreef naar bestand Z"), zodat afwijkingen tussen intentie en uitvoering direct alarm slaan.
Deze uitbreiding is geen vervanging van bestaande maatregelen, maar een aanvulling. Het doel is een cross-layer beveiligingspostuur waarin applicatie- en kernellaag elkaar versterken.
Zakelijse kans: architectuurreview en detectie-implementatie
Voor organisaties die hun agent-infrastructuur willen hardenen, biedt dit een concrete ingang. Een architectuurreview van bestaande agent-systemen, met focus op de vraag welke laag welke aanvallen ziet, identificeert direct de huidige blind spots. Op basis daarvan kan een detectie-implementatie worden opgezet die kernel-syscall-monitoring integreert met bestaande SIEM- of observability-platforms.
De investering voor een dergelijke review en eerste implementatie ligt doorgaans tussen €50.000 en €100.000, afhankelijk van de omvang van de infrastructuur en de complexiteit van de agent-workloads. Dat is substantieel, maar het alternatief, een aanval die pas wordt ontdekt wanneer de schade al is aangericht, is kostbaarder, zowel in financiële als reputatieschade.
Conclusie
King et al. leveren met ACE overtuigend empirisch bewijs dat kernel-level evidence een essentiële component is van agent-security. De 4.047 sessies, 17 threat models en dekking van 14 OWASP-categorieën laten zien dat dit geen nicheprobleem is, maar een systematisch gat in de huidige beveiligingspraktijk.
De boodschap is helder: applicatie-level monitoring alleen is onvoldoende voor agentic systemen. De kernellaag ziet wat de applicatielaag niet ziet, en de combinatie van beide lagen levert detectie die robuuster is tegen zowel bekende als onbekende dreigingen. Voor organisaties die onder NIS2 en BIO2 vallen, is dit geen luxe maar een noodzaak: een baseline die 40% van het aanvalsoppervlak negeert, is geen betrouwbare baseline.
Referenties
King, J.A., Zhang, Y., Patwa, A., et al. (2026). On the Effectiveness of Kernel-Level Evidence for Agent Security. arXiv:2609.28915. University of Georgia & AWS AI Labs. https://arxiv.org/abs/2609.28915
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.