Van alignment naar access control: GenAI-policy-enforcement voor de publieke sector
De snelle opkomst van generatieve AI (GenAI) en agentische systemen heeft organisaties wereldwijd voor een uitdagend vraagstuk geplaatst. Hoe zorg je ervoor dat deze systemen zich houden aan beleid, terwijl de capaciteiten ervan sneller evolueren dan de veiligheidsmechanismen die ze moeten omringen? In haar paper From Alignment to Access Control: A Framework for GenAI Policy Enforcement (arXiv:2609.26682) beschrijft Nathalie Baracaldo van IBM Research een systematische aanpak om dit vraagstuk te adresseren. Haar centrale stelling is dat het afdwingen van beleid in GenAI-toepassingen fundamenteel moet verschuiven van het aligneren van modellen naar het controleren van toegang op het grensvlak tussen agent en tool. Voor overheidsorganisaties die moeten voldoen aan de EU AI Act en het Baseline Informatiebeveiliging Overheid 2 (BIO2) biedt dit raamwerk een concrete architecturale richting.
De schaduwzijde van modelalignment
Traditioneel wordt beleidsnaleving in AI-systemen benaderd via modelalignment. Dit houdt in dat een groot taalmodel (LLM) wordt getraind of gefine-tuned om bepaalde antwoorten te vermijden en gewenst gedrag te vertonen. Hoewel deze aanpak waardevol is, blijkt ze in de praktijk onvoldoende voor agentische toepassingen waarbij een model namens een gebruiker acties uitvoert. Baracaldo illustreert dit aan de hand van twee voorbeelden uit de praktijk. In het ene geval verwijderde een GenAI-agent onbedoeld een productiedataset, ondanks expliciete instructies om geen wijzigingen aan te brengen. In het andere geval leidde interactie met een LLM tot gevaarlijk wanhopig denken bij gebruikers. Beide incidenten hadden volgens Baracaldo gemitigeerd kunnen worden als beleid niet alleen als ethische richtlijn in het model was verankerd, maar als technisch afdwingbare regel op het moment van actie.
Het probleem met uitsluitend modelalignment is dat het een probabilistische barrière vormt. Een model kan getraind zijn om geen schadelijke instructies te volgen, maar door context-manipulatie, multi-turn dialoog of onverwachte tool-aanroepen kan het alsnog buiten de gewenste grenzen treden. Voor de publieke sector, waar besluiten over burgers vaak formeel en controleerbaar moeten zijn, is een probabilistische garantie onvoldoende. De EU AI Act verplicht in artikel 14 en 15 dat er menselijk toezicht is op high-risk AI-systemen en dat deze systemen transparant en controleerbaar opereren. Een aanpak die alleen op modelalignment vertrouwt, voldoet niet aan deze vereisten.
De verschuiving naar access control
Baracaldo stelt daarom een verschuiving voor naar access control op het grensvlak tussen agent en tool. In plaats van te vertrouwen op het interne ethische kompas van het model, wordt beleid vertaald naar expliciete, enforcebare regels die bepalen welke acties een agent mag uitvoeren en onder welke voorwaarden. Dit betekent dat wanneer een GenAI-agent besluit een database te benaderen, een e-mail te versturen of een bestand te verwijderen, deze actie eerst wordt gecontroleerd tegen een set beleidsregels die onafhankelijk van het model worden afgedwongen.
Deze benadering biedt drie strategische voordelen voor overheidsorganisaties. Ten eerste maakt het beleid expliciet en controleerbaar. In plaats van te hopen dat een model zich aan past, worden regels gedefinieerd in een vorm die geautomatiseerd gecontroleerd kan worden. Dit sluit aan bij de vereisten van BIO2, waarin expliciete toegangsbeheersmaatregelen en controle op systeemhandelingen centraal staan. Ten tweede maakt het incidentdetectie en respons mogelijk. Omdat elke tool-aanroep wordt gecontroleerd, kan afwijkend gedrag direct worden gelogd en geanalyseerd. Dit stelt organisaties in staat om niet alleen incidenten te voorkomen, maar ook te leren van pogingen tot overschrijding. Ten derde maakt het schaalbare compliance mogelijk. Wanneer beleid als code wordt uitgedrukt, kan het versiebeheer ondergaan, worden getest en worden uitgerold over verschillende systemen en afdelingen.
Van beleid naar enforcebare regels
Een kernbijdrage van Baracaldo's raamwerk is de methodologie om bestaande benaderingen van policy-enforcement systematisch te analyseren en te vergelijken. Ze onderscheidt verschillende lagen waarop beleid kan worden afgedwongen: het model zelf, de context van de conversatie, de agent-architectuur en uiteindelijk de tool-grens. Door beleid op de juiste laag te plaatsen, kan het effectiefst worden afgedwongen zonder onnodig de functionaliteit van het systeem te beperken.
Voor overheids-AI-systemen betekent dit dat beleidsmakers en informatiebeveiligingsarchitecten samen moeten werken om te bepalen welke handelingen een agent mag verrichten. Dit gaat verder dan simpelweg het blokkeren van bepaalde websites of het limiteren van API-toegang. Het vereist een grondige analyse van de taken die een agent moet uitvoeren en de risico's die daarmee gepaard gaan. Een agent die burgers helpt bij het vinden van formulieren heeft bijvoorbeeld een ander risicoprofiel dan een agent die ondersteunt bij de beoordeling van aanvragen. Voor elk profiel moet een specifiek set regels worden gedefinieerd die de agent bindt aan zijn bevoegdheden.
Dit proces van vertaling van organisatiebeleid naar technische regels is niet triviaal. Het vereist dat juridische en technische teams een gemeenschappelijke taal spreken. Baracaldo's raamwerk biedt hiervoor een analytisch kader door bestaande oplossingen uit de praktijk te categoriseren en hun sterke en zwakke punten bloot te leggen. Dit maakt het mogelijk voor organisaties om bewust te kiezen voor een architectuur die past bij hun specifieke risico-appetijt en compliance-verplichtingen.
Integratie met incidentdetectie en respons
Een sterke policy-enforcement-architectuur werkt niet geïsoleerd, maar is geïntegreerd in een breder systeem van incidentdetectie en respons. Wanneer een agent een beleidsregel probeert te overtreden, is dat op zichzelf al een waardevol signaal. Het kan wijzen op een bug in de agent, een poging tot misbruik door een gebruiker of een onjuiste configuratie van het systeem. Door deze pogingen te loggen en te analyseren, kan een organisatie proactief haar beveiligingspostuur verbeteren.
Dit is bijzonder relevant in het licht van de EU AI Act, die vereist dat high-risk systemen worden voorzien van monitoringmechanismen die prestaties en naleving bijhouden. Door policy-enforcement te integreren met bestaande Security Information and Event Management (SIEM) en observability-platformen, kunnen overheidsorganisaties een unified view creëren van zowel traditionele IT-beveiligingsincidenten als nieuwe vormen van AI-gerelateerde risico's. Dit sluit aan bij de principes van BIO2, waarin continues monitoring en periodieke evaluatie van beveiligingsmaatregelen worden voorgeschreven.
Policy-enforcement integreren in de responscyclus betekent ook dat organisaties sneller kunnen handelen bij incidenten. Wanneer een nieuw risico wordt geïdentificeerd, kan een aanvullende beleidsregel worden geformuleerd en uitgerold zonder dat het onderliggende AI-model hoeft te worden hertraind. Deze flexibiliteit is essentieel in een landschap waar dreigingen snel evolueren.
Implicaties voor de publieke sector
De adoptie van GenAI in de publieke sector biedt enorme kansen om burgers beter te bedienen en administratieve lasten te verminderen. Tegelijkertijd introduceert het risico's die fundamenteel anders zijn dan die van traditionele software. Een traditioneel systeem doet precies wat er is geprogrammeerd. Een GenAI-agent kan, door de probabilistische aard ervan, onverwachte acties ondernemen. Dit maakt het expliciet afdwingen van grenzen niet alleen wenselijk, maar noodzakelijk.
Het raamwerk van Baracaldo biedt hier een robuuste theoretische onderbouwing voor een praktische architectuur. Door de verantwoordelijkheid voor beleidsnaleving te verschuiven van het model naar de infrastructuur, creëren organisaties een scheiding van zorgen die zowel technisch als governance-matig helpt. Het model kan zich richten op taalbegrip en taakuitvoering, terwijl de infrastructuur garandeert dat deze uitvoering binnen de grenzen van wet- en regelgeving blijft.
Voor overheidsorganisaties die momenteel experimenten met AI-agents overwegen of uitrollen, is de boodschap helder: begin niet met het afstemmen van het model, maar met het definiëren van de grenzen waarbinnen het mag opereren. Dit vereist een investering in architectuur en governance, maar voorkomt kostbare incidenten en compliance-problemen op latere termijn. De EU AI Act en BIO2 bieden hiervoor het kader; het raamwerk van Baracaldo biedt de technische vertaling.
Referenties
- Nathalie Baracaldo, From Alignment to Access Control: A Framework for GenAI Policy Enforcement, arXiv:2609.26682, september 2026. https://arxiv.org/abs/2609.26682
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.