Anticiperend menselijk toezicht bij agentic AI: de limiet van reactief toezicht
Stelling
Reactief menselijk toezicht (een mens die ingrijpt op een specifieke actie) is voor klassieke AI-systemen al fragiel, maar voor agentic AI is het meer dan fragiel: het stuit op een structurele limiet. Een nieuw filosofisch paper (Baum, Kiener, Langer & Laux, arXiv:2609.24242) argumenteert dat agentic AI-systemen, die plannen, doelen decomponeren en over verlengde tijdshorizons multi-stap-acties uitvoeren, een ander toezicht vragen: anticipatoir toezicht, uitgeoefend vóór de agent handelt. De auteurstelling is helder: interventie op individuele acties ontkracht de autonomie die de inzet van de agent juist motiveert, terwijl interventie op aggregaatpatronen te grof is voor schade waarvan de cumulatieve gevolgen pas achteraf leesbaar worden.
Het structurele dilemma van reactief toezicht
Het paper tekent het dilemma scherp. Voor een systeem dat discrete outputs produceert op identificeerbare beslispunten, is reactief toezicht (de mens die het besluit bevestigt of intrekt) empirisch fragiel maar gekend. Bainbridge en de automation-bias-literatuur laten al decennia zien dat hoe betrouwbaarder de automatisering, hoe slechter de mens wordt in de resterende toezichtstaak.
Voor agentic AI is de positie fundamenteel anders, en het paper toont waarom op beide assen:
Interventie op individuele acties. Als elke individuele tool-call of actie menselijke goedkeuring vereist, is de agent wat de autonomie betreft geen agent meer. Het is een veredelde wizard die per stap om toestemming vraagt. De hele reden om een agent in te zetten was zelfstandigheid over langere trajecten. Het opnieuw doorvoeren van stap-voor-stap menselijke goedkeuring ondermijnt niet alleen de efficiëntiewinst, het ontkracht de autonome capaciteit die de inzet legitimeerde.
Interventie op aggregaatpatronen. De andere pool (de mens kijkt pas achteraf naar statistieken over wat het systeem deed) is te grof voor de schade die agentic AI kan aanrichten. Een enkele ogenschijnlijk onschuldige actie kan onderdeel zijn van een traject waarvan de cumulatieve consequentie pas na veel stappen zichtbaar wordt. Tegen de tijd dat het patroon op een dashboard zichtbaar is, is de schade al ingetreden en niet meer terug te draaien.
De centrale inzet van het paper is dat dit geen verbeterprobleem is van "meer menselijke aandacht", maar een categorisch andere vraag: je kunt een agent niet redden met meer reactie; je moet de norm vooraf stellen.
Anticipatoir toezicht: de normatieve agenda
Het paper stelt de oplossing voor als anticipatoir toezicht: toezicht uitgeoefend vóór de agent handelt, door de normatieve agenda te specificeren die de ruimte van toegestane actie structureert, en die agenda iteratief te verfijnen via specificatie, runtime en inspectie.
Concreet betekent dit: in plaats van "wat doet de agent per stap?" is de relevante vraag "welke handelingsruimte heeft de agent überhaupt?" Die handelingsruimte wordt bepaald door een vooraf gestelde agenda: wat mag wel, wat mag niet, welke uitkomsten zijn acceptabel. Die agenda wordt gedurende de levenscyclus van de agent verfijnd:
- Specificatie: de normatieve kaders worden vooraf vastgesteld, vóór livegang en vóór dat de agent handelt.
- Runtime: de agenda structureert hoe de agent te midden van zijn taakuitvoering binnen de ruimte van het toegestane blijft.
- Inspectie: na afloop wordt geëvalueerd of de agenda adequaat was, en waar de grenzen moeten worden aangepast.
Het cruciale onderscheid met de reactieve benadering: anticipatoir toezicht intervenieert niet op het moment van handelen, maar bepaalt de structuur waarbinnen handelen plaatsvindt. Daar hoort wel een reactieve component bij, maar als complement, niet als kern: de agenda's escalatiecondities bepalen wanneer reactieve interventie wordt aangeroepen. Anticipatoir toezicht is dus niet de vervanging van reactief toezicht, maar de conditionering ervan.
De verantwoordelijkheidsarchitectuur: strict moral answerability
Het paper leest anticipatoir toezicht via Meaningful Human Control als de operationalisering van distal-reason tracking. En het trekt daaraan een expliciete verantwoordelijkheidsarchitectuur door design vast.
Het occupëren van de anticipatoire mode is het vervullen van een rol-gefundeerde prospectieve verplichting: een persoon heeft, op grond van zijn rol, de plicht om vóór het handelen de normatieve agenda adequaat te stellen. De achterwaarts-gerichte verantwoordelijkheid neemt daardoor de vorm aan van strict moral answerability: rationalistisch, relationeel, en geldend ongeacht schuld, in virtute van de principal's eerdere gelegenheid tot voorzorg.
Dat is een scherpe en gevolgentijke claim. Normaal denken we bij verantwoordelijkheid van AI-systemen na over "wie had dit kunnen weten" en "wie is schuldig". Het paper verschuift het zwaartepunt: omdat de principal een eerdere gelegenheid had om voorzorg te nemen (de agenda goed te stellen), kan hij zich niet aan zijn verantwoordelijkheid onttrekken door te wijzen naar wat de agent deed. De verantwoordelijkheid geldt ongeacht of de specifieke schade "verwijtbaar" was in klassieke zin: het is strict answerability.
Het paper ontwikkelt hier ook bridging failure modes en adresseert objecties zoals moral luck en de illusion of control. De zorg dat anticipatoir toezicht kan ontaarden in het idee dat "we het allemaal vooraf hebben geregeld" terwijl dat niet zo is.
Wat dit betekent voor compliance en architectuur
Hoewel het paper filosofisch is, heeft het directe regulatoire en architecturale implicaties, en ze raken precies de praktijk van het EU AI Act-kader.
AI Act art. 14 (menselijk toezicht). Het paper's onderscheid tussen reactief en anticipatoir toezicht is een scherpe lens op art. 14, dat voor high-risk-systemen menselijk toezicht eist. De gangbare interpretatie van art. 14 wordt vaak gereduceerd tot "een mens ziet per besluit toe". Voor agentic AI is die lezing onhoudbaar: precies het structurele dilemma dat het paper tekent. Het paper bevestigt dat de invulling van art. 14 voor agents een anticipatoire component moet hebben: geen stap-voor-stap goedkeuring (dat ontkracht de agent), en geen achteraf-patroonanalyse alleen (te grof), maar een vooraf gestelde normatieve agenda die de handelingsruimte begrenst.
Automation bias als ontwerpeis. Het paper verbindt anticipatoir toezicht met de automation-bias-literatuur (Bainbridge, Parasuraman & Manzey). Dit sluit aan op de AI-GRACE-bespreking: een toezichtsregime is pas een control als de toezichtstap zélf aan assurance is onderworpen. Anticipatoir toezicht verschuift dat van "de mens blijft alert" naar "de agenda wordt geverifieerd".
De agenda is een architectureel artefact. De normatieve agenda is geen beleid op papier; het moet geoperationaliseerd worden in de architectuur, als de begrenzing van de handelingsruimte van de agent, de escalatiecondities, de boundary die het model-als-niet-vertrouwde-component principe afdwingt. Dit verbindt direct met het reference-monitor-argument: een antecedent gestelde agenda is de deterministische structuur die het reactieve, probabilistische deel conditioneert.
Conclusie
Anticipatoir toezicht is geen academische verfijning maar de erkenning dat agentic AI een ander toezichtsregime vraagt dan klassieke systemen. Het paper maakt de keuze scherp: ofwel je stelt de normatieve agenda vooraf en begrenst daarmee de handelingsruimte van de agent (anticipatoir, met escalatiecondities die reactief toezicht aanroepen), ofwel je blijft reactief interveniëren en ontkracht óf de autonomie van de agent, óf de bescherming van de betrokkene. Voor wie agentic AI bouwt, is de praktische les: ontwerp de agenda als een architectureel, geverifieerd artefact, niet als een beleidsdocument dat de agent kan negeren.
Referenties
Baum, Kiener, Langer & Laux, Anticipatory Human Oversight of Agentic AI: A Philosophical Account, arXiv:2609.24242, DFKI / TUHH / Oxford / Freiburg.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.