Human-AI-samenwerking op schaal: 250.000 gesprekken over staken, regie en frictie
Human-AI Collaboration at Scale: Task Criticality, Agency, and Friction Across 250,000 Conversations. Shao, Zhao, Padmakumar, Wang & Yang (Stanford University), 2026.
1. De vraag die surveys en labstudies niet beantwoorden
AI dringt snel door in professioneel werk, maar het meeste bewijs over hoe mensen er daadwerkelijk mee samenwerken komt uit surveys, gecontroleerde labstudies of smalle task-benchmarks. Geen van deze bronnen vangt wat er werkelijk gebeurt wanneer honderdduizenden mensen, in het wild, hun dagelijks werk naar een model brengen.
Deze Stanford-studie neemt een fundamenteel andere benadering. Op basis van 249.834 privacy-beveiligde, real-world gesprekken van Claude.ai (geleverd door Anthropic, maar onafhankelijk geanalyseerd) stelt zij drie vragen:
- Wat brengen mensen naar AI? (task criticality)
- Welke rol behouden mensen bij het voltooien van dat werk? (human agency)
- Waar breekt de samenwerking? (friction)
De kernvraag die door de drie heen loopt: maakt werken met AI mensen capabeler, of vervangt het hun inspanning?
2. Methode: de pipeline is de beperking
De analyse is model-gebaseerd. Een model beoordeelt elk gesprek op drie dimensies van task criticality : onomkeerbaarheid, externe zichtbaarheid en impact en wijst een van vier tiers toe (van reversibel/privaat/laag tot ernstige gevolgen). Hetzelfde geldt voor de Human Agency Scale (H1-H5) en de frictie-classificatie.
Dit is geen onbelangrijk detail. Het betekent dat elk getal in deze studie een pipeline-geconditioneerde schatting is, geen schoon observationeel feit. De steekproefopzet is onder-beschreven, de out-of-sample facet-validatie is zwak, er is een validation-domain shift van WildChat naar Claude.ai, en de onderzoekers hadden geen directe toegang tot conversation-level ground truth: zij werkten op Anthropic's eigen extractie- en aggregatiepipeline.
De cijfers zijn daarom het beste beschikbare beeld, maar niet de waarheid. Wie "72% human-led" of "49,7% frictie" citeert als exacte observatie, overclaimt de precisie. Dat voorbehoud is zelf een van de waardevolste lessen van het paper.
3. Bevinding 1: kritieke taken bereiken AI: en niet zelden
De centrale bevinding over criticality is ontnuchterend voor wie AI-delegatie nog ziet als iets voor triviale klusjes.
Onder gesprekken met een actiegerichte taak werd 56% geclassificeerd als consequential of high-stakes. Afzonderlijk had 34% van het volledige corpus geen actiegerichte taak (chatten, exploreren, brainstormen zonder deliverable).
De delegatie van hoge criticality concentreert zich in advisory- en professionele domeinen. De Task Criticality Index (TCI) (de volume-gewogen gemiddelde tier per domein, gescoord van 0 tot 3) piekt bij juridische en financiële begeleiding op 2,14. Academische opdrachten scoren het laagst op 1,06. Circa 24% van de juridisch/financiële gesprekken is high-stakes.
Dit is een governance-signaal van de eerste orde: consequenteel, moeilijk-terugdraaibaar werk stroomt nu al massaal naar AI, en niet marginaal maar in het hart van advisory-domeinen : precies de domeinen die onder de EU AI Act en de Nederlandse toezichthouder-aandacht vallen.
4. Bevinding 2: staken veranderen de interactie
Criticality is niet alleen een kenmerk van de taak; het verandert hoe mensen zich gedragen.
- Gesprekslengte verdubbelt bijna van ephemeral naar high-stakes: van 6,5 turns naar 12,4 turns gemiddeld.
- Prompting wordt preciezer naarmate de staken stijgen.
- Taakdecompositie piekt echter bij het consequential-tier en daalt licht bij high-stakes.
De nuance in die laatste bevinding is subtiel en belangrijk. Men zou verwachten dat de hoogste staken de sterkste decompositie uitlokken. Dat gebeurt niet, mogelijk omdat high-stakes taken vaker gaan over oordeelsvorming en interpretatie dan over opsplitsbaar werk. Het suggereert dat de relatie tussen staken en cognitieve strategie niet monotoon is.
5. Bevinding 3: mensen leiden meestal: maar bouwen hun regie zelf
De Human Agency Scale loopt van H1 (AI handelt alleen) tot H5 (volledige menselijke controle). H4 (de mens leidt, AI assisteert) domineert met 72% van de gesprekken. AI-autonome samenwerking (H1 + H2) is 18,2%.
Maar de meest genuanceerde bevinding is dat taaktype niet volledig bepaalt wie leidt. Binnen vrijwel elke taakcategorie bestaat variatie. Mensen construeren hun niveau van regie door hoe ze prompten en itereren, niet door een vooraf vastgestelde rol.
Dit zet de "AI neemt het over"-narratief in een scherper licht. Op populatieniveau is mens-geleide samenwerking de norm, en mensen houden actief grip. De AI-autonome 18,2% is reëel maar niet dominant. Wat ontbreekt in dit getal, zoals de onderzoekers expliciet erkennen: de classificatie toont niet wie de output uiteindelijk adopteert, redigeert, verifieert of in de praktijk brengt.
6. Bevinding 4: "Adapt" is de dominante omgangsvorm
Mensen consumeren AI-output niet passief. "Adapt" (het significant herbewerken van de output) is de meest voorkomende modus over alle criticality-tiers, oplopend tot 60% voor consequential werk en 52% voor high-stakes. Op high-stakes taken stijgt "understand" (vragen om uitleg of verdere details) naar 21%.
Dit is empirisch bewijs tegen de populaire vrees van kritiekloze adoptie. Naarmate de staken stijgen, verschuift het gedrag naar begrijpen en herbewerken, niet naar kopiëren. De mens blijft de eindverantwoordelijke, althans in gedrag, niet noodzakelijk in uitkomst.
7. Bevinding 5: frictie is frequent én vaak productief
Frictie (elk gespreksevent dat voortgang belemmert of vertraagt) komt voor in 49,7% van de gesprekken. Onder de gevlagde gevallen is 42,0% compounding (mens- én modelproblemen samen), 38,6% model-geïnitieerd en 19,4% user-geïnitieerd.
De sleutelbevinding is dat frictie vaak productief is, geclassificeerd als leidend tot verheldering, verfijning of leren. Wanneer frictie optreedt, proberen gebruikers in 78,7% van de gevallen actief herstel, met "addressing the mismatch" als meest voorkomende strategie (72,9%).
Een opvallend clusterresultaat: 33,0% van de topicclusters valt in het high-friction/high-productivity kwadrant, en die clusters zijn goed voor 40,8% van de consequential- of high-stakes taken. Met andere woorden: juist het werk met de hoogste inzet kent de meeste frictie, én de meeste productieve frictie.
8. Bevinding 6: actief onderwijzen is wijdverbreid, maar ongelijk
De spanning tussen capability-building en substitution wordt onderzocht via AI-ondersteund leren en upskilling. Actief onderwijzen komt voor in 67% van de gesprekken, maar de baten zijn ongelijk gerealiseerd.
Dit is de kernspanning van de studie in één getal. Het feit dat twee derde van de gebruikers actief probeert te leren van AI zegt niets over of dat leren daadwerkelijk plaatsvindt. Het paper scheidt deze twee zorgvuldig: de frequentie van onderwijzen is hoog, de effectiviteit is ongelijk en grotendeels ongemeten.
9. Epistemische classificatie van de kernclaims
In de geest van het paper zelf (dat zijn eigen beperkingen nadrukkelijk voorop zet) classificeer ik de claims op bewijssterkte:
| Stelling | Status |
|---|---|
| Consequentieel werk bereikt AI op grote schaal (56% van actiegerichte taken) | Empirisch ondersteund, pipeline-geconditioneerd |
| Mensen leiden meestal (72% H4) | Empirisch ondersteund, pipeline-geconditioneerd |
| Frictie komt voor in ~de helft van de gesprekken | Empirisch ondersteund, pipeline-geconditioneerd |
| Mensen herstellen actief van frictie (78,7%) | Empirisch ondersteund, pipeline-geconditioneerd |
| Werken met AI maakt mensen daadwerkelijk capabeler | Niet aangetoond: het paper meet frequentie van onderwijzen, niet leereffect |
| De exacte percentages (72%, 49,7%, 67%) zijn schone observationele feiten | Onjuist: pipeline-geconditioneerde schattingen |
De sterkste, best verdedigbare claim van het paper is niet een specifiek percentage. Het is het patroon: mensen brengen consequentieel werk naar AI, leiden meestal zelf, herbewerken output actief, en behandelen frictie als onderdeel van het proces. Dat is een beeld van adaptatie aan AI, niet van deferentie aan AI.
10. Wat dit betekent voor de Nederlandse publieke sector
De implicaties voor organisaties die AI in professioneel en advisory-werk inzetten zijn direct:
AI Act-classificatie. De bevinding dat high-criticality delegatie zich concentreert in juridische en financiële advisory-domeinen is precies het terrein waar de EU AI Act high-risk classificatie en menselijk toezicht (artikel 14) verplicht. Wie AI-assistenten in deze domeinen inzet, moet aantonen dat het menselijk toezicht reëel is, en deze studie levert bewijs dat mensen gedrag vertonen dat op toezicht lijkt (adapt, understand), maar niet dat het toezicht effectief is.
Upskilling versus substitutie. Het 67%-onderwijzen-cijfer met ongelijke baten is een waarschuwing voor elke organisatie die AI-adoptie als automatische upskilling ziet. Het feit dat mensen proberen te leren zegt niets over of ze daadwerkelijk capabeler worden. Organisaties die de capability van hun medewerkers willen behouden, moeten leereffect meten, niet alleen gebruik.
Frictie als ontwerpsignaal. De bevinding dat high-stakes taken de meeste (vaak productieve) frictie kennen, suggereert dat frictie niet per definitie een UX-defect is maar een indicatie van actieve cognitieve betrokkenheid. Een product dat frictie volledig weg-optimaliseert, kan juist de "understand"- en "adapt"-gedragingen wegnemen die de menselijke controle in stand houden.
De methodologische les. Voor wie evalueert hoe AI in de eigen organisatie wordt gebruikt: gedragsdata uit logfiles zijn nuttig, maar het paper demonstreert dat de classificatie van die data model-gebaseerd en daarmee onzeker is. Een audit die beweert dat "60% van de taken consequential is" moet transparant zijn over de classifier die dat label produceert.
11. Conclusie
De waarde van deze studie ligt niet in de precisie van haar percentages, maar in het feit dat zij de eerste populatie-schaal blik werpt op hoe mensen werkelijk met AI samenwerken, niet in een lab, maar in het wild, over honderdduizenden gesprekken.
Het beeld dat naar voren komt is genuanceerder dan zowel de hype als de angst. Mensen brengen consequentieel werk naar AI, maar ze leiden meestal zelf, herbewerken actief, en behandelen frictie als onderdeel van het proces. Dat is adaptatie, geen deferentie.
Maar de centrale onbeantwoorde vraag blijft staan: maakt dit mensen capabeler? Het paper beantwoordt die vraag niet: het documenteert dat twee derde van de gebruikers probeert te leren, terwijl de baten ongelijk en grotendeels ongemeten zijn. Voor de Nederlandse publieke sector, waar AI-adoptie nu versnelt in juridische, financiële en beleidsadviserende domeinen, is dat de vraag die ertoe doet, en de vraag die nog niemand op populatieniveau heeft beantwoord.
Bron: Shao, Y., Zhao, D., Padmakumar, V., Wang, J. & Yang, D. (2026). "Human-AI Collaboration at Scale: Task Criticality, Agency, and Friction Across 250,000 Conversations." Stanford University. Data verstrekt door Anthropic (Claude.ai, Free/Pro/Max-plannen; agentic producten uitgesloten); analyse, bevindingen en conclusies zijn uitsluitend die van de auteurs en mogen niet aan Anthropic worden toegeschreven.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.