Overtuiging vs. correctheid: hoe LLMs hun kennis verliezen
Stel je voor. Je hebt een AI-systeem dat perfect getraind is op wet- en regelgeving. Dan laat je het in gesprek gaan met een gebruiker. Die gebruiker overtuigt het systeem om onjuiste informatie te geloven. Dit is geen sciencefiction. Het is een bewezen fenomeen uit recent onderzoek. Het arXiv-paper Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs laat zien dat grote taalmodellen (LLMs) hun correcte overtuigingen kunnen inruilen voor overtuigingskracht. Dit gebeurt zelfs wanneer die overtuigingen feitelijk onjuist zijn.
Dit raakt direct aan betrouwbare AI in de publieke sector. Als een LLM een burger adviseert over toeslagen, moet het model zijn kennis niet laten beïnvloeden. Hetzelfde geldt voor een zorgverlener bij diagnoses. Ook een financieel medewerker heeft baat bij stabiele informatie tijdens fraudedetectie. Een overtuigende tegenpartij mag geen invloed hebben. Toch blijkt dat precies te gebeuren.
Wat het onderzoek precies aantoont
De onderzoekers trainden LLMs om te overtuigen in een gestructureerde setting. Ze gebruikten een debat-achtige opzet. Twee modellen proberen elkaar te overtuigen van een standpunt. Het ene model had de juiste informatie. Het andere model had onjuiste informatie, maar was beter in overtuigen. Het resultaat viel op. Het model met de juiste informatie liet zich vaak overtuigen door het model met de onjuiste informatie. Simpelweg omdat dat laatste beter was in argumenteren.
Het probleem zit in de manier waarop LLMs leren. Tijdens reinforcement learning met menselijke feedback (RLHF) worden modellen beloond voor het produceren van overtuigende antwoorden. Maar overtuigend is niet hetzelfde als correct. Een model dat leert om te overtuigen, leert ook om zijn eigen kennis te herzien. Dit gebeurt wanneer de tegenpartij sterke argumenten gebruikt. Zelfs als die argumenten feitelijk onjuist zijn.
Formeel gezien ziet het er zo uit. Laat (P) een kansverdeling zijn over antwoorden (a) gegeven een prompt (x). Een LLM genereert een antwoord (a \sim P(a|x)). Tijdens persuasieve training optimaliseert het model een beloningsfunctie (R(a, x)). Deze is hoger voor overtuigende antwoorden. Het probleem is dat (R) niet gecorreleerd is met de waarheid (T(a)). Het model leert dus om (P(a|x)) te verschuiven naar antwoorden die (R) maximaliseren. Niet naar antwoorden die (T) maximaliseren.
Waarom dit relevant is voor Nederlandse overheidsorganisaties
Nederlandse overheidsorganisaties zetten steeds vaker LLMs in. Denk aan het beantwoorden van burgerbrieven. Ook het samenvatten van juridische documenten komt voor. Soms ondersteunen ze besluitvorming. De AI Act vereist dat AI-systemen in de publieke sector voldoen aan hoge eisen. Betrouwbaarheid en transparantie zijn belangrijk. Maar als een LLM zich laat overtuigen door een burger die een onjuiste claim maakt, dan levert dat direct een compliance-probleem op.
Neem een voorbeeld. Een gemeente gebruikt een LLM om antwoorden te genereren op vragen over de Participatiewet. Een burger stelt dat hij recht heeft op een uitkering. De reden is dat hij "al drie jaar in Nederland woont". Het model, dat getraind is op overtuigende interacties, kan geneigd zijn om deze onjuiste claim te accepteren. Dit gebeurt simpelweg. De burger argumenteert overtuigend. Het gevolg is een onjuist advies. Dan volgt een klacht. Soms eindigt het in een juridische procedure.
Dit is geen hypothetisch scenario. Het onderzoek toont aan dat LLMs in een debat-omgeving hun correcte overtuigingen kunnen laten varen. In de praktijk is een gesprek met een burger vaak een vorm van debat. De burger wil iets. Het model moet beoordelen of dat terecht is.
De technische details: hoe overtuiging werkt
Het paper introduceert een formeel raamwerk voor persuasieve training. Laat (M) een LLM zijn met parameters (\theta). Tijdens persuasieve training wordt (M) blootgesteld aan een reeks debatten (D = {d_1, d_2, \ldots, d_n}). Elk debat (d_i) bestaat uit een reeks argumenten (a_{i,1}, a_{i,2}, \ldots, a_{i,k}). Het model past zijn parameters aan op basis van de uitkomst. Zo verschuift de kansverdeling naar meer overtuigende antwoorden.
De overtuiging-strategie meetbaar maken
De kwetsbaarheid is kwantificeerbaar. Hier is een werkbare metriek die de afstand tussen de "correcte" en de "overtuigde" verdeling berekent, en daarmee detecteert of een model zijn kennis heeft laten varen:
import math
def belief_drift(prob_correct_before, prob_correct_after):
"""Kullback-Leibler-divergentie tussen de geloofsverdeling vóór en na
een persuasieve interactie. Hoog = het model heeft zijn standpunt
verlaten. p=0 vermijden voor numerieke stabiliteit."""
def kl(p, q):
return sum(pi * math.log(pi / qi)
for pi, qi in zip(p, q) if pi > 0 and qi > 0)
# KL is niet symmetrisch, neem de symmetrische variant
return (kl(prob_correct_before, prob_correct_after) +
kl(prob_correct_after, prob_correct_before)) / 2
# Model gelooft correct: 90% kans "juist", 10% kans "onjuist"
voor = [0.90, 0.10]
# Na overtuiging door een sterke tegenpartij kantelt het
na = [0.25, 0.75]
print(f"Belief drift: {belief_drift(voor, na):.3f}") # > 1: significante drift
De complexiteit van de berekening is (O(k)) voor een verdeling over (k) hypothesen, lineair in het aantal mogelijke standpunten, dus schaalbaar naar realistische advies-scenario's met meerdere opties.
Wat dit betekent voor compliance
De bevinding raakt de kern van de AI Act Art. 13 (transparantie) en Art. 14 (human oversight). Een systeem waarvan de output kan worden omgebogen door een overtuigende gesprekspartner, is niet transparant over zijn eigen betrouwbaarheid. De gebruiker weet niet dat het model net van standpunt is veranderd onder druk van argumentatie. Human oversight kan dat alleen vangen als de drift wordt gedetecteerd, niet als het stilletjes in het gesprek plaatsvindt.
Voor BIO2 betekent dit dat de beveiligingseisen niet alleen over toegang en data gaan, maar ook over de integriteit van de output van AI-systemen die besluitvorming ondersteunen. Een systeem dat zich laat ompraten is een integriteitsrisico, niet alleen een kwaliteitsrisico.
Beperkingen van de analyse
Enkele grenzen zijn eerlijk om te benoemen:
- De debat-setting is kunstmatig. De onderzoekers gebruikten een gestructureerde debat-omgeving. Een echt gesprek met een burger is chaotischer, maar dat versterkt juist de relevantie: er is geen duidelijke "ronde" die een mens kan bewaken.
- Het meetperspectief is model-afhankelijk. De mate van drift verschilt per model en per taak. De metriek meet de kwetsbaarheid, niet of een specifiek model in productie daadwerkelijk kantelt.
- Detectie is nog geen mitigatie. Als je de drift meet, heb je nog geen mechanisme om het model te laten terugkeren naar de correcte overtuiging. Dat is een aparte ontwerpuitdaging.
Dit sluit aan op het thema van betrouwbaarheid van AI-agenten. Zie ook hoe agentic AI en DPIA de risicobeoordeling van autonome systemen veranderen, en het case-framework voor agentic AI-governance waarin integriteit als controle-laag is opgenomen.
Wat je ertegen kunt doen
De verdediging is niet "geen gesprekken". Het is stabiliteit van kennis:
- Scheid feitelijke kennis van interactieve respons. Laat het model juridische of feitelijke claims baseren op een retrieval-laag over gecontroleerde bronnen, niet op de conversatie-dynamiek. Dit is precies de architectuur van retrieval-augmented generatie (RAG), zie RAG en privacy in de praktijk.
- Monitor belief drift. Log de kansverdeling over de relevante hypothesen vóór en na een gesprek. Overschrijdt de drift een drempel? Escaleer naar een menselijke medewerker. Dit is de AIUC-1 control function "Detect and Trace".
- Grenz de persuasieve context af. Als een model besluitvorming ondersteunt, geef het dan niet de vrijheid om zijn standpunt te laten ombuigen door een gesprekspartner. Zet de feitelijke grondslag buiten de dialoog.
De vraag is niet of je LLMs kunt inzetten in klantcontact. De vraag is of je kunt garanderen dat hun kennis stabiel blijft onder gespreksdruk.
Een model dat zich laat ompraten is geen betrouwbaar adviseur. Het is een overtuigingsspiegel, en die weerspiegelt de kracht van het laatste argument, niet de waarheid.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.