Compliance-QA met Domain-Adapted RAG: Waarom Alleen Retrieval Niet Werkt
Financial institutions opereren onder dichte, frequent gewijzigde regelgeving. Een compliance-vraag beantwoorden vereist niet alleen vloeiende taal, maar ook verifieerbare verankering in de autoritaire brontekst. Large language models zijn aantrekkelijk voor dit werk, maar de modellen die organisaties realistisch on-premise kunnen draaien zijn compact, en compacte modellen hallucineren verplichtingen.
Het paper Automated Regulatory Compliance Question Answering in Financial Services with Domain-Adapted Retrieval-Augmented Generation (Deußer et al., 2026) onderzoekt of een zorgvuldig domein-geadapteerde RAG-pipeline dat gat dicht.
ObliQA: een benchmark voor regelgevingsvragen
De auteurs bouwden ObliQA, een vraag-antwoordbenchmark gebaseerd op de Abu Dhabi Global Market-rulebooks. Dit is geen algemene reading-comprehension-task: vragen vereisen het nauwkeurig lokaliseren van specifieke verplichtingen in juridisch dichte tekst. De benchmark test dus zowel retrieval als de kwaliteit van het gegenereerde antwoord.
De retriever: drie stadia van verbetering
De retriever is in drie stadia opgebouwd bovenop LegalBERT:
- Entailment tuning. Vraag-passage-matching wordt gerecaderd als premise-hypothesis-reconstructie. Dit leert het model om niet alleen op trefwoordoverlap te scoren, maar op logische implicatie.
- Contrastive tuning. Met in-batch negatives wordt het model gedwongen om subtiele onderscheiden te maken tussen relevante en bijna-relevante passages.
- Score-level fusion met BM25. De dense embeddings worden gecombineerd met de sparse BM25-scores voor hybride ranking.
Het resultaat is indrukwekkend. Recall@10 stijgt van 0,256 (baseline LegalBERT) naar 0,774 (staged retriever). Ter vergelijking: BM25 scoort 0,678 en het algemene dense model E5-large-v2 scoort 0,758. De staged retriever overtreft dus zowel klassieke lexical search als sterke general-purpose dense encoders.
De generator: compacte modellen met RAFT-LoRA
De generator is een compact model (2B tot 12B parameters), gekwantiseerd naar 4-bit. De auteurs testen twee aanpakken: standaard prompting en retrieval-aware fine-tuning (RAFT) via LoRA. RAFT-LoRA verbetert de composite RePASs-score, een maat voor antwoordkwaliteit, voor elk model. Opvallend: de grootste winst zit bij het zwakste model.
Dit is goed nieuws voor organisaties die geen GPT-4-klasse modellen kunnen of willen inzetten. Met domeinadaptatie presteren kleine modellen substantieel beter op juridische vragen.
De twee waarschuwingen
Het paper bevat twee belangrijke nuanceringen die direct relevant zijn voor iedereen die RAG inzet voor compliance.
Ten eerste: geen transfer naar andere jurisdicties. De aangepaste modellen generaliseren niet naar Australische case-law. Domeinadaptatie is echt domein-specifiek: een model dat is getraind op Abu Dhabi-regelgeving, presteert niet zonder aanpassing op andere rechtsgebieden. Voor Nederlandse organisaties betekent dit dat een compliance-QA-tool expliciet moet worden getraind op Nederlandse en Europese regelgeving, NIS2, AI Act, BIO2, in plaats van te vertrouwen op generieke juridische embeddings.
Ten tweede: closed-book hallucineert net zo goed. Een model zonder toegang tot passages, puur op basis van parametrische kennis, scoort slechts 0,011 RePASs onder de volledige pipeline. Dat lijkt een klein verschil, maar de antwoorden citeren niets en misstaan verplichtingen. In compliance-context is dat onacceptabel: een antwoord dat er goed uitziet maar de verkeerde paragraaf aanhaalt of een verplichting weglaat, creëert juridisch risico.
De les is dat retrieval niet optioneel is, maar dat retrieval op zich ook niet genoeg is. Je hebt zowel een sterke retriever nodig die de juiste passages vindt, als een generator die die passages correct interpreteert en verwerkt.
Praktische implicaties voor NIS2, AI Act en BIO2
De methodiek is direct toepasbaar op Europese compliance-vragen:
- NIS2 vereist passende maatregelen voor cyberbeveiliging en incidentrapportage. Een domain-adapted RAG-tool kan operators helpen om snel te achterhalen welke verplichtingen gelden voor hun sector en systeemklasse.
- AI Act vereist risk management en technische documentatie voor high-risk systemen. Een compliance-QA-tool die de AI Act-verordening als corpus gebruikt, kan auditors en ontwikkelaars directe, geciteerde antwoorden geven op vragen over conformiteit.
- BIO2 vereist risicogebaseerde beheersing. Domain-adapted retrieval zorgt dat antwoorden zijn verankerd in de actuele baseline, niet in verouderde parametrische kennis.
Het verschil tussen een generieke RAG-implementatie en een domain-adapted versie is hier het verschil tussen een systeem dat plausible antwoorden geeft, en een systeem dat aantoonbaar juiste antwoorden geeft.
Zakelijke kans: PoC compliance-QA-tool
Organisaties die nu handmatig compliance-vragen beantwoorden, of die generieke chatbots inzetten, kunnen met een beperkte PoC valideren of domain-adapted RAG hun antwoordkwaliteit structureel verbetert. Een geschatte investering van €25.000 tot €50.000 levert een geteste retriever-generator-pipeline op, getraind op de specifieke regelgeving die voor de organisatie geldt. Dat is een fractie van de kosten van een compliance-incident dat voortkomt uit een verkeerd geïnterpreteerde verplichting.
Conclusie
De stijging van Recall@10 van 0,256 naar 0,774 is op zichzelf al overtuigend bewijs dat domeinadaptatie werkt. Maar de grotere boodschap is voorzichtigheid. RAG zonder domeinspecifieke tuning geeft antwoorden die klinkend zijn maar fundamenteel onbetrouwbaar. En zelfs met sterke retrieval blijft de generator een risico als je niet verifieert dat het antwoord de gevonden passages correct weergeeft.
Voor compliance is alleen een antwoord dat zowel gevonden als juist is, goed genoeg.
Referenties
Deußer, T., Pillai, A., Bariviera, A.F., Bhardwaj, D., Sparrenberg, L., Berghaus, D., Bauckhage, C. & Sifa, R. (2026). Automated Regulatory Compliance Question Answering in Financial Services with Domain-Adapted Retrieval-Augmented Generation. arXiv:2609.30009. University of Bonn, Lamarr-Institute for Machine Learning and Artificial Intelligence, Fraunhofer IAIS.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.