ARCCS: An Automated Regulatory Compliance Checking System
Primaire bron: ARCCS: An Automated Regulatory Compliance Checking System; volledige PDF.
Lead: de centrale verschuiving
De verschuiving van handmatige compliance-audits naar agentische, traceerbare regelchecks is geen efficiëntieslag alleen: het is een herverdeling van bewijslast in het bestuurlijk proces. ARCCS demonstreert dit door regulatie te ontbinden in atomaire requirements die individueel verifieerbaar en herleidbaar zijn (Filandrianos et al., 2025). Mijn vraag is hoe deze granulariteit de positie van de Nederlandse publieke sector wijzigt: niet of de techniek werkt, maar welke beslisruimte ontstaat wanneer 98.8% violation-detection accuracy op EU-aanbestedingsniveau beschikbaar komt als open-source infrastructuur. De kernvraag luidt: hoe verandert de relatie tussen regelgever, uitvoerder en toezichthouder wanneer compliance geen documentreview maar een gereproduceerbare, getrapte berekening wordt?
Claim C1
ARCCS bereikt 98.8% violation-detection accuracy in de EU-aanbestedingsbenchmark.
ARCCS detecteert 98.8% violations in een benchmark van 1.200 EU-aanbestedingsregels (bron).
ARCCS bereikt 98,8% violation-detection accuracy op een benchmark van 1.200 EU-aanbestedingsregels (Filandrianos et al., 2025). Dit cijfer meet het correct identificeren van schendingen in gestructureerde aanbestedingsdocumenten, niet de dekking van ongestructureerde processen of interpretatieruimte in gunningscriteria.
De evidence strength is PRIMARY: het betreft de auteurs' eigen evaluatie met gedocumenteerde testset. De 98,8% is een technische observatie; de interpretatie dat deze granulariteit de positie van Nederlandse aanbestedende diensten wijzigt, hangt af van de adoptiegraad van agentische checks als open-source infrastructuur. De 1,2% resterende onzekerheid concentreert zich in randgevallen waar regelinteractie niet lineair is. Deze claim ondersteunt de centrale hypothese dat compliance een getrapte, reproduceerbare berekening wordt, met de nuance dat de bewijslastverschuiving pas materieel is bij institutionele inbedding van de traceerbaarheid.
Claim C2
ARCCS genereert auditable compliance reports met traceerbare requirements.
ARCCS produceert auditable rapporten die atomische requirements traceerbaar maken (bron).
ARCCS genereert auditable compliance reports waarin elke atomaire requirement individueel traceerbaar is naar zijn bronregel (Filandrianos et al., 2025). Het mechanisme werkt als volgt: regulatietekst wordt ontbonden in verifieerbare eenheden, waarna het systeem per eenheid rapporteert of voldaan is, met een audit trail die de gereproduceerbare berekening vastlegt. Dit is een technische observatie; de interpretatie dat deze traceerbaarheid de bewijspositie van Nederlandse uitvoerders wijzigt, veronderstelt dat de audit trail als bewijsmiddel wordt erkend in bestuurlijke procedures. Evidence strength is PRIMARY, maar het paper specificeert niet of de gegenereerde rapporten voldoen aan bestaande archief- of procesrechtelijke eisen. De onzekerheid concentreert zich in de institutionele overgang: traceerbaarheid op technisch niveau garandeert nog geen accountability op bestuurlijk niveau. Deze claim versterkt de centrale hypothese dat compliance een getrapte berekening wordt, met de begrenzing dat de "trap" pas volledig doorlopen is wanneer de audit trail juridisch en organisatorisch wordt gevalideerd, niet slechts technisch geproduceerd.
Claim C3
ARCCS reduceert de tijd voor compliance-checks tot onder 5 minuten per document.
Test toont dat ARCCS verwerkt een GDPR-document in gemiddeld 4 minuten (bron).
ARCCS verwerkt een GDPR-document in gemiddeld 4 minuten (ARCCS Demo Performance). Dit is een SECONDARY-bron: een demonstratie-omgeving, geen peer-reviewed evaluatie. De 4-minutenmeting betreft een enkel documenttype onder onbekende omstandigheden; variantie in documentlengte, regelcomplexiteit en systeembelasting zijn niet gerapporteerd. De claim dat dit "onder 5 minuten" structureel realiseerbaar is, overstijgt de evidence: één gemiddelde in een gecontroleerde demo generaliseert niet naar productiebelasting in Nederlandse overheidsorganisaties. De observatie is verwerkingssnelheid; de interpretatie dat tijdsreductie de beslisruimte van uitvoerders wijzigt, vereist extrapolatie naar huidige handmatige doorlooptijden en procesinrichting. Deze claim raakt de centrale hypothese indirect: snelheid verandert de relatie tussen regelgever en uitvoerder pas als de 4 minuten worden ingebed in herroepbare, gecontroleerde procedures, niet als losstaande technische prestatie.
Hypothese H1
Onder gebruik van ARCCS treedt een stijging van violation-detection accuracy tot ≥98% op in de EU-aanbestedingsbenchmark.
ARCCS realiseert ≥98% violation-detection accuracy in EU-aanbestedingschecks door regulatie te ontbinden in atomaire requirements die individueel verifieerbaar zijn (Filandrianos et al., 2025). Het mechanisme: een agentische pipeline die 1.200+ regels niet als tekst interpreteert, maar als computationele constraints afzet tegen documentinhoud, met herleidbare stap-voor-stap-verificatie.
Deze accuracy geldt voor gestructureerde aanbestedingsdocumenten in een gecontroleerde benchmark; de 1,2% resterende foutmarge concentreert zich in niet-lineaire regelinteracties en randgevallen. De discriminator is of dezelfde granulariteit behouden blijft bij Nederlandse aanbestedende diensten met hun specifieke documentvariatie en gunningscriteria. Confidence is matig: het primaire experiment is reproduceerbaar, maar de extrapolatie naar open-source adoptie als infrastructurele standaard vereist veldvalidatie die nog niet is gerapporteerd. De assumption is dat accuracy op benchmarkniveau vertaalt naar betrouwbaarheid in productieomgevingen met onbekende inputvariatie.
Hypothese H2
Onder gebruik van ARCCS treedt geen stijging van violation-detection accuracy op; in plaats daarvan verbetert het alleen de snelheid van compliance-checks.
Hypothese H2 stelt dat ARCCS geen verbetering van violation-detection accuracy realiseert, maar uitsluitend snelheidswinst bij compliance-checks. Het mechanisme zou dan beperkt blijven tot tijdsreductie door parallelle verwerking van atomaire requirements, zonder fundamentele verhoging van detectiekwaliteit.
Supporting evidence ontbreekt in het plan: geen bron rapporteert dat accuracy gelijk blijft bij versnelde verwerking. Contradicting evidence E1 (de 98,8% violation-detection accuracy uit C1/H1) ondermijnt de kern van H2 direct. De 98,8% is een significante stijging ten opzichte van handmatige review, die typisch 60-85% inter-rater reliability kent in complexe regeltoepassing. De assumption dat snelheid en accuracy gescheiden dimensies zijn, houdt geen stand: de agentische pipeline van ARCCS koppelt beide door atomaire ontleding, waarbij snelheid een emergente eigenschap is van parallelle verificatie, niet een vervanging ervan.
Expected observations onder H2 zouden zijn: identieke foutpatronen tussen handmatige en geautomatiseerde checks, alleen versneld. De discriminator is of de foutmarge structureel verschuift: H2 voorspelt 1,2% onzekerheid als plafond, H1 als vloer voor verdere optimalisatie. Confidence is laag: E1 is primair en direct gemeten, terwijl H2 geen empirische onderbouwing heeft in het beschikbare corpus. De betekenis voor Nederlandse aanbestedende diensten is dat H2, indien waar, compliance tot een louter operationele optimalisatie zou reduceren; de falsificatie ervan opent de deur voor kwalitatieve herverdeling van bewijslast.
Hypothese H3
Onder gebruik van ARCCS treedt een toename van false positive detections op, waardoor de algehele kwaliteit daalt.
Hypothese H3 stelt dat ARCCS een toename van false positive detections veroorzaakt, met netto kwaliteitsdaling als gevolg. Het mechanisme zou kunnen liggen in de atomaire ontleding zelf: wanneer regulatie wordt versplinterd in individueel verifieerbare constraints, verliest het systeem de pragmatische tolerantie die menselijke reviewers hanteren bij samenhangende regeltoepassing. Een gunningscriterium dat in isolatie strikt wordt geëvalueerd, kan als violation worden gemarkeerd terwijl de bredere context wettelijke ruimte biedt.
Supporting evidence ontbreekt in het beschikbare corpus: geen bron rapporteert verhoogde false positive rates voor ARCCS. De 98,8% violation-detection accuracy uit H1/C1 meet correcte identificatie van daadwerkelijke schendingen, niet de omgekeerde foutmarge (false positives als fractie van alle negatieve cases). Het paper specificeert geen precision/recall-splitsing of F1-score. Contradicting evidence is indirect: de 96,67% consistentie bij GDPR-beleidsdocumenten (LLM-judges) suggereert stabiliteit in classificatie, niet per se lage false positives maar wel geen systematische drift naar overdetectie.
De assumption dat atomaire ontleding tot overdetectie leidt, veronderstelt dat menselijke reviewers effectief zijn in contextuele afweging; onderzoek naar inter-rater reliability in aanbestedingscontrole (60-85%) ondermijnt deze assumption juist. Expected observations onder H3 zouden zijn: stijgende revisie-aanvragen na geautomatiseerde checks, groeiende klachten over formele afwijzingen bij materiële conformiteit. De discriminator is de false positive rate in productie, niet gemeten in de benchmark. Confidence is laag: geen primaire evidence ondersteunt H3, de mechanismeveronderstelling is plausibel maar niet empirisch verankerd. Voor Nederlandse aanbestedende diensten is de betekenis conditioneel: indien H3 waar, verschuift de bewijslast niet naar uitvoerders maar ontstaat een nieuwe correctielast door beroepsprocedures, wat de bestuurlijke efficiëntie tegenwerkt.
Discriminators: wat onderscheidt de hypotheses?
Als de violation-detection accuracy bij gebruik van ARCCS ≥98% is in de EU-aanbestedingsbenchmark, dan is H1 waarschijnlijker dan H2; blijft die onder 90%, dan H2.
De discriminator tussen H1 en H2 materialiseert in een reproduceerbare benchmarkobservatie: violation-detection accuracy op de EU-aanbestedingsset van 1.200+ regels. H1 voorspelt dat ARCCS, door regulatie te ontbinden in atomaire requirements die als computationele constraints worden afgezet tegen documentinhoud, structureel boven de 98%-drempel blijft (Filandrianos et al., 2025). H2 voorspelt dat de 98,8% uit de gecontroleerde evaluatie een plafond is dat in productieomgevingen terugvalt naar handmatige niveaus, waarbij de 4-minutenverwerkingstijd het enige blijvende verschil zou zijn. De operationele test ligt in de stabiliteit van de foutmarge: als de 1,2% onzekerheid in niet-lineaire regelinteracties bij Nederlandse aanbestedende diensten niet uitzet maar comprimeert, is H1 versterkt; als variantie in documentstructuur en gunningscriteria de accuracy structureel onder 90% drukt, is H2 de betere verklaring. De NL-beslisimpact hangt hier direct van af: pas bij ≥98% consistentie verschuift de bewijslast materieel, omdat de uitvoerder dan met traceerbare, herhaalbare verificatie kan opereren in plaats van met probabilistische menselijke review.
Falsification: wat zou de conclusie verzwakken?
Onder gebruik van ARCCS wordt een stijging van violation-detection accuracy tot ≥98% NIET waargenomen: accuracy blijft ≤95%.
Meten van violation-detection accuracy met en zonder ARCCS op dezelfde EU-aanbestedingsbenchmark; vergelijken of accuracy ≥98% wordt bereikt.
De huidige conclusie, dat ARCCS de violation-detection accuracy in EU-aanbestedingschecks structureel naar ≥98% tilt, verzwakt materieel als dezelfde meting zonder ARCCS of met ARCCS in productieomstandigheden ≤95% oplevert (Filandrianos et al., 2025). Het falsificerende scenario houdt in: de 98,8% uit de gecontroleerde benchmark is niet reproduceerbaar wanneer Nederlandse aanbestedende diensten de tool toepassen op eigen documentvariatie met niet-lineaire regelinteracties en gunningscriteria die buiten de testset vallen. De observable test is een gestandaardiseerde A/B-meting op identieke EU-aanbestedingsdocumenten, waarbij de accuracy met ARCCS systematisch onder de 98%-drempel blijft of de foutmarge van 1,2% explodeert door onbekende inputvariantie. Voor de Nederlandse publieke sector betekent dit dat de bewijslastverschuiving pas materieel wordt bij empirische bevestiging dat de ≥98% geen artefact is van benchmarkselectie, maar robuust tegen productiecomplexiteit. Zonder die bevestiging blijft compliance een probabilistische menselijke review, alleen versneld.
Counterfactual: causale stresstest
Als ARCCS niet wordt ingezet, zou de stijging van violation-detection accuracy tot ≥98% nog optreden?
De counterfactual test of de ≥98% violation-detection accuracy een eigenschap is van ARCCS zelf, of van de onderliggende condities: gestructureerde input, atomaire regelontleding, en herleidbare verificatie. Als ARCCS niet wordt ingezet maar deze condities wel worden nagebootst (bijvoorbeeld door menselijke reviewers met dezelfde atomaire checklist), zou dezelfde accuracy dan volgen? Het paper rapporteert geen menselijke baseline met identieke granulariteit; de 60-85% inter-rater reliability in bestaande aanbestedingscontrole suggereert van niet. De causale stresstest wijst uit dat niet de snelheid maar de atomaire ontleding het differentiërende mechanisme is: zonder ARCCS blijft de bewijslastverschuiving naar herleidbare berekening uit, omdat menselijke review geen reproduceerbare audit trail genereert. De NL-relevantie ligt hier: de accuracystijging is niet los te koppelen van de infrastructuur die deze produceert, wat adoptiebeslissingen conditioneert op institutionele inbedding van de volledige pipeline, niet op cijferovername.
Invariant vs novelty: wat is werkelijk nieuw?
Traceerbaarheid van requirements blijft behouden ongeacht modelgrootte.
Open‑source licentie waarborgt reproduceerbaarheid van resultaten.
Eerste volledig open‑source end‑to‑end compliance‑checking pipeline die auditable rapporten genereert vanuit atomische, traceerbare requirements.
De invarianten in dit plan dragen geen nieuwe kennis: traceerbaarheid van requirements en open-source reproduceerbaarheid zijn gevestigde principes in software-engineering en compliance-architectuur. Wat ARCCS toevoegt, is niet het principe zelf maar de materialisatie ervan in een end-to-end pipeline voor regulatietoepassing. De combinatie van atomaire ontleding met auditable report generation is bestaande techniek; de toepassing ervan op EU-aanbestedingsregels als volledig open-source systeem is dat niet.
De werkelijke novel materialiseert in de samenloop van drie elementen die afzonderlijk bekend zijn maar hier gezamenlijk opereren: 98.8% violation-detection accuracy op een benchmark van meer dan 1.200 regels, met herleidbare stap-voor-stap-verificatie, onder een open-source licentie die reproduceerbaarheid van de volledige keten waarborgt. Dit is niet verpakking: de pipeline genereert geen samenvattende compliance-score maar atomische, individueel traceerbare uitspraken per requirement, wat de bewijslaststructuur in bestuurlijke procedures anders positioneert dan bij aggregerende tools: niet als een breuk, maar als een verschuiving van documentreview naar reproduceerbare berekening.
De nieuwe implicatie volgt uit deze combinatie, niet uit enkel element. Voor Nederlandse aanbestedende diensten ontstaat beslisruimte wanneer een uitvoerder niet meer een menselijke review als bewijs aanvoert, maar een gereproduceerbare berekening met audit trail. De voorwaarde is dat de 98.8% consistentie behouden blijft onder Nederlandse documentvariatie; het plan specificeert geen veldvalidatie die deze extrapolatie waarborgt.
Onzekerheid: expliciete classificatie
Generaliseerbaarheid van ARCCS-prestaties naar niet‑EU regelgeving.
Robuustheid van agentic legal NLP tegen LLM‑hallucinaties.
De classificatie van claims uit het plan verdeelt zich ongelijk over de vier onzekerheidsniveaus. Source-onzekerheid concentreert zich in C3: de 4-minutenverwerkingstijd stamt uit een demonstratie-omgeving, niet uit peer-reviewed evaluatie (ARCCS Demo Performance). Measurement-onzekerheid domineert bij H3: de 98,8% violation-detection accuracy meet correcte identificatie van schendingen, maar precision/recall-splitsing en false positive rate ontbreken in het primaire paper (Filandrianos et al., 2025). Model-onzekerheid materialiseert in het plan-element "Generaliseerbaarheid van ARCCS-prestaties naar niet-EU regelgeving": de atomaire ontleding is getraind op EU-aanbestedingsstructuur, en het paper specificeert geen transferlearning naar Nederlandse aanbestedende diensten met eigen gunningscriteria. Causal-onzekerheid raakt het tweede plan-element, "Robuustheid van agentic legal NLP tegen LLM-hallucinaties": de 96,67% consistentie bij GDPR-documenten (LLM-judges) is een correlatie, geen causal bewijs dat hallucinaties zijn geëlimineerd versus gecorreleerd met gestructureerde input.
De classificatie: C1 (98,8% accuracy) is HIGH_CONFIDENCE op benchmarkniveau, maar PROBABLE voor productieomgevingen. C2 (auditable reports) is HIGH_CONFIDENCE technisch, PLAUSIBLE voor bestuurlijke erkenning. C3 (4-minutenverwerking) is SPECULATIVE als generalisatie. H1 is PROBABLE; H2 is SPECULATIVE (geen ondersteunende evidence); H3 is PLAUSIBLE mechanistisch maar UNKNOWN empirisch. De generaliseerbaarheid naar niet-EU regelgeving is UNKNOWN; de robuustheid tegen hallucinaties is PROBABLE voor gestructureerde input, UNKNOWN voor ongestructureerde.
Handelingsperspectief
Deze analyse is relevant voor CIO's, compliance-officers en aanbestedingsjuristen bij Nederlandse ministeries, uitvoeringsorganisaties en decentrale overheden die nu toetsen of hun huidige compliance-infrastructuur de komende 12-18 maanden houdbaar is. Het concrete probleem: uw organisatie kan vaststellen of de 98,8% benchmark-accuracy van ARCCS translateerbaar is naar uw eigen documentvariatie en gunningscriteria, en of uw archief- en procesrechtelijke kaders een agentische audit trail kunnen opvangen zonder bewijskracht te verliezen.
org_type = input("ministerie | uitvoeringsorgaan | waterschap")
current_review_time = input("gemiddelde doorlooptijd in dagen")
document_variation_score = input("homogeen | gemiddeld | hoog")
traceerbaarheid_niveau = assess_audit_trail_readiness(org_type)
accuracy_extrapolatie = benchmark_to_productie(
benchmark_acc=0.988,
document_variatie=document_variation_score,
regelinteractie_complexiteit="niet-lineair"
)
output = {
"technische_haalbaarheid": accuracy_extrapolatie,
"institutionele_haalbaarheid": traceerbaarheid_niveau,
"tijdslijn": "12-18 maanden veldvalidatie" if accuracy_extrapolatie < 0.95 else "6-9 maanden pilot"
}
Voor een inhoudelijke verkenning van hoe Djimit agentische compliance-infrastructuur positioneert binnen Nederlandse governance, zie /advisory. Om te bespreken hoe dit raamwerk aansluit op uw specifieke aanbestedingsproces, kunt u een kennismaking plannen.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.