VerifyWise: AI-governance met LLM-evaluaties voor de EU AI Act
Lead: de centrale verschuiving
De EU AI Act dwingt een keuze af: governance als externe dienst afnemen of controle in eigen infrastructuur houden. VerifyWise biedt het tweede: source-available, on-premises hostbaar, met LLM Evals en LLM Arena voor technische modelverificatie. Ik heb de README en de feature-lijst nagelopen; mijn vraag is dan ook: hoe structureert dit instrument audit-efficiëntie zonder afhankelijkheid van externe SaaS-controle? De risico- en control-mappings voor EU AI Act, ISO 42001, NIST AI RMF en ISO 27001 liggen in één codebase, wat de traceerbaarheid van compliance-beslissingen verhoogt. Voor Nederlandse publieke organisaties is dit relevant omdat data-soevereiniteit en security-audits van source code geen afgeleide vereisten zijn, maar expliciet door het platform worden ondersteund.
Claim C1
VerifyWise biedt LLM‑evaluaties en een LLM Arena voor technische modelevaluatie.
Feature (1) LLM Evals + LLM Arena voor technische evaluatie van modellen. (bron).
VerifyWise biedt twee technische instrumenten voor modelevaluatie: LLM Evals en LLM Arena. LLM Evals voert gestandaardiseerde assessments uit op taalmodellen; LLM Arena faciliteert vergelijkende benchmarking tussen modellen. Beide functies zijn geïmplementeerd in de Python-gebaseerde EvalServer en toegankelijk via hetzelfde platform dat risicobeheer en compliance-mappings huisvest. Dit integreert technische validatie in de governance-workflow, wat de fragmentatie tussen ontwikkelteams en compliance-afdelingen reduceert.
De evidence-steun is primair en direct afkomstig van de repository-documentatie. Er is geen kwantitatieve informatie over evaluatie-coverage of ondersteunde model-families; de werkelijke reikwijdte vereist inspectie van de EvalServer-code. Voor Nederlandse publieke organisaties is het on-premises karakter hier relevant: model-evaluatie vindt plaats binnen de eigen infrastructuur, wat data-exfiltratie bij externe benchmark-diensten voorkomt. Dit sluit aan bij de in de lead geformuleerde centrale hypothese dat VerifyWise audit-efficiëntie structureert zonder SaaS-afhankelijkheid.
Claim C2
VerifyWise koppelt risico‑ en control‑mappings aan de EU AI Act, ISO 42001, NIST AI RMF en ISO 27001.
Feature (2) risico‑ en control‑mappings voor EU AI Act, ISO 42001, NIST AI RMF en ISO 27001. (bron).
VerifyWise koppelt risico- en control-mappings aan vier kaders: de EU AI Act, ISO 42001, NIST AI RMF en ISO 27001 (bron). Dit is geen externe template-bibliotheek: de mappings leven in dezelfde codebase als de governance-workflow, wat traceerbaarheid van compliance-beslissingen mechanisch ondersteunt.
De evidence is primair maar functioneel beschreven. De README specificeert niet welke Artikelen of Annexen van de EU AI Act zijn gedekt, noch de diepgang per ISO 27001 Annex A-control. Dat is een begrenzing: een organisatie kan niet aannemen dat volledige conformiteit out-of-the-box bereikbaar is zonder gap-analyse. Voor de Nederlandse publieke sector is het on-premises karakter hier doorslaggevend: risico-classificaties en control-toewijzingen blijven binnen eigen infrastructuur, wat de in de lead geformuleerde hypothese van audit-efficiëntie zonder SaaS-afhankelijkheid versterkt.
Claim C3
VerifyWise maakt snellere audits mogelijk via AI‑gegenereerde antwoorden op compliance‑vragen.
Feature (7) snellere audits via AI‑gegenereerde antwoorden op compliance‑vragen. (bron).
VerifyWise genereert AI-antwoorden op compliance-vragen om audits te versnellen (bron). Het mechanisme is functioneel beschreven: het platform produceert antwoorden op gestandaardiseerde compliance-vragen, wat de doorlooptijd van auditprocessen reduceert. Dit is geen menselijke review-vervanging; de kwaliteit hangt af van de onderliggende prompts en modelconfiguratie, die in de EvalServer-code zitten.
De evidence is primair maar op feature-niveau geaggregeerd. De README specificeert niet welke compliance-vraagtypen worden gedekt, de granulariteit van antwoorden, of het review- en goedkeuringsproces. Dat is een begrenzing: een auditor kan niet aannemen dat gegenereerde antwoorden zonder menselijke verificatie voldoen aan EU AI Artikel 10.3 of ISO 42001 eisen voor documentatie-adequaatheid. Voor Nederlandse publieke organisaties is het on-premises karakter hier relevant: compliance-vragen en gegenereerde antwoorden blijven binnen eigen infrastructuur, wat de in de lead geformuleerde hypothese van audit-efficiëntie zonder SaaS-afhankelijkheid versterkt.
Hypothese H1
Onder inzet van VerifyWise op‑premises treedt een afname van auditduur op.
De hypothese stelt dat on-premises inzet van VerifyWise auditduur verkort. Het mechanisme werkt via drie verstrengelde pijlers: risico- en control-mappings voor meerdere kaders in één codebase (bron), AI-gegenereerde antwoorden op compliance-vragen (bron), en event logs voor audittrails (bron). Samen reduceren deze de fragmentatie tussen technische evaluatie en governance-documentatie.
E3 ondersteunt dit: de README positionert AI-gegenereerde antwoorden expliciet als tijdsbesparing voor audits. Er is geen contradicting evidence in het plan. Assumptie is dat de gegenereerde antwoorden voldoende accuraat zijn voor eerste-pass documentatie, zonder dat menselijke review volledig vervalt. Expected observation: verkorte doorlooptijd bij herhaalbare auditmomenten, niet bij initiële implementatie. Discriminator: of de tijdswinst opweegt tegen de opstartkosten van on-premises hosting en modelconfiguratie. Confidence: medium, omdat de README geen kwantitatieve baseline of validatiemethode specificeert. Voor Nederlandse publieke organisaties is de relevantie dat tijdswinst niet ten koste gaat van data-soevereiniteit, wat bij SaaS-alternatieven wel risico loopt.
Hypothese H2
Onder inzet van VerifyWise op‑premises treedt geen afname van auditduur op, omdat alleen event‑logs zonder AI‑gegenereerde antwoorden de auditefficiëntie beïnvloeden.
De hypothese stelt dat on-premises inzet van VerifyWise de auditduur niet verkort wanneer alleen event-logs zonder AI-gegenereerde antwoorden worden gebruikt. Het mechanisme hangt af van een strikte scheiding: event-logs (feature 6) bieden audittrails, maar geen antwoordgeneratie (bron). Zonder feature 7, AI-gegenereerde antwoorden op compliance-vragen, blijft de auditor handmatig documentatie doorlopen, wat de tijdswinst uit H1 ondermijnt.
E4 ondersteunt dit: de README positionert event-logs als een afzonderlijke audittrail-functie, niet als tijdsbesparend instrument. E3 treedt als contradicting evidence op: zelfde bron presenteert AI-gegenereerde antwoorden wel als expliciete snelheidsverbetering. De assumptie is dat event-logs pas efficiëntiewinst opleveren bij geautomatiseerde analyse, wat VerifyWise niet claimt. Expected observation: ongewijzigde auditduur bij organisaties die bewust AI-generatie uitschakelen om modelafhankelijkheid te vermijden. Discriminator: of de auditor de tijdskosten van handmatige log-analyse accepteert tegenover het risico van AI-gegenereerde fouten. Confidence: medium-high, omdat de functiescheiding in de README expliciet is, maar de praktijkwerking afhangt van auditprocesdesign. Voor Nederlandse publieke organisaties is dit relevant: een on-premises configuratie zonder AI-generatie behoudt data-soevereiniteit, maar vereist expliciete afweging dat audit-efficiëntie dan niet het primaire verkoopargument is.
Hypothese H3
Onder inzet van VerifyWise op‑premises treedt een toename van compliance‑vraagstukken op, omdat de integratie met externe AI‑risk repositories extra complexiteit introduceert.
De hypothese stelt dat on-premises inzet van VerifyWise compliance-vraagstukken vermeerdert door complexiteit bij integratie met externe AI-risk repositories. Het mechanisme betreft feature 9, integratie met het MIT en IBM AI risk repository (bron). Bij on-premises hosting moet deze externe dataset lokaal worden gerepliceerd of via beveiligde kanalen gesynchroniseerd, wat netwerkconfiguratie, versiebeheer en updatefrequentie introduceert die bij SaaS-gebruik door de aanbieder worden opgevangen.
Supporting evidence is afwezig in het plan; de README specificeert niet de architectuur of synchronisatiemodus van deze integratie. Contradicting evidence is eveneens afwezig. Assumptie is dat publieke organisaties de externe repository als verplichte referentie beschouwen, niet als optionele uitbreiding. Expected observation: verhoogde infrastructurele belasting bij periodieke updates van het risk repository, of verouderde mappings bij uitblijven daarvan. Discriminator: of VerifyWise een offline snapshot of live API-koppeling ondersteunt, en welke van beide de standaardconfiguratie is. Confidence: low-medium, omdat de README geen implementatiedetails vermeldt en de werkelijke complexiteit afhangt van onontsloten code-inspectie. Voor Nederlandse publieke organisaties is dit relevant: een on-premises vereiste voor externe data-integratie kan de beoogde autonomie ondergraven wanneer de repository-afhankelijkheid niet expliciet in het beheermodel is verankerd.
Discriminators: wat onderscheidt de hypotheses?
Als auditduur na drie maanden gebruik van VerifyWise op‑premises minstens 20 % korter is dan vóór inzet, dan is H1 waarschijnlijker dan H2; blijft het verschil onder 5 %, dan H2.
De discriminator D1 materialiseert een empirisch beslismoment na drie maanden operationeel gebruik. Het mechanisme is expliciet: auditduur wordt gemeten als doorlooptijd van compliance-controles, met drempelwaarden van 20% versus 5% die de hypothesetoetsing binair verdelen (bron). De begrenzing ligt in het causale isolatieprobleem: een verkorting kan ook voortkomen uit auditorteam-leren of proceswijzigingen buiten VerifyWise. Voor de Nederlandse publieke sector is de NL-beslisimpact dat organisaties expliciet moeten vastleggen of AI-gegenereerde antwoorden (feature 7) daadwerkelijk in productie zijn genomen, of dat alleen event-logs (feature 6) worden gebruikt, want H2 voorspelt identieke auditduur bij uitsluiting van feature 7. De 20%-drempel is ambitieus gegeven de opstartkosten van on-premises EvalServer-configuratie en modelvalidatie; de 5%-ondergrens voor H2 reflecteert meetruis bij korte observatieperiodes. Zonder baseline-meting vóór inzet is de discriminator operationeel onbruikbaar, wat een implementatievereiste aan de meetinrichting stelt die de README zelf niet noemt.
Falsification: wat zou de conclusie verzwakken?
Onder inzet van VerifyWise op‑premises wordt afname van auditduur NIET waargenomen: auditduur blijft binnen 5 % van de baseline. Deze stelling maakt de centrale hypothese falsifieerbaar: zodra een meting na drie maanden géén afname toont, is H1 weerlegd.
Meten van auditduur vóór en na inzet van VerifyWise op dezelfde organisatie gedurende drie maanden.
De huidige conclusie dat VerifyWise op-premises auditduur verkort, zou materieel verzwakken als de meting geen afname toont. Het falsificatiecriterium is strikt: auditduur blijft binnen 5% van de baseline na drie maanden operationeel gebruik (bron). Dit zou het mechanisme van AI-gegenereerde antwoorden en geïntegreerde mappings als inefficiënt of niet-geadopteerd aanduiden.
De observable test vereist een voor-na-meting op dezelfde organisatie gedurende drie maanden. Zonder baseline is de test onbruikbaar: organisaties meten vaak pas na implementatie, waardoor causale attributie onmogelijk wordt. Voor de Nederlandse publieke sector betekent dit dat audit-efficiëntie als implementatie-eis expliciet meetbaar moet worden gesteld, niet als impliciet voordeel wordt geaccepteerd.
Counterfactual: causale stresstest
Als de AI‑gegenereerde antwoorden op compliance‑vragen niet aanwezig waren, zou de afname van auditduur nog optreden?
De counterfactual test het causale mechanisme achter H1: als AI-gegenereerde antwoorden (feature 7) afwezig zijn, volgt de afname van auditduur dan nog? (bron). H2 stelt van niet: event-logs (feature 6) alleen bieden audittrails, geen antwoordgeneratie, dus de auditor doorloopt handmatig documentatie. Dit maakt de claim dat AI-generatie auditduur verkort, empirisch belast: zonder feature 7 resteert alleen de mappings-structuur uit C2, die fragmentatie reduceert maar geen expliciete tijdswinst claimt.
De begrenzing is dat de README geen modale opties specificeert: kunnen organisaties feature 7 uitschakelen terwijl C2 actief blijft? De NL-beslisimpact hangt hieraan: publieke organisaties die modelafhankelijkheid bij compliance willen vermijden, moeten expliciet verifiëren of hun on-premises configuratie AI-generatie dwingend inschakelt of configureerbaar laat. Is het laatste het geval, dan is H1 niet automatisch gerealiseerd bij elke on-premises implementatie, en vervalt het verkoopargument van verkorte auditduur gedeeltelijk.
Invariant vs novelty: wat is werkelijk nieuw?
On‑premises hosting garandeert dat volledige source‑code beschikbaar blijft, ongeacht veranderingen in cloud‑providers.
Combinatie van LLM‑arena evaluaties met EU AI Act‑mappings in één on‑premises platform biedt een unieke, volledig transparante governance‑oplossing voor de publieke sector.
De invariant dat on-premises hosting volledige source-code-toegang garandeert, ongeacht cloud-providerwijzigingen, bevestigt bestaande kennis over infrastructuur-autonomie. Dit is geen noviteit: elke source-available, self-hosted oplossing biedt dit mechanisch. Wat daadwerkelijk nieuw zou zijn, is de combinatie van LLM-arena evaluaties met EU AI Act-mappings in één platform, maar de README specificeert niet of deze twee functies daadwerkelijk integreren: of evaluatie-resultaten automatisch risico-classificaties voeden, of slechts naast elkaar bestaan in dezelfde codebase. De claim van "volledig transparante governance" is nieuwe verpakking van de invariant zelf: source-code-toegang garandeert transparantie over het platform, niet over de modellen die geëvalueerd worden. De enige nieuwe implicatie die uit de combinatie van evidence volgt, is conditioneel: als de EvalServer en governance-mappings gegevensdeling ondersteunen, dan ontstaat een traceerbare keten van modelvalidatie naar compliance-beslissing zonder externe tussenkomst. Deze synthese volgt niet rechtstreeks uit één bron: zij ontstaat uit de combinatie van drie afzonderlijke README-claims (LLM Arena, risico-mappings, on-premise hosting) plus de redenering dat hun samenspel een controleerbare validatieketen oplevert. De README noemt deze integratie echter niet, dus dit blijft een niet-geverifieerde implicatie, geen vastgesteld feit. Voor de Nederlandse publieke sector betekent dit dat de beoogde transparantie twee lagen vereist: inspectie van de VerifyWise-code én explicite validatie dat evaluatie-outputs daadwerkelijk de risico-mappings informeren.
Onzekerheid: expliciete classificatie
Effectiviteit van AI‑gegenereerde antwoorden in organisaties met verschillende schaalgroottes.
Impact van on‑premises hosting op onderhouds- en licentiekosten.
De effectiviteit van AI-gegenereerde antwoorden bij organisaties met verschillende schaalgroottes is PLAUSIBLE op source-niveau: de README claimt tijdsbesparing voor audits maar specificeert geen schaalafhankelijke werking. Measurement-uncertainty is HIGH: geen baseline, geen drempelwaarden, geen organisatiegrootte in de documentatie. Model-uncertainty betreft het impliciete veronderstelde lineaire verband tussen antwoordgeneratie en auditduur; causal-uncertainty is UNKNOWN omdat confounders (teamervaring, procesrijpheid) niet worden gecontroleerd.
De impact van on-premises hosting op onderhouds- en licentiekosten is SPECULATIVE. Source-uncertainty: de README noemt "source-available" en "self-hosted" zonder kostenmodel. Measurement-uncertainty is COMPLETE: geen TCO-vergelijking met SaaS-alternatieven, geen personeelsvereisten voor EvalServer-beheer. Model-uncertainty ontstaat omdat de kostenfunctie voor publieke organisaties afhangt van bestaande infrastructuur en cybersecurity-capaciteit, variabelen die de README niet kwantificeert. Causal-uncertainty: het is onontgonnen of on-premises in deze architectuur leidt tot hogere of lagere totale kosten van eigendom; de invariant van data-soevereiniteit wordt als gegeven gepresenteerd, maar de prijs ervoor niet. Voor Nederlandse publieke organisaties betekent dit dat de beslissing tussen eigen hosting en externe dienstverlening niet evidence-based kan worden gemaakt op basis van alleen deze bron.
Handelingsperspectief
Deze analyse is relevant voor informatiebeveiligingsarchitecten en compliance-officers bij Nederlandse publieke organisaties die een on-premises AI-governance-infrastructuur moeten toetsen tegen de eigen beheercapaciteit. Het concrete vraagstuk: of de combinatie van EvalServer-configuratie, risico-mappings onderhoud en AI-gegenereerde antwoordreview past binnen bestaande DevSecOps-capaciteit, gezien de README geen TCO of personeelsvereisten specificeert.
org = {
"bestaande_infrastructuur": "Kubernetes-cluster met ISO 27001 scope",
"security_clearance": "BV/EV",
"ai_governance_rijpheid": None # onbekend, vereist assessment
}
verifywise_config = {
"hosting": "on-premises",
"features": [6, 7], # event-logs + AI-antwoorden
"evalserver": "Python, vereist GPU voor LLM Arena"
}
def toets_beheercapaciteit(org, config):
if org["ai_governance_rijpheid"] is None:
return "EXPLICIETE_ASSESSMENT_VEREIST"
gpu_beschikbaar = org.get("gpu_cluster", False)
if not gpu_beschikbaar and 1 in config["features"]:
return "EVALSERVER_INFRA_UITBREIDING_NODIG"
# Output: toetsbaar beslismoment
return {
"doorlooptijd_audit": "AFHANKELIJK_VAN_FEATURE_7_ADOPTIE",
"data_soevereiniteit": "GARANDEERD",
"onderhoudslast": "ONGEKWANTIFICEERD_IN_BRON"
}
De pseudocode toont het onontgonnen veld: zonder expliciete ai_governance_rijpheid-meting kan geen organisatie het on-premises voordeel claimen zonder risico op onderschatte beheerslast. Voor organisaties die deze assessment willen structuren, biedt Djimit advisory voor capaciteitsanalyse bij AI-governance-implementaties. Wilt u verkennen of uw organisatie aan deze drempel voldoet, dan bespreekt Djimit dit in een kennismaking.
Bronnen
- VerifyWise, source-available AI governance platform, GitHub, geraadpleegd 6 oktober 2026
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.