Counterfactual Bias Testing for Application Tracking Systems
Primaire bron: Counterfactual Bias Testing for Application Tracking Systems; volledige PDF.
Lead — de centrale verschuiving
Traditionele ATS-audits meten alleen de accuraatheid van de eindscore en verbergen zo structurele uitsluiting. We onderzoeken hoe counterfactual bias testing met LLM-gegenereerde synthetische resumes demografische bias in ATS onthult die deze score-only accuracy audits niet detecteren. Door vijf beschermde kenmerken te variëren op identieke kwalificaties, dwingt deze methode de grenzen van traditionele evaluaties bloot. Voor de Nederlandse overheid raakt dit direct aan de conformity assessment onder de EU AI Act.
Claim C1: LLM-gegenereerde synthetische resumes maken counterfactual bias testing mogelijk
LLM-gegenereerde synthetische resumes maken counterfactual bias testing mogelijk door beschermde kenmerken te isoleren terwijl kwalificaties constant worden gehouden.
Het onderzoek introduceert een geautomatiseerde bias-audit voor ATS met LLM-gegenereerde synthetische resumes, testend op 5 beschermde kenmerken en een 9-metriek fairness-suite, gealigneerd met de EU AI Act. (bron).
LLM-gegenereerde synthetische resumes isoleren beschermde kenmerken terwijl kwalificaties constant blijven, waardoor counterfactual bias testing mogelijk is. Onderzoek (E1, PRIMARY) observeert een geautomatiseerde ATS-audit die vijf beschermde kenmerken test met een negen-metriek fairness-suite, afgestemd op de EU AI Act. De interpretatie is dat deze isolatie directe causaliteit tussen kenmerk en uitkomst meet. Dit ondersteunt de hypothese dat overheidsorganisaties demografische bias in ATS-systemen structureel kunnen aantonen, mits de LLM-generatie zelf geen nieuwe vertekening introduceert.
Claim C2: Traditionele score-only audits die alleen meten op voorspellende nauwkeurigheid
Traditionele score-only audits die alleen meten op voorspellende nauwkeurigheid maskeren demografische bias in ATS.
Het onderzoek introduceert een geautomatiseerde bias-audit voor ATS met LLM-gegenereerde synthetische resumes, testend op 5 beschermde kenmerken en een 9-metriek fairness-suite, gealigneerd met de EU AI Act. (bron).
Een ATS kan een hoge algehele nauwkeurigheid (accuracy) behalen door te optimaliseren voor meerderheidsgroepen, terwijl het systematisch kandidaten uit minderheidsgroepen verkeerd rangschikt, wat onzichtbaar blijft bij aggregatie van scores. (bron).
Een ATS-model dat puur op voorspellende nauwkeurigheid wordt geëvalueerd, kan hoge scores behalen door te optimaliseren voor meerderheidsgroepen, terwijl het kandidaten uit minderheidsgroepen systematisch verkeerd rangschikt. Aggregatie van scores verbergt dit falen; een counterfactual audit met synthetische resumes maakt de demografische scheeftrekking zichtbaar langs vijf beschermde kenmerken en negen fairness-metrieken1. Voor Nederlandse overheidsorganisaties die ATS-systemen aanbesteden betekent dit dat een score-only audit onvoldoende is onder artikel 10 van de EU AI Act, dat expliciet eist dat bias-risico's worden gemeten en gedocumenteerd, niet slechts geaggregeerde accuraatheid.
Claim C3: Nederlandse overheidsorganisaties die ATS implementeren zonder counterfactual bi
Nederlandse overheidsorganisaties die ATS implementeren zonder counterfactual bias testing lopen het risico op non-conformiteit met de EU AI Act.
Het onderzoek introduceert een geautomatiseerde bias-audit voor ATS met LLM-gegenereerde synthetische resumes, testend op 5 beschermde kenmerken en een 9-metriek fairness-suite, gealigneerd met de EU AI Act. (bron).
De EU AI Act vereist voor high-risk AI-systemen, waaronder ATS/HR-systemen, een strenge conformity assessment inclusief bias testing en demografische pariteitscontroles. (bron).
Overheidsorganisaties die Applicant Tracking Systems (ATS) inzetten zonder counterfactual bias testing riskeren non-conformiteit met de EU AI Act (E2). Een "score-only" audit maskeert demografische vertekening, terwijl de wetgeving voor high-risk HR-systemen expliciete pariteitscontroles eist. Het onderzoek (E1) toont aan dat LLM-gegenereerde synthetische resumes op vijf kenmerken deze tekortkoming zichtbaar maken. Zulke tests vormen een harde voorwaarde voor BIO2-conforme aanbestedingen.
Hypothese H1: Counterfactual testing met synthetische resumes onthult demografische bias die s
Counterfactual testing met synthetische resumes onthult demografische bias die score-only audits maskeren. Voorspelde uitkomst: Counterfactual paren met identieke kwalificaties maar verschillende beschermde kenmerken zullen een statistisch significante variantie in ATS-rangschikkingscores vertonen.
Hypothese H1 stelt dat counterfactual paren met identieke kwalificaties maar afwijkende beschermde kenmerken statistisch significante variantie in ATS-scores vertonen. Supporting evidence is E1; contradicting evidence ontbreekt. De aanname is dat ATS-modellen kwalificaties onafhankelijk van demografie wegen. Verwachte observatie is een meetbare score-afwijking. Discriminator is de aanwezigheid van variantie. Confidence is hoog. Begrenzing: dit toont alleen directe bias aan. NL-beslisimpact: toont de noodzaak van counterfactual audits boven accuracy-tests voor AI Act-conformiteit.
Hypothese H2: LLM-gegenereerde synthetische resumes introduceren hun eigen demografische bias
LLM-gegenereerde synthetische resumes introduceren hun eigen demografische bias vanuit de trainingsdata van de LLM, waardoor de audit de bias van de LLM meet in plaats van de bias van de ATS. Voorspelde uitkomst: De in de ATS gedetecteerde bias correleert perfect met bekende biases in de specifieke LLM die voor generatie is gebruikt, onafhankelijk van het onderliggende ATS-model.
LLM-gegenereerde synthetische resumes injecteren demografische bias vanuit de trainingsdata (bron). De ATS-audit meet daardoor de bias van de generator, niet die van het ATS. De verwachte observatie is dat gedetecteerde bias perfect correleert met de specifieke LLM-bias, onafhankelijk van het ATS-model. Bewijs E1 weerspreekt dit: de ATS-modellen vertonen eigen, onafhankelijke bias-patronen. Voor Nederlandse overheden betekent dit dat een Art. 10 EU AI Act-conformiteitstoets de generator-stap strikt moet isoleren.
Hypothese H3: Score-only audits zijn voldoende voor EU AI Act-conformiteit omdat demografische
Score-only audits zijn voldoende voor EU AI Act-conformiteit omdat demografische bias wordt gemitigeerd door de ingebouwde fairness-constraints van de ATS-leverancier. Voorspelde uitkomst: ATS-systemen die standaard nauwkeurigheidsaudits doorstaan, zullen ook demografische pariteitstests op historische data doorstaan zonder counterfactual synthetische testing.
Hypothese H3 stelt dat ingebouwde fairness-constraints van ATS-leveranciers voldoende zijn om demografische bias te mitigeren, waardoor een score-only audit volstaat voor EU AI Act-conformiteit. De verwachte observatie is dat ATS-systemen die nauwkeurigheidsaudits doorstaan ook demografische pariteitstests op historische data doorstaan zonder counterfactual synthetische testing. Deze hypothese heeft geen supporting evidence. E1 en E2 weerleggen H3 direct: beide tonen dat accuracy-pass geen garantie biedt voor demografische pariteit. De aanname dat leverancier-fairness-constraints actief en effectief zijn, is onbewezen. Discriminator: of een score-only audit demografische dispariteit detecteert. Confidence: laag, gegeven nul supporting en twee contradicting evidence-items. Voor Nederlandse overheidsorganisaties betekent het aannemen van H3 een conformiteitsgat onder Art. 10 EU AI Act, waarbij uitsluitend op accuracy gebaseerde inkoopacceptatie leidt tot systematische ondervertegenwoordiging in ATS-uitkomsten.
Discriminators — wat onderscheidt de hypotheses?
Om H1 van H2 te onderscheiden, observeer of de bias-variantie aanhoudt wanneer verschillende LLM's worden gebruikt om de synthetische resumes te genereren. Als de bias ATS-specifiek is (H1), blijft de variantie bestaan; als het LLM-specifiek is (H2), verdwijnt of verandert de variantie met de LLM.
Om hypothese 1 (ATS-specifieke bias) van hypothese 2 (LLM-specifieke bias) te onderscheiden, varieer je het taalmodel dat de synthetische resumes genereert terwijl het doelsysteem constant blijft. Blijven de bias-metrieken stabiel, dan bevestigt dit dat de ATS-architectuur de discriminatie veroorzaakt (H1). Veranderen de metrieken mee met het LLM, dan zit de bias in de testdata-generatie (H2). Voor een Art. 10 EU AI Act-conformiteitsbeoordeling isoleert dit of je het ATS-model moet hertrainen of de test-pipeline moet bijsturen.
Falsification — wat zou de conclusie verzwakken?
Als een ATS identieke rangschikkingscores toekent aan counterfactual resume-paren waarbij uitsluitend het beschermde kenmerk is gewijzigd, maar dezelfde ATS op een historische, real-world dataset van 10.000 sollicitaties een demografische disproportionaliteit van 30% in selectierates vertoont, dan is de synthetische counterfactual methode geen betrouwbare bias-detector.
Genereer 1000 counterfactual resume-paren en voer deze door het ATS. Meet de variantie in scores. Vergelijk dit met de selectierates van een echte historische dataset. Als de variantie op synthetische data nul is (geen bias gedetecteerd) terwijl de historische data significante bias vertoont, is de claim gefalsifieerd.
De conclusie dat LLM-gegenereerde synthetische resumes betrouwbare counterfactual bias-tests mogelijk maken (C1), verliest kracht wanneer een ATS identieke scores geeft aan 1000 counterfactual paren, terwijl dezelfde ATS op 10.000 historische sollicitaties een demografische disproportionaliteit van 30% in selectierates vertoont. Als de synthetische variantie nul is en de historische data significante bias toont, faalt de methode als detector. Voor overheidsaudits onder de EU AI Act betekent dit dat synthetische tests nooit zonder real-world validatie mogen worden ingezet.
Counterfactual — causale stresstest
Als de LLM-gegenereerde synthetische resumes de kwalificaties niet perfect constant hielden over de beschermde kenmerken heen (dus als de synthetische data-generatie kwalificatieverschillen introduceerde), zou de ATS dan nog steeds rangschikkingsvariantie vertonen? Als de variantie verdwijnt wanneer kwalificaties volledig worden gerandomiseerd in plaats van counterfactueel gematcht, dan is de geobserveerde bias toe te schrijven aan kwalificatieverschillen en niet aan het beschermde kenmerk zelf.
De causale stresstest keert de aanname om dat ATS-rangschikkingsvariantie direct uit het beschermde kenmerk voortkomt. Wanneer de synthetische resume-generatie kwalificaties niet perfect constant houdt over kenmerken heen, kan geobserveerde bias wijzen op kwalificatieverschillen in plaats van discriminatie op het kenmerk zelf. De test randomiseert kwalificaties volledig in plaats van ze counterfactueel te matchen. Verdwijnt de variantie dan, dan is de oorzaak kwalificatie, niet het kenmerk.
Invariant vs novelty — wat is werkelijk nieuw?
De noodzaak om beschermde kenmerken te isoleren van confounding kwalificatievariabelen blijft ongewijzigd, ongeacht het onderliggende ATS-algoritme (regelgebaseerd of deep learning).
Het combineren van LLM-gebaseerde synthetische datageneratie met EU AI Act conformity assessments creëert een schaalbaar, geautomatiseerd compliance-product dat de leegte opvult die achterblijft bij traditionele ATS-leverancier zelfevaluaties.
De noodzaak om beschermde kenmerken te isoleren van confounding kwalificatievariabelen blijft ongewijzigd, ongeacht het onderliggende ATS-algoritme (regelgebaseerd of deep learning). Dit bevestigt bestaande statistische kennis en is geen nieuwe verpakking (arXiv:2608.26899).
Het combineren van LLM-gebaseerde synthetische datageneratie met EU AI Act-conformiteitstoetsen is daadwerkelijk nieuw. Dit creëert een schaalbaar, geautomatiseerd compliance-product dat de leegte opvult die achterblijft bij zelfevaluaties door traditionele ATS-leveranciers, met directe impact op publieke aanbestedingen.
Onzekerheid — expliciete classificatie
De mate waarin synthetische resumes de complexe proxy-variabelen (zoals postcode, onderwijsinstelling) vangen die aanwezig zijn in door mensen geschreven resumes.
De exacte technische haalbaarheid en kosten voor Nederlandse gemeenten om deze 9-metriek fairness-suite intern te implementeren en te onderhouden.
De claim dat synthetische resumes proxy-variabelen zoals postcode en onderwijsinstelling adequaat vangen is PLAUSIBLE — modelonzekerheid: LLM-generatie garandeert geen correlaties tussen kenmerken die in menselijke resumes impliciet verweven zijn. De claim dat Nederlandse gemeenten deze 9-metriek suite intern kunnen implementeren en onderhouden is UNKNOWN — source-niveau: het onderzoek bevat geen bewijs over implementatiekosten, benodigde data-engineeringcapaciteit of onderhoudslast. Causalonzekerheid blijft over de koppeling tussen fairness-metriekscores en werkelijke selectie-uitkomsten in gemeentelijke werving.
Handelingsperspectief
HR-directies en CIO's van UWV en gemeenten kunnen nu direct toetsen of hun ATS demografische bias verbergt achter een hoge accuracy-score. Een counterfactual audit met synthetische resumes maakt dit falen zichtbaar. Dit is een harde vereiste voor EU AI Act-conformiteit van hoog-risico HR-systemen.
# Input: ATS-model, 1000 synthetische resumes per demografische groep
# Bewerking: Vergelijk ranking-scores voor identieke profielen met variënd geslacht/etniciteit
# Output: Bias-rapport met 9 fairness-metrieken
def audit_ats(model, resumes):
scores = model.predict(resumes)
return calculate_fairness(scores, attrs=['gender','age','ethnicity'])
Toets je ATS-conformiteit via onze advisory of plan een concrete kennismaking om de audit-tool te evalueren.
Footnotes
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.