EDPB zet streep in het zand: web scraping voor AI wordt governed data supply chain
De EDPB zet web scraping voor generatieve AI niet categorisch buiten spel, maar verplaatst het van een technische dataverzamelactiviteit naar een zwaar gereguleerde AVG-verwerking met aantoonplicht. De praktische norm wordt: geen "crawl first, justify later", maar vooraf gespecificeerde doelen, bronselectie, proportionaliteit, transparantie, data-minimalisatie, anti-memorisation maatregelen, rechtenafhandeling en bewijsbare governance.
Het document is Guidelines 03/2026, versie 1.0, aangenomen op 7 juli 2026 als consultatieversie. De publieke consultatie loopt van 8 juli tot en met 30 oktober 2026, 23:59 CET. Het is dus geen finale versie, maar wel een sterk signaal voor de toezichtlijn die organisaties nu al moeten meenemen.
Daarnaast publiceerde de EDPB een tweede richtlijn over anonimisering, met een nieuw driecriteria-toetsingskader voor wanneer data écht anoniem is.
Scope: wie wordt geraakt?
De richtlijn ziet op web scraping uit externe internetbronnen voor training en fine-tuning van generatieve AI. In scope zijn organisaties die zelf scrapen, scrapers inhuren, of reeds gescrapete datasets hergebruiken. Buiten scope vallen onder meer scraping van eigen organisatiedata, publieke sector scraping, en data brokers die alleen datasets beschikbaar houden zonder zelf AI-modellen te trainen. Dat laatste betekent niet dat data brokers irrelevant zijn, maar wel dat de EDPB hier vooral de AI-ontwikkelaar en datasetgebruiker adresseert.
De EDPB benadrukt dat de AVG van toepassing is zodra scraping persoonsgegevens omvat, direct identificeerbaar (namen, foto's, contactgegevens) of indirect identificeerbaar. Ook bij gemengde datasets blijft de AVG gelden voor het persoonsgegevensdeel. Dit is cruciaal, want grote webcorpora bevatten vrijwel altijd persoonsgegevens, ook als het primaire doel "taal", "beeld" of "algemene wereldkennis" is.
De zeven belangrijkste juridische impactpunten
1. Controllerrol wordt feitelijk bepaald, niet contractueel cosmetisch
Als een AI-ontwikkelaar een scraper instrueert over bronnen, categorieën en samenstelling van de dataset, zal de AI-ontwikkelaar doorgaans controller zijn en de scraper mogelijk processor. Als een ontwikkelaar een al bestaande gescrapete dataset gebruikt, zijn scraper en AI-ontwikkelaar in beginsel ieder controller voor hun eigen verwerking. Joint controllership ontstaat wanneer scraper en AI-ontwikkelaar samen doel en middelen bepalen.
2. Transparantie blijft verplicht, maar individuele notificatie is soms niet haalbaar
De EDPB erkent dat individuele informatieverstrekking bij massale scraping moeilijk, onpraktisch of objectief onmogelijk kan zijn. Artikel 14(5)(b) AVG kan dan relevant zijn, maar dit is geen generieke vrijstelling. De controller moet de inspanning afwegen tegen de impact op betrokkenen, met factoren zoals aantal betrokkenen, ouderdom van de data en getroffen waarborgen. Publieke informatieverstrekking blijft altijd vereist wanneer individuele notificatie onmogelijk of disproportioneel is.
Concreet verwacht de EDPB een privacy notice met onder meer: categorieën persoonsgegevens, doelen, rechtsgrond, precieze bronindicatie, of bronnen publiek of niet-publiek zijn, kenmerken van de crawler, en waar mogelijk domeinen, URL's en datum of periode van verzameling in doorzoekbaar formaat. Bij hergebruik van gescrapete datasets is het verstandig te verwijzen naar de oorspronkelijke scraper/controller en de verzamelcondities.
3. Data-minimalisatie verbiedt grote datasets niet, maar wel ongerichte overcollectie
De EDPB zegt expliciet dat het minimalisatiebeginsel training met grote volumes niet verbiedt. Het vereist wel dat geen persoonsgegevens worden verwerkt die niet noodzakelijk, relevant of adequaat zijn. De beoordeling moet vooraf plaatsvinden, niet pas na training.
Voorafgaande maatregelen: synthetische data overwegen, precieze verzamelcriteria definiëren, data mapping en inventory uitvoeren, categorieën zoals banktransacties of locatiegegevens filteren, websites uitsluiten die structureel data over minderjarigen of kwetsbare personen bevatten, en websites uitsluiten die scraping duidelijk weigeren via robots.txt, ai.txt, CAPTCHA of authenticatiebarrières.
Tijdens en na collectie: syntax-based filters, synthetische vervanging, anonimisering en pseudonimisering.
4. Publieke beschikbaarheid is geen toestemming
Toestemming is volgens de EDPB meestal geen bruikbare grondslag voor grootschalige indirecte scraping. Dat iemand persoonsgegevens online heeft gezet, betekent niet dat die persoon toestemming heeft gegeven voor scraping voor een specifiek AI-trainingsdoel. Ook een ontbrekend of niet-toepasselijk robots.txt-bestand is geen toestemming in de zin van de AVG.
5. Legitimate interest wordt mogelijk, maar alleen met een strenge driestappentoets
Private partijen zullen vaak naar artikel 6(1)(f) AVG kijken. De EDPB herhaalt de drie cumulatieve voorwaarden:
| Voorwaarde | Wat de EDPB eist |
|---|---|
| 1. Legitiem belang | Het belang moet "lawful, clearly and precisely articulated and real and present, not speculative" zijn. Een generiek "we trainen een AI-model" volstaat niet, specificeer of het commercieel, publiek, of wetenschappelijk onderzoek is. |
| 2. Noodzakelijkheid | Is er een minder ingrijpende manier? De EDPB noemt expliciet: smallere bronselectie, synthetische data, en pseudonimisering als alternatieven voor "scrape het hele internet". |
| 3. Belangenafweging | De impact op betrokkenen weegt zwaar. De EDPB benoemt het chilling effect: grootschalige scraping creëert een gevoel van surveillance waardoor mensen zichzelf censureren. |
De noodzakelijkheidstoets wordt technisch relevant: minder intrusieve alternatieven zoals smallere bronselectie, pseudonimisering of synthetische data moeten serieus worden beoordeeld. Een brede crawl van grote delen van het internet is daardoor moeilijker verdedigbaar dan een purpose-bound, bronbeperkte dataset.
6. Reasonable expectations krijgen veel gewicht
De EDPB zegt dat mensen door de ontwikkeling van generatieve AI wel kunnen weten dat online data door derden kan worden hergebruikt, maar dat zij dit niet altijd, voor alle doelen, door alle controllers en voor alle datatypes hoeven te verwachten. Relevante factoren zijn onder meer: het type website, het publieke karakter van de publicatie, technische anti-scraping signalen, de relatie met de controller en kenmerken van betrokkenen zoals minderjarigheid of publieke functie.
Dit is een stevige verschuiving: robots.txt, ai.txt, CAPTCHA en login barriers zijn niet alleen technische of contractuele signalen, maar worden door de EDPB ook meegenomen in data-minimalisatie en in de redelijke verwachtingen van betrokkenen. Scraping tegen zulke signalen in maakt artikel 6(1)(f) significant kwetsbaarder.
Praktijkvoorbeeld uit de richtlijn: Een organisatie die publiek toegankelijke stemopnames scrapet om een voice generation tool te bouwen, zónder aanvullende maatregelen tegen misbruik, die kan zich niet op legitimate interest beroepen.
7. Speciale categorieën persoonsgegevens blijven het zwaarste blokkadepunt
Voor gegevens over bijvoorbeeld ras, etnische afkomst, politieke opvattingen, gezondheid of seksuele gerichtheid geldt een principieel verwerkingsverbod, tenzij naast artikel 6 ook een uitzondering uit artikel 9(2) AVG geldt. De EDPB erkent dat bij scraping soms pas na collectie duidelijk wordt of zulke data aanwezig zijn, maar zegt ook dat residuele verwerking zonder rechtvaardiging onrechtmatig blijft.
De EDPB gebruikt GC & Others (C-136/17) als mogelijke analogie voor incidentele en residuele verzameling, maar benadrukt dat dit geen algemene vrijstelling is. De controller moet per geval aantonen dat:
- De verwerking vergelijkbaar is met zoekmachine-achtige verwerking
- Speciale categorieën alleen incidenteel en residueel worden verwerkt
- Preventie moeilijk of onmogelijk was
- Maatregelen zijn genomen binnen de eigen verantwoordelijkheden, bevoegdheden en mogelijkheden
De anonimiseringsrichtlijn: drie criteria voor échte anonimiteit
De tweede EDPB-richtlijn herdefinieert anonimisering met een praktisch toetsingskader. Data is pas anoniem als aan drie cumulatieve criteria is voldaan:
- Singling out is uitgesloten, de data mag geen unieke combinatie van kenmerken van individuele personen weergeven
- Linkability is uitgesloten, de data mag niet te combineren zijn met andere informatiebronnen om personen te identificeren
- Inference is uitgesloten, er mogen geen betrouwbare conclusies over identificeerbare individuen uit de data getrokken kunnen worden
Controllers kunnen kiezen tussen een contextuele benadering (rekening houdend met de capaciteiten van potentiële aanvallers) en een vereenvoudigde benadering (maximale veiligheid, maar risico op over-classificatie van anonieme data als persoonsgegevens).
Strategische implicatie: web scraping wordt een governed data supply chain
Voor bestuurders is dit de echte boodschap: web scraping voor AI wordt een governed data supply chain. Dataset sourcing, modeltraining, security testing en privacy compliance moeten in één control plane komen.
Minimaal verdedigbaar wordt een architectuur met:

| Domein | Vereiste capability | Praktische invulling |
|---|---|---|
| Governance | AI data intake gate | LIA, DPIA-triage, bronbeleid, go/no-go criteria, DPO sign-off |
| Data sourcing | Source allowlist en denylist | Respecteer robots.txt, ai.txt, CAPTCHA, login walls, minors/sensitive-domain blocklists |
| Provenance | Dataset registry | Bron, URL/domein, crawlperiode, crawler identity, licentie, TDM-status, hash, versie |
| Privacy engineering | Pre-collection en post-collection filtering | PII detectors, special-category classifiers, regex filters, deduplicatie, pseudonimisering |
| Security | AI supply chain controls | Dataset signing, SBOM/AIBOM, malware scanning, poisoning detection, access control |
| Model risk | Memorisation en extraction testing | Privacy red teaming, canary tests, membership inference checks, output filters |
| Rights handling | DSR en opt-out workflow | Public notice, prior objection channel, deletion from datasets, output suppression, unlearning assessment |
| Monitoring | Runtime privacy telemetry | Logging, prompt abuse detection, output leakage detection, escalation to DPO/CISO |
Dit sluit goed aan op NIST AI RMF, vooral Govern, Map, Measure en Manage. NIST positioneert de Generative AI Profile als een cross-sector companion voor AI RMF 1.0 om trustworthiness in ontwerp, ontwikkeling, gebruik en evaluatie te integreren.
Voor securityteams is OWASP GenAI/LLM Top 10 relevant als aanvullende taxonomie. De 2025-lijst noemt onder meer Sensitive Information Disclosure, Supply Chain, Data and Model Poisoning, Vector and Embedding Weaknesses en Misinformation, precies de risicoklassen die door scraping en datasethergebruik worden versterkt.
Risicoregister
| Risico | Inherent risico | Waarom relevant | Kernmitigatie |
|---|---|---|---|
| Onvoldoende rechtsgrond | Hoog | Legitimate interest is geen automatisme, consent is meestal niet haalbaar | LIA per dataset en doel, alternatievenanalyse, DPO-review |
| Disproportionele of ongerichte scraping | Hoog | Untargeted crawling vergroot onbekendheid over welke persoonsgegevens worden verzameld | Targeted scraping, source allowlists, crawl constraints, pre-filters |
| Transparantie-falen | Hoog | Artikel 14 vereist publieke informatie, bronindicatie en rechteninformatie | Public scraping notice, doorzoekbare bronlijst, crawler disclosure |
| Scraping tegen anti-bot of no-AI signalen | Hoog | Ondergraven redelijke verwachtingen en minimalisatie | Respecteer robots.txt, ai.txt, CAPTCHA, login walls, platform policies |
| Speciale categorieën en minderjarigen | Kritiek | Artikel 9 verwerking is verboden tenzij expliciet gerechtvaardigd | Sensitive-domain blocklists, classifiers, snelle deletion, output filters |
| Memorisation, regurgitation, extraction | Hoog | Model kan trainingsdata reproduceren of persoonsgegevens lekken | Deduplicatie, privacy-preserving training, red teaming, output filtering |
| Derde partij dataset zonder provenance | Hoog | Reuse ontslaat AI-ontwikkelaar niet van eigen verantwoordingsplicht | Vendor due diligence, contractuele auditrechten, dataset manifest |
| Accuracy en verouderde data | Middel/hoog | Output met persoonsgegevens moet accuraat zijn voor het doel | Betrouwbare bronnen, timestamping, validatie en updatebeleid |
| AI Act en IP-transparantie mismatch | Middel/hoog | GPAI-providers moeten training content summaries publiceren | Align AVG source registry met AI Act template en copyright/TDM beleid |
AI Act-koppeling
De EDPB-richtlijn gaat primair over AVG/GDPR, maar de Europese AI Act maakt dezelfde dataketen transparanter. De Commissie-template voor general-purpose AI summaries vereist onder meer informatie over data scraped from online sources, namen van gebruikte crawlers, verzamelperiode, beschrijving van de gescrapete content en een lijst van de top 10 procent van gescrapete domeinen (voor SMEs: top 5 procent of 1000, afhankelijk van wat lager is). Die verplichting geldt voor GPAI-modellen op de EU-markt, inclusief open-source modellen.
Praktisch betekent dit: bouw één provenance registry die zowel artikel 14 AVG-transparantie, LIA/DPIA bewijsvoering, copyright/TDM-reservations en AI Act summary reporting bedient. Anders ontstaat duplicatie en inconsistent bewijs.
Go/no-go logica
Go, mits goed gedocumenteerd: publieke bronnen zonder anti-scraping signalen, data door betrokkenen bewust publiek gemaakt, geen structurele minderjarigen of bijzondere categorieën, duidelijk AI-doel, beperkte collectie, public notice, opt-out, filters, extraction testing en model safeguards. De EDPB geeft een positief voorbeeld waarin tekstdata uit vrij toegankelijke bronnen, copyright-respect, anti-memorisation maatregelen, rechtenfacilitatie en publieke broninformatie samen de balancing test kunnen ondersteunen.
Hold: social media, fora, dynamische content, oude data, datasets met onduidelijke herkomst, voice/image/video, online registers, of API's die meer metadata tonen dan gewone gebruikers zien. Hier is extra DPIA, juridische toetsing en technische beperking nodig.
No-go tenzij zwaar gemotiveerd: scraping achter login, CAPTCHA-omzeiling, scraping ondanks expliciete robots.txt of ai.txt blokkade, websites primair gericht op minderjarigen of kwetsbare groepen, opzettelijke verzameling van bijzondere categorieën zonder artikel 9(2)-grond, en stemopnames voor voice generation zonder sterke waarborgen.
Aanbevolen 90-dagen roadmap
0 tot 30 dagen: containment en inventarisatie
Stop nieuwe brede, ongerichte scraping totdat er een LIA/DPIA intake bestaat. Inventariseer alle bestaande AI-training datasets, scraping jobs, vendors, data brokers, crawler identities, broncategorieën en eventuele anti-scraping conflicts. Definieer een interim no-go lijst voor minors, health, finance, geolocation, social platforms met login of CAPTCHA, en bronnen met expliciete no-AI of no-scrape signalen.
30 tot 60 dagen: control plane bouwen
Implementeer een Data Source Gateway met policy-as-code: bronclassificatie, robots.txt en ai.txt checks, CAPTCHA/login detectie, rate limits, jurisdiction tags en provenance capture. Zet een Dataset Registry op met hashes, versies, bronlijsten, crawlperiode, licenties, TDM-reservations en model-lineage. Koppel toegang via OIDC workload identity, scoped short-lived tokens, least privilege en gescheiden secrets management.
60 tot 90 dagen: bewijs en assurance
Formaliseer LIA templates voor artikel 6(1)(f), DPIA triggers, Article 14 notices, opt-out en DSR-workflows. Voer privacy red teaming uit op modellen die met webdata zijn getraind, inclusief extraction, regurgitation, special-category leakage en prompt abuse. Richt model monitoring in voor output filters, incident response, rollback, dataset removal en unlearning assessment.
Wat dit betekent voor de Nederlandse praktijk
Voor organisaties die AI trainen of laten trainen, of dat nu overheden, ZBO's of private partijen zijn, veranderen deze richtlijnen de compliance-afweging fundamenteel:
-
Legitimate interest is geen default. Je moet kunnen aantonen dat je de driestappentoets hebt doorlopen én mitigerende maatregelen hebt geïmplementeerd. Een DPIA alleen is niet genoeg.
-
Robots.txt wordt juridisch relevant. De EDPB maakt expliciet dat technische anti-scraping-maatregelen meewegen in de "redelijke verwachtingen" van betrokkenen. Websites die scraping technisch blokkeren, creëren een gerechtvaardigd vertrouwen dat data níet gescrapet wordt.
-
Synthetische data is de eerste keuze. De EDPB noemt synthetische data herhaaldelijk als minder ingrijpend alternatief. Dit is een signaal richting de markt: investeer in synthetic data generation.
-
De consultatieperiode is een window of opportunity. Tot 30 oktober 2026 kan iedereen input leveren. De definitieve richtlijnen zullen de handhavingspraktijk van Europese privacytoezichthouders, inclusief de Autoriteit Persoonsgegevens, voor jaren bepalen.
-
Nederlandse context: AP-handhaving in aantocht? De AP heeft zich de afgelopen jaren terughoudend opgesteld rond AI en scraping, maar met deze EDPB-richtlijnen is er een duidelijk toetsingskader. Organisaties die nu al hun AI-trainingen tegen deze richtlijnen aanhouden, lopen voorop.
Kritische observaties
De richtlijn maakt "publicly available" juridisch minder relevant dan vaak wordt aangenomen. De relevante vraag wordt niet of data publiek toegankelijk was, maar of verwerking voor dit AI-doel noodzakelijk, proportioneel, verwachtbaar, transparant en technisch begrensd was.
De zwaarste frictie zit bij foundation models en general-purpose AI. Juist daar is het doel breed, de dataset omvangrijk, het aantal betrokkenen onbekend, en het verwijderen van persoonsgegevens uit getrainde modellen technisch moeilijk. De EDPB noemt expliciet dat het na training moeilijk kan zijn om persoonsgegevens uit een model te verwijderen, wat de balancing test zwaarder maakt.
Ons oordeel: organisaties met EU-exposure moeten web scraping voor AI behandelen als high-risk data processing. Niet omdat elke scrape verboden is, maar omdat de bewijsstandaard substantieel stijgt. De verdedigbare positie is source-minimized, purpose-bound, provenance-rich, rights-aware en privacy-tested voordat training start.
De EDPB-richtlijnen zijn beschikbaar op edpb.europa.eu. Guidelines 03/2026 (web scraping) en de anonimiseringsrichtlijn staan open voor consultatie tot 30 oktober 2026, 23:59 CET.
AI & Security Intelligence
Wekelijkse nieuwsbrief met AI updates, security alerts en compliance inzichten, direct in uw inbox.
Security & AI Operating Model
Advisory met executiekracht
Van BIO2 en NIS2 tot EU AI Act, embedded in uw operating model, niet als extern project. Maandelijks opzegbaar, met assessments als bewijsvoering.