Het internetverkeer verandert in hoog tempo. Waar websites tien jaar geleden vooral rekening hielden met menselijke bezoekers en een beperkt aantal zoekmachinecrawlers zoals Googlebot en Bingbot, bestaat vandaag een steeds groter deel van het verkeer uit geautomatiseerde systemen.
Een recente analyse van crawlerverkeer op een Belgische website laat zien hoe groot die verschuiving kan zijn. Over een periode van slechts twee dagen werden meer dan 850.000 bezoeken van herkenbare crawlerfamilies geregistreerd. Opvallend daarbij was niet Google of Bing, maar de enorme hoeveelheid verkeer die als Anthropic-gerelateerd werd herkend.
Meer dan 850.000 crawlerbezoeken in twee dagen
In de onderzochte periode werden de volgende aantallen geregistreerd:
| Crawler / automatisering | Bezoeken |
|---|---|
| Anthropic | 785.515 |
| Amazon | 40.993 |
| 10.115 | |
| Apple | 4.347 |
| Perplexity | 3.227 |
| Bing | 2.866 |
| Andere crawlers | 2.574 |
| Meta | 2.566 |
| Baidu | 1.708 |
| Bytespider | 1.247 |
| Yandex | 381 |
| OpenAI | 126 |
In totaal gaat het om ongeveer 855.000 herkende crawlerbezoeken in twee dagen. Ongeveer 92% daarvan werd als Anthropic-gerelateerd herkend.
Daarbij is een belangrijke technische kanttekening noodzakelijk. De herkenning gebeurde op basis van crawlerfamilies en niet voor alle requests via een cryptografisch of netwerkmatig geverifieerde identiteit. Een user-agent of vergelijkbaar kenmerk kan worden nagebootst. De cijfers tonen dus vooral welk verkeer als een bepaalde crawler wordt herkend en bewijzen niet automatisch dat iedere request daadwerkelijk van het genoemde bedrijf afkomstig is.
80% geautomatiseerd verkeer op een website is niet langer ondenkbaar
In deze specifieke meting bestond ongeveer 80% van het totale websiteverkeer uit geautomatiseerde systemen. Dat betekent niet dat 80% van het volledige internetverkeer uit AI-crawlers bestaat. De verhouding verschilt enorm per website.
Websites met grote hoeveelheden gestructureerde informatie zijn bijzonder aantrekkelijk voor crawlers. Denk aan bedrijvengidsen, vacaturesites, vastgoedplatformen, webshops, vergelijkingssites, nieuwsarchieven en andere grote databanken.
Toch past de ontwikkeling in een duidelijke internationale trend. Volgens het 2025 Bad Bot Report van Imperva, onderdeel van Thales, was in 2024 voor het eerst meer dan de helft van het wereldwijde webverkeer geautomatiseerd. Ongeveer 51% werd als automated traffic geclassificeerd en ongeveer 49% als menselijk verkeer.
Bron: Imperva / Thales, 2025 Bad Bot Report.
Tien jaar geleden was de economische afspraak duidelijk
Het bijzondere is niet alleen dat er meer bots zijn. De economische relatie tussen website en crawler is fundamenteel veranderd.
Bij traditionele zoekmachines bestond jarenlang een eenvoudige, impliciete ruil:
Website → Google crawlt content → Google indexeert pagina → gebruiker zoekt → Google stuurt bezoeker naar website.
Een website betaalde voor hosting, servers, databases, redactie en content. Google mocht die informatie grotendeels gratis crawlen. Daar stond iets waardevols tegenover: distributie.
Voor veel websites was Google daardoor niet alleen een verbruiker van servercapaciteit, maar vooral een belangrijke leverancier van bezoekers en potentiële klanten.
AI verandert deze historische ruil
Bij generatieve AI kan dezelfde keten er heel anders uitzien:
Website → AI-crawler haalt informatie op → informatie wordt verwerkt → AI geeft rechtstreeks antwoord → gebruiker bezoekt oorspronkelijke website mogelijk niet.
Dat is economisch een belangrijk verschil.
De website blijft investeren in infrastructuur en informatie, terwijl het systeem dat deze informatie ophaalt niet noodzakelijk een vergelijkbare hoeveelheid bezoekers terugstuurt.
Hoeveel crawls zijn nodig voor één bezoeker?
Cloudflare publiceerde hierover opvallende cijfers. In analyses uit 2025 bleek dat er enorme verschillen bestaan tussen traditionele zoekmachines en verschillende AI-platformen.
Cloudflare rapporteerde op een bepaald meetmoment ongeveer 14 Google-crawls per doorverwezen bezoeker. Voor OpenAI lag die verhouding volgens dezelfde analyse rond 1.700 crawls per referral en voor Anthropic rond 73.000 crawls per referral.
In een latere Cloudflare-meting verbeterde de gemeten verhouding voor Anthropic, maar bleef het verschil met traditionele search zeer groot.
Bronnen: Cloudflare, analyses over AI crawlers, referrals en contentgebruik, 2025.
Deze cijfers moeten voorzichtig worden geïnterpreteerd. Niet ieder bezoek vanuit een AI-assistent bevat een traditionele HTTP-referrer. Een gebruiker kan bovendien een bedrijfsnaam lezen in een AI-antwoord en de website later rechtstreeks bezoeken.
Toch laten de cijfers een belangrijk structureel probleem zien: sommige AI-crawlers halen enorm veel informatie op in verhouding tot de hoeveelheid direct meetbaar verkeer die zij terugsturen.
Google gebruikt capaciteit, maar levert ook verkeer
Daarom is het te eenvoudig om alle bots als ongewenst verkeer te beschouwen.
Een crawler van Google kan duizenden requests veroorzaken, maar wanneer Google vervolgens tienduizenden menselijke bezoekers naar dezelfde website stuurt, is de economische verhouding duidelijk.
Hetzelfde principe kan gelden voor Bing en in toenemende mate ook voor AI-platformen die bronnen vermelden en gebruikers daadwerkelijk laten doorklikken.
In onze eigen meting viel bijvoorbeeld op dat OpenAI relatief weinig crawlerrequests veroorzaakte. Tegelijkertijd zijn bezoeken vanuit ChatGPT wel zichtbaar. Google blijft eveneens een belangrijke bron van daadwerkelijk menselijk verkeer.
Het probleem is dus niet simpelweg het bestaan van bots. De interessante vraag wordt:
Hoeveel infrastructuur gebruikt een crawler en welke waarde komt daarvoor terug?
AI-crawlers moeten dezelfde pagina's steeds opnieuw controleren
Er speelt bovendien een technisch inefficiënt probleem. Een crawler weet niet automatisch of een pagina sinds zijn vorige bezoek gewijzigd is.
Cloudflare meldde in 2026 dat meer dan de helft van het gemeten AI-crawlverkeer bestond uit het opnieuw ophalen van pagina's waarvan de inhoud niet was gewijzigd.
Dat betekent dat een aanzienlijk deel van het verkeer potentieel weinig nieuwe informatie oplevert.
Bron: Cloudflare, publicaties over AI crawling en content freshness, 2026.
Voor één individuele pagina lijkt dat verwaarloosbaar. Op internetschaal gaat het echter om miljarden requests.
Een crawlerrequest is niet gratis
Een HTTP-request lijkt technisch klein, maar voordat een pagina bij een crawler terechtkomt, kunnen verschillende systemen actief worden:
- DNS-infrastructuur;
- netwerkverbinding en TLS;
- CDN of reverse proxy;
- webserver;
- applicatieserver;
- database;
- zoekindex;
- cache;
- compressie;
- datatransfer;
- logging en monitoring.
Aan de andere kant moet het bedrijf achter de crawler de informatie downloaden, opslaan, dedupliceren, analyseren en eventueel verwerken voor zoekindexen, embeddings, training, retrieval of realtime AI-antwoorden.
De kosten bestaan dus aan beide kanten.
Hoeveel energie kost AI-crawling?
Het energieverbruik van AI krijgt veel aandacht, maar daarbij gaat het meestal over het trainen en gebruiken van grote taalmodellen. Voor het energieverbruik van afzonderlijke webcrawlers bestaan veel minder betrouwbare openbare cijfers.
Een gewone HTML-request vereist vanzelfsprekend veel minder rekenkracht dan het trainen van een groot AI-model of het uitvoeren van een complexe reasoning-query.
Het zou daarom onjuist zijn om iedere crawlerrequest gelijk te stellen aan een AI-query.
Maar schaal verandert de berekening. Honderd requests zijn irrelevant. Honderdduizenden requests per website per paar dagen, verspreid over miljoenen websites, zijn dat niet meer.
Vooral wanneer grote hoeveelheden informatie opnieuw worden opgehaald terwijl de oorspronkelijke content niet veranderd is, ontstaat vermijdbaar gebruik van netwerkcapaciteit, servers, opslag en elektriciteit.
De echte vraag is niet alleen energie, maar economie
Voor website-eigenaren is het directe economische vraagstuk waarschijnlijk belangrijker dan het exacte aantal watturen.
Wie betaalt voor:
- de servers;
- databasecapaciteit;
- bandwidth;
- CDN-verkeer;
- ontwikkeling;
- content;
- dataonderhoud;
- beveiliging;
- monitoring?
Historisch werd een deel van die investering terugverdiend doordat zoekmachines bezoekers terugstuurden.
Wanneer AI-systemen informatie rechtstreeks verwerken en presenteren zonder vergelijkbare hoeveelheden bezoekers terug te sturen, wordt dat economische model minder vanzelfsprekend.
Van gratis crawling naar betalen per crawl?
Dat probleem is inmiddels zo zichtbaar dat nieuwe commerciële modellen ontstaan.
Cloudflare introduceerde bijvoorbeeld Pay Per Crawl. Daarmee wordt het technisch mogelijk om AI-crawlers niet alleen toe te staan of te blokkeren, maar onder bepaalde omstandigheden ook een prijs voor toegang tot content te vragen.
Bron: Cloudflare, Pay Per Crawl-documentatie en AI Crawl Control.
Dat is een fundamenteel andere gedachte dan waarop het openbare web jarenlang functioneerde.
Het oude model was:
Gratis crawlen in ruil voor vindbaarheid en bezoekers.
Een mogelijk toekomstig model wordt:
Crawlen in ruil voor bezoekers, licentievergoeding, betaling per request of een andere vorm van waarde.
Niet iedere crawler moet hetzelfde worden behandeld
Voor website-eigenaren wordt het daarom steeds belangrijker om onderscheid te maken tussen verschillende soorten geautomatiseerd verkeer.
1. Traditionele zoekmachines
Google en Bing kunnen veel pagina's crawlen, maar leveren doorgaans ook zoekverkeer terug. Voor commerciële websites kan dat verkeer rechtstreeks economische waarde vertegenwoordigen.
2. AI-assistenten die bezoekers doorsturen
Systemen zoals ChatGPT en Perplexity kunnen bronnen vermelden en gebruikers naar externe websites sturen. Hoe groot die waarde uiteindelijk wordt, zal per website en sector verschillen.
3. Training- en datasetcrawlers
Wanneer een crawler honderdduizenden pagina's downloadt zonder noemenswaardig zichtbaar referralverkeer, ontstaat een andere kosten-batenverhouding.
4. Realtime AI-agents
Een vierde categorie wordt waarschijnlijk steeds belangrijker. Hierbij vraagt een menselijke gebruiker iets aan een AI-agent, waarna die agent op dat moment een website bezoekt om actuele informatie op te halen. Zo'n request heeft economisch een heel andere betekenis dan een crawler die miljoenen pagina's verzamelt voor een dataset.
Robots.txt alleen is mogelijk niet meer voldoende
Robots.txt werd ontworpen in een tijd waarin crawling voornamelijk draaide om zoekmachines. De huidige situatie is ingewikkelder.
Een website-eigenaar kan bijvoorbeeld Google Search willen toestaan, AI-verwijzingen vanuit ChatGPT welkom vinden, realtime AI-agents toegang geven, maar grootschalige dataset- of trainingscrawlers beperken.
Daarvoor zijn fijnmazigere mechanismen nodig: crawleridentificatie, verificatie, rate limiting, caching, crawl budgets en afzonderlijke regels voor search, AI-training en realtime AI-gebruik.
Let op: een user-agent is geen identiteit
Er is nog een belangrijke technische nuance. Wanneer statistieken melden dat bijvoorbeeld Anthropic, OpenAI, Google of Amazon een pagina bezocht, betekent dat niet automatisch dat iedere request werkelijk van dat bedrijf afkomstig was.
User-agents kunnen worden nagebootst.
Voor betrouwbare analyses moeten website-eigenaren waar mogelijk ook kijken naar IP-ranges, reverse DNS, officiële crawlerdocumentatie en andere verificatiemethoden.
Dat is vooral belangrijk wanneer één crawlerfamilie uitzonderlijk veel verkeer veroorzaakt. Een ongewoon hoog aantal requests is juist een reden om eerst de identiteit en het crawlpatroon te controleren voordat conclusies over een specifieke onderneming worden getrokken.
Het web krijgt een nieuwe economische discussie
De fundamentele vraag wordt uiteindelijk niet of crawlers goed of slecht zijn. Zonder crawlers zouden zoekmachines, AI-assistenten en veel andere nuttige internetdiensten nauwelijks functioneren.
De vraag is hoe de kosten en opbrengsten verdeeld worden.
Een website investeert in informatie. Een crawler gebruikt infrastructuur om die informatie op te halen. Een AI-bedrijf investeert vervolgens opnieuw in infrastructuur om die informatie te verwerken en beschikbaar te maken.
Zolang beide kanten daar voldoende waarde uit halen, bestaat er weinig probleem.
Maar wanneer een website honderdduizenden geautomatiseerde requests verwerkt terwijl daar nauwelijks bezoekers, omzet of andere aantoonbare waarde tegenover staat, wordt het logisch dat website-eigenaren kritischer naar onbeperkte gratis toegang kijken.
Van het menselijke web naar het machine-to-machine web
Misschien is dat uiteindelijk de belangrijkste ontwikkeling.
Tien jaar geleden bouwden we websites hoofdzakelijk voor mensen. Google en Bing waren tussenpersonen die informatie indexeerden om die mensen naar de juiste pagina te brengen.
Vandaag communiceren steeds meer machines rechtstreeks met andere machines.
Crawlers lezen websites. AI-systemen verwerken de informatie. Agents zoeken prijzen, vacatures, bedrijven, producten en vastgoed. Andere systemen combineren en analyseren die gegevens voordat een mens ooit de oorspronkelijke website ziet.
Het internet verandert daardoor langzaam van een netwerk waarin machines mensen naar informatie brengen naar een netwerk waarin machines steeds vaker zelf de informatie consumeren.
Dat maakt crawlerverkeer niet noodzakelijk ongewenst. Maar het maakt het wel noodzakelijk om opnieuw na te denken over toegang, capaciteit, energie, auteursrechten, licenties en vooral de economische waarde van webcontent.
De vraag voor de komende jaren wordt daarom niet alleen: hoeveel bezoekers heeft mijn website? Steeds belangrijker wordt: wie gebruikt mijn website, hoeveel infrastructuur kost dat en wat krijg ik daarvoor terug?
Bronnen en verdere informatie
Imperva / Thales — 2025 Bad Bot Report.
Cloudflare — Radar Year in Review en analyses over wereldwijd botverkeer.
Cloudflare — onderzoeken naar AI crawlers versus referrals.
Cloudflare — publicaties over AI crawling, content freshness en redundant crawling, 2026.
Cloudflare — AI Crawl Control en Pay Per Crawl-documentatie.
Fastly — Threat Insights Report en analyses van AI bot- en crawlerverkeer.
Eigen webserveranalyse — crawlerverkeer gedurende twee dagen, september 2026. Crawlerfamilies herkend zonder voor iedere request een geverifieerde identiteit.

Reacties
Een reactie posten