ZichtbaarheidsbasisWelke AI-crawlers laat je toe, en wat kost blokkeren je?

Mijn advies is: laat ze allemaal toe. Niet omdat het niet uitmaakt, maar omdat blokkeren je minder oplevert dan je denkt en meer kost dan je denkt. Hieronder staat waarom, wat de alternatieven zijn, en een robots.txt die je kunt kopiëren.

Die keuze gaat pas leven als je weet wat die robots eigenlijk doen, en dat begint bij hoe een AI-antwoord tot stand komt. AI-zoekmachines zoeken eerst en schrijven daarna. Sta je niet in die index, dan sta je ook niet in het antwoord.

Wat gebeurt er tussen vraag en antwoord?

Grofweg drie stappen. Het model verzint het antwoord niet uit zichzelf; het krijgt materiaal aangereikt en vat dat samen.

  • Ophalen. Je vraag wordt omgezet in een of meer zoekopdrachten in een zoekindex. Soms de eigen index van de aanbieder, soms die van een zoekmachine.
  • Onderbouwen. De gevonden pagina's worden in stukken geknipt en de meest relevante stukken gaan mee als context. Dit heet grounding.
  • Schrijven. Het model formuleert een antwoord op basis van die stukken en zet er verwijzingen bij.

De praktische les zit in stap twee: er wordt geciteerd op het niveau van tekstfragmenten, niet van pagina's. Je concurreert dus niet met je hele artikel, maar met de alinea die het beste antwoord geeft.

Waarom gewone SEO nog steeds het meeste uitmaakt

Omdat stap één een zoekopdracht is. Wat er in stap twee en drie gebeurt, kan alleen met bronnen die in stap één naar boven zijn gekomen.

Daarmee is de rangorde van je inspanningen vrij duidelijk. Zorg eerst dat je vindbaar bent in gewone zoekmachines. Zorg daarna dat je tekst makkelijk te citeren is. Dat is een andere volgorde dan veel aanbieders op dit moment verkopen.

Ik ken geen enkele aanbieder die publiek heeft gedocumenteerd hoe bronnen precies worden gekozen. Iedereen die je een exact recept geeft, vult het gat met een aanname. Dat mag, zolang het er eerlijk bij staat.

Waarom je site zonder JavaScript moet werken

Voor zover bekend voeren de meeste crawlers van AI-aanbieders weinig tot geen JavaScript uit. Wat pas na het laden door een script op de pagina wordt gezet, bestaat voor hen dan niet.

Ik moet daar eerlijk bij zeggen dat geen enkele aanbieder publiceert hoe ver hun crawler hierin gaat. Behandel het dus als een aanname, niet als een feit. Het mooie is dat je er ook niet op hoeft te vertrouwen: je kunt het zelf controleren. Zet JavaScript uit in je browser en laad je belangrijkste pagina opnieuw. Wat je dan niet ziet, is precies het deel waarvan je niet zeker weet of het meetelt.

Deze website gebruikt bewust geen enkele regel JavaScript in de browser. Alles staat gewoon in de HTML.

Drie keuzes, en welke ik zou maken

Er zijn drie samenhangende posities. Ze verschillen niet in techniek maar in wat je ermee wint en verliest.

  • Open. Zoeken, ophalen op verzoek van een gebruiker én training toestaan. Maximale kans om genoemd en geciteerd te worden.
  • Zoeken ja, training nee. De zoekindexen en de ophalers toelaten, de trainingscrawlers weigeren. AI kan je tekst nog steeds live aanhalen, maar hij wordt niet in een model verwerkt.
  • Dicht voor AI. Alles weigeren wat AI heet.

Ik zou open kiezen, ook als je product zelf content is. Dat is een inschatting in een onzekere tijd, geen vaststaand feit, dus hier is de redenering zodat je er zelf iets van kunt vinden.

Naar mijn idee wordt je content toch wel opgehaald, of je het beschermt of niet. Als dat klopt, dan is de vraag niet of het gebeurt maar wat je er nog uit haalt zolang het kan. En er zit een concurrentiekant aan die zwaarder weegt dan de principiële: blokkeer jij terwijl je concurrent dat niet doet, dan wordt hij genoemd en jij niet. Hij bouwt bekendheid op in precies het kanaal waar jij je uit hebt teruggetrokken.

Zoeken ja en training nee is verdedigbaar. Het is ook de optie waarbij je het meeste moet uitleggen aan jezelf, want je weigert iets waarvan je niet kunt controleren of het geweigerd wordt, en je levert wel iets in.

Dicht voor AI zou ik niemand aanraden die gevonden wil worden. Dan zeg je nee tegen de zoekindexen van ChatGPT, Perplexity en Claude, en dat zijn de plekken waar steeds meer mensen hun vraag beginnen.

Een robots.txt die je kunt kopiëren

Voor de open keuze is het kort. Dit is in de kern wat er op deze website staat.

# Iedere crawler is welkom.
User-agent: *
Allow: /

Sitemap: https://jouwdomein.nl/sitemap.xml

Wil je toch zoeken ja en training nee, dan zet je de trainingscrawlers apart. Een robot die zijn eigen groep heeft, negeert de groep met de asterisk, dus de volgorde hieronder klopt.

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: *
Allow: /

Sitemap: https://jouwdomein.nl/sitemap.xml

Twee dingen die hierbij misgaan. Blokkeer nooit Googlebot, want dan verdwijn je uit Google en daarmee ook uit AI Overviews. En Google-Extended is helemaal geen crawler: er komt niets langs onder die naam. Het is een schakelaar voor wat Google mag doen met pagina's die Googlebot al heeft opgehaald. Dat maakt hem niet minder nuttig, maar wel iets anders dan de rest van dit lijstje.

Welke robot wat doet staat in de tabel op de zichtbaarheidsbasis, met de documentatie van elke aanbieder erbij.

robots.txt is een signaal, geen muur

Dit is het deel dat het vaakst wordt overgeslagen. robots.txt is een verzoek. Nette crawlers houden zich eraan, andere niet, en je hebt geen enkele manier om het te handhaven.

Dat is geen vermoeden. Cloudflare heeft het getest en gepubliceerd. Ze zetten nieuwe, ongepubliceerde testdomeinen op met een robots.txt die alle geautomatiseerde toegang verbood, en stelden Perplexity daarna vragen over die domeinen. Wat ze vonden: naast de aangekondigde Perplexity-User ook een niet-aangekondigde crawler met een gewone Chrome-op-macOS-identiteit, via IP-adressen buiten hun eigen officiële reeksen. Volgens Cloudflare ging het om tienduizenden domeinen en miljoenen verzoeken per dag.

Cloudflare zegt er zelf over dat robots.txt "website directives and preferences" uitdrukt, dus voorkeuren en geen bindende regels.

Bij sommige robots werkt het per definitie niet. ChatGPT-User haalt een pagina op omdat een gebruiker daar op dat moment om vraagt, en dat soort verzoeken vallen niet betrouwbaar onder je robots-regels.

Wat betekent dat voor je keuze? Als blokkeren deels een signaal is en niet deels maar geheel afhankelijk van de goede wil van de ander, dan koop je er minder bescherming mee dan de moeite suggereert. Wil je iets echt dichthouden, dan hoort het achter een login of het hoort er niet te staan. Daar is robots.txt het verkeerde gereedschap voor.

Bron: Cloudflare over niet-aangekondigde crawlers, 4 augustus 2025.

Je kunt niet uit AI Overviews stappen

Niet via robots.txt. Dit is de misvatting die het meeste geld kost, omdat mensen ervoor gaan zitten en er niets van terugkomt.

AI Overviews zijn gebouwd op de gewone zoekindex van Google. Die wordt gevuld door Googlebot. Wil je uit AI Overviews, dan zou je Googlebot moeten weigeren, en dan verdwijn je ook uit de normale zoekresultaten. Dat is geen ruil die iemand wil maken.

Google-Extended blokkeren helpt hier niet: dat gaat over Gemini, niet over AI Overviews. Google schrijft het zelf op: "Google-Extended does not impact a site's inclusion in Google Search nor is it used as a ranking signal in Google Search."

De enige echte schakelaars zijn nosnippet en max-snippet, en die snijden in hetzelfde vlees: ze verkleinen of verwijderen ook je gewone zoekfragment. Je ruilt dan zichtbaarheid in de zoekresultaten in voor iets minder tekst in een AI-antwoord. Voor vrijwel iedereen is dat een slechte ruil.

Bron: Google over zijn crawlers.

Makkelijk op te halen zijn helpt je

De andere kant van dezelfde keuze. Als je besluit de deur open te zetten, zorg dan dat er iets te halen valt dat op zichzelf staat.

Er wordt geciteerd per tekstfragment, niet per pagina. Een alinea die los te begrijpen is, wordt gebruikt. Een alinea waarin het antwoord pas in de vierde zin staat, niet. Dat is dezelfde regel als in de basis: antwoord vooraan, één bewering per alinea, met het bewijs in diezelfde alinea.

Je zult dit verkocht zien worden als extractability. Het idee eronder is juist en het is niet nieuw. Wees wel voorzichtig met de cijfers die eraan hangen. Ik vond voor die term uitsluitend bureaus, toolaanbieders en glossarysites als bron, geen documentatie van een aanbieder en geen onafhankelijk onderzoek. Er circuleert bijvoorbeeld een citatiepercentage voor de ene schrijfstijl tegen de andere, zonder dat er een controleerbare meting bij staat.

Dat maakt het advies niet fout. Het maakt de precisie verdacht. Doe het omdat het logisch is en omdat het je tekst ook voor mensen beter maakt, niet omdat er een percentage bij staat.

Wat doe je hiermee?

Vier dingen, in deze volgorde.

  • Kijk wat er nu in je robots.txt staat. Vaak staat daar iets wat iemand jaren geleden heeft neergezet en niemand meer begrijpt.
  • Maak een keuze uit de drie posities en schrijf op waarom. Als je het niet kunt uitleggen, is het geen keuze maar een instelling.
  • Zet het antwoord vooraan onder elke kop, zodat één fragment op zichzelf te begrijpen is.
  • Blijf bouwen aan gewone vindbaarheid. Daar bereik je nog steeds het meeste mee.

Dit artikel hoort bij de online zichtbaarheidsbasis, waarin de hele basis op een rij staat. Wil je dat niet zelf doen, dan is het onderdeel van wat ik doe bij SEO en AI-vindbaarheid.

Eén kanttekening die in de hele reeks terugkomt: vindbaarheid is één onderdeel van een marketingstrategie, niet het geheel.

Weet je niet wat er in je robots.txt staat?

Stuur me je website. Ik kijk welke robots er binnenkomen, wat dat je oplevert en wat het je kost.

Dominique@framvekst.no

Je krijgt binnen drie werkdagen een reactie.

Bekijk mijn contactgegevens