AI-bedrijven gebruiken verschillende bots voor verschillende doelen, en je regelt ze per naam in robots.txt. Grofweg zijn er drie soorten: bots die tekst verzamelen voor het trainen van modellen (GPTBot, ClaudeBot, en de tokens Google-Extended en Applebot-Extended), bots die een zoekindex bouwen voor AI-antwoorden (OAI-SearchBot, Claude-SearchBot, PerplexityBot, en Bingbot en Googlebot voor de zoekmachines zelf) en bots die een pagina ophalen omdat een gebruiker erom vraagt (ChatGPT-User, Claude-User, Perplexity-User). Wil je in AI-antwoorden genoemd worden, laat dan de zoekbots toe. Training kun je volgens de documentatie van OpenAI, Anthropic, Google en Apple apart uitzetten zonder dat je zichtbaarheid in hun zoekfuncties verandert.
Crawlertoegang is het eerste wat we controleren bij technische SEO en bij elk traject als GEO-bureau: een assistent die je site niet mag lezen, kan je niet citeren.
1. Alle AI-bots en wat blokkeren doet
Alleen wat de aanbieders zelf documenteren. Waar ze iets niet zeggen, staat dat erbij.
| User agent | Waarvoor | Wat blokkeren doet |
|---|---|---|
| OAI-SearchBot (OpenAI) | Websites tonen in de zoekfuncties van ChatGPT. | Je site wordt niet getoond in zoekantwoorden van ChatGPT. |
| GPTBot (OpenAI) | Generatieve basismodellen nuttiger en veiliger maken. | Signaal dat je content niet gebruikt mag worden voor training. |
| ChatGPT-User (OpenAI) | Bepaalde acties van gebruikers in ChatGPT en Custom GPTs. | OpenAI: omdat een gebruiker de actie start, gelden robots.txt-regels mogelijk niet. |
| OAI-AdsBot (OpenAI) | Veiligheid controleren van pagina's die als advertentie in ChatGPT zijn ingediend. | Niet gedocumenteerd. |
| ClaudeBot (Anthropic) | Webcontent verzamelen die kan bijdragen aan training van de modellen. | Toekomstig materiaal van je site wordt uitgesloten van trainingsdata. |
| Claude-SearchBot (Anthropic) | Content analyseren om zoekantwoorden relevanter en juister te maken. | Je content wordt niet geïndexeerd voor zoeken; volgens Anthropic kan je zichtbaarheid in zoekantwoorden dalen. |
| Claude-User (Anthropic) | Pagina's ophalen als een gebruiker Claude een vraag stelt. | Claude haalt je content niet op bij een vraag van een gebruiker; zichtbaarheid kan dalen. |
| PerplexityBot | Websites tonen en linken in de zoekresultaten van Perplexity; volgens Perplexity niet voor training van basismodellen. | Je site verschijnt niet in de zoekresultaten van Perplexity. |
| Perplexity-User | Pagina's bezoeken bij een vraag van een gebruiker. | Perplexity: deze fetcher negeert robots.txt over het algemeen, omdat een gebruiker erom vroeg. |
| Google-Extended | Geen eigen crawler maar een token. Regelt of content gebruikt mag worden voor training van Gemini en voor grounding in Gemini Apps en Vertex AI. | Geen effect op opname in Google Zoeken of op ranking, volgens Google. |
| Applebot-Extended | Geen crawler maar een extra controle over hoe Apple je content gebruikt, onder meer voor het trainen van Apple-modellen. | Je pagina's kunnen nog steeds in de zoekresultaten van Apple verschijnen. |
| Bingbot (Microsoft) | De standaardcrawler van Bing. Bing noemt geen aparte AI-crawler. | Bing haalt je pagina's niet meer op. Voor de AI-chat van Bing werkt Bing met de meta-tags NOCACHE en NOARCHIVE (zie hieronder). |
Bronnen: OpenAI, Anthropic, Perplexity, Google, Apple, Bing. Geraadpleegd op 2 oktober 2026; aanbieders passen deze pagina's regelmatig aan.
2. Google: Google-Extended raakt AI Overviews niet
Een veelgemaakte fout is denken dat je met Google-Extended uit AI Overviews blijft. Volgens de documentatie van Google heeft Google-Extended geen eigen user-agent-string: het crawlen gebeurt met de bestaande Google-crawlers, en het token in robots.txt werkt alleen als controle. Het heeft geen invloed op opname in Google Zoeken en is geen rankingsignaal.
AI Overviews en AI Mode horen bij Google Zoeken. Wil je beperken wat daar van je pagina getoond wordt, dan verwijst Google in de documentatie over AI-functies naar de bestaande instellingen: nosnippet, data-nosnippet, max-snippet of noindex. Die gelden ook voor de gewone zoekresultaten, dus gebruik ze alleen als je dat bewust wilt.
3. Bots die een gebruiker stuurt
ChatGPT-User, Claude-User en Perplexity-User halen een pagina op omdat iemand daar in een gesprek om vraagt. De aanbieders zijn hier niet eenduidig. OpenAI schrijft dat robots.txt-regels mogelijk niet gelden. Perplexity schrijft dat Perplexity-User robots.txt over het algemeen negeert. Anthropic schrijft dat zijn bots de gangbare robots.txt-regels volgen en ondersteunt ook Crawl-delay. Wil je zulke verzoeken echt tegenhouden, dan kan dat alleen op serverniveau; OpenAI en Perplexity publiceren daarvoor hun IP-reeksen als JSON-bestanden.
4. Bing en Copilot
Bing noemt vijf crawlers: Bingbot, AdIdxBot, BingPreview, MicrosoftPreview en BingVideoPreview. Een aparte AI-crawler staat er niet tussen. Voor de AI-chat introduceerde Bing in 2023 twee meta-tags, toen de chat nog Bing Chat heette. Met NOCACHE kan je content in chatantwoorden komen, maar toont Bing alleen URL, titel en snippet. Met NOARCHIVE komt je content niet in chatantwoorden en wordt er niet naar gelinkt. In beide gevallen blijf je in de gewone zoekresultaten van Bing. Of dit één op één geldt voor de huidige Copilot, staat niet in die aankondiging.
5. Wat robots.txt niet kan
- Het is een verzoek, geen slot. Google schrijft in de uitleg over robots.txt dat de regels gedrag niet kunnen afdwingen en dat het aan de crawler is om ze te volgen.
- Een geblokkeerde URL kan toch in de index komen. Ook volgens Google: een pagina die in robots.txt is uitgesloten, kan geïndexeerd worden als andere sites ernaar linken. Gebruik
noindexom een pagina uit Google te houden. - Het werkt niet met terugwerkende kracht. Anthropic spreekt over het uitsluiten van toekomstig materiaal; wat al verzameld is, valt daar niet onder.
- Het kost tijd. OpenAI en Perplexity noemen allebei ongeveer 24 uur voordat een wijziging in robots.txt is verwerkt.
6. Een voorbeeld-robots.txt
Dit voorbeeld laat de zoekbots en de bots van gebruikers toe en zet training uit. Elke regel staat los: OpenAI en Perplexity schrijven allebei dat elke instelling onafhankelijk werkt.
# Zoeken in AI-assistenten: toestaan
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: ChatGPT-User
User-agent: Claude-User
Allow: /
# Training van modellen: uitzetten
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /
# Alle andere crawlers, waaronder Googlebot en Bingbot
User-agent: *
Allow: /
Disallow: /admin/
Sitemap: https://www.jouwdomein.nl/sitemap.xml
Meerdere User-agent-regels boven één groep regels is toegestaan volgens RFC 9309, de standaard voor robots.txt. Let op: een crawler die een groep met zijn eigen naam vindt, volgt die groep; de groep met * is alleen de terugval als er geen eigen groep is. Staat GPTBot in een eigen groep, dan gelden de regels onder User-agent: * niet meer voor GPTBot. Herhaal dus je algemene uitsluitingen in elke groep.
Hoe wij het doen
Onze eigen robots.txt is kort: User-agent: * met Allow: /, een paar uitgesloten mappen voor klantomgevingen en de sitemap. We laten dus ook de trainingsbots toe. Dat is een keuze: voor een bureau dat gevonden wil worden, weegt het mee dat modellen ons kennen. Voor een uitgever met betaalde content kan de afweging anders uitvallen.
7. Controleren of het werkt
- Open
/robots.txtop je domein en kijk of er geen bredeDisallow: /onderUser-agent: *staat. - Controleer ook de firewall of het CDN: een blokkade daar staat niet in robots.txt, maar houdt een bot net zo goed tegen.
- Kijk in je serverlogs welke user agents langskomen en vergelijk de IP-adressen met de gepubliceerde reeksen van de aanbieder; een user-agent-string is makkelijk na te maken.
- Kijk of je belangrijkste tekst in de HTML staat en niet pas na JavaScript verschijnt.
Is de toegang goed, dan helpt een llms.txt een agent de juiste pagina's te vinden; je maakt er een met de llms.txt-generator. Wat er daarna nodig is om ook echt genoemd te worden, lees je op GEO-bureau en in de gids over structured data voor AI. Liever dat wij je robots.txt, firewall en logs nalopen: dat doen we binnen technische SEO.
8. Veelgestelde vragen
Moet ik GPTBot blokkeren?
Dat hangt af van of je wilt dat je content gebruikt wordt voor het trainen van OpenAI-modellen. Volgens OpenAI staat elke instelling los: je kunt GPTBot blokkeren en OAI-SearchBot toelaten, zodat je wel in de zoekantwoorden van ChatGPT kunt verschijnen.
Blijf ik met Google-Extended uit AI Overviews?
Nee. Volgens Google heeft Google-Extended geen invloed op opname in Google Zoeken. Om te beperken wat Google in zoekresultaten en AI-functies van je pagina toont, verwijst Google naar nosnippet, data-nosnippet, max-snippet en noindex.
Wat is het verschil tussen GPTBot en OAI-SearchBot?
GPTBot verzamelt content voor het trainen van de basismodellen van OpenAI. OAI-SearchBot zorgt dat websites in de zoekfuncties van ChatGPT getoond worden. Blokkeer je OAI-SearchBot, dan verschijnt je site niet in de zoekantwoorden van ChatGPT.
Volgen alle AI-bots robots.txt?
Niet altijd. OpenAI schrijft dat robots.txt-regels mogelijk niet gelden voor ChatGPT-User, en Perplexity schrijft dat Perplexity-User robots.txt over het algemeen negeert, omdat een gebruiker om de pagina vroeg. Anthropic schrijft dat zijn bots robots.txt volgen.
Hoe lang duurt het voordat een wijziging in robots.txt werkt?
OpenAI en Perplexity noemen allebei ongeveer 24 uur voordat hun systemen een wijziging verwerken. Voor de andere aanbieders is dat niet gedocumenteerd.