Robots.txt: wat het is, wat je ermee kan en hoe het eruitziet in het AI-tijdperk

29 juli 2026  ·  leestijd 9 minuten  ·  door Louise Snel

Bospad als metafoor voor toegang van zoekmachines en AI-crawlers via robots.txt

De robots.txt in het kort

Robots.txt is een simpel tekstbestand in de hoofdmap van je website waarmee je crawlers vertelt wat ze wel en niet mogen bezoeken. Jarenlang was het vooral een dingetje voor zoekmachines. Nu AI-bots als GPTBot, OAI-SearchBot en ClaudeBot dagelijks websites scannen, is het uitgegroeid tot de plek waar je bepaalt hoe jouw content in AI-systemen terechtkomt. In dit artikel lees je hoe het bestand werkt, welke AI-bots er anno 2026 aankloppen en hoe een doordachte robots.txt er nu uitziet, met voorbeelden die je direct kunt overnemen.

Wat is een robots.txt?

Een robots.txt is een gewoon tekstbestand dat op een vaste plek staat: in de hoofdmap van je domein, dus bijvoorbeeld op jouwdomein.nl/robots.txt. Elke nette bot die je website wil bezoeken, van Googlebot tot GPTBot, haalt eerst dit bestand op om te kijken wat er mag. Zie het als het bordje bij de ingang van een winkel: hier ben je welkom, daar niet.

Het bestand bestaat al sinds 1994 en het protocol erachter (het Robots Exclusion Protocol) is inmiddels een officiële internetstandaard. Iedere website heeft er baat bij, en vrijwel elk CMS genereert er automatisch één. WordPress bijvoorbeeld maakt standaard een minimale variant aan die alleen de admin-omgeving afschermt. Grote kans dus dat jouw site er al een heeft zonder dat je er ooit naar hebt omgekeken. Juist daarom loont het om er nu wél naar te kijken, want de bezoekers die dit bestand lezen, zijn de afgelopen jaren flink veranderd.

Wat kan je met de robots.txt (en wat niet)

Met robots.txt bepaal je per bot welke delen van je site gecrawld mogen worden. Je kunt er drie dingen goed mee: bots weghouden bij delen van je site die niet publiek relevant zijn (denk aan admin-pagina’s, interne zoekresultaten of filterpagina’s), specifieke bots volledig weren of juist toelaten, en de weg wijzen naar je sitemap zodat crawlers je site efficiënt kunnen doorlopen.

Net zo belangrijk is wat robots.txt níet is. Het is geen beveiliging: het bestand is een vriendelijk verzoek, geen slot op de deur. Nette bots houden zich eraan, kwaadwillende scrapers negeren het gewoon. Gevoelige informatie hoort dus achter een login, niet achter een Disallow-regel. Het is ook geen manier om pagina’s uit Google te halen. Een geblokkeerde pagina kan alsnog in de zoekresultaten verschijnen als er links naartoe wijzen, alleen dan zonder beschrijving. Wil je een pagina echt uit de index houden, gebruik dan een noindex-tag.

De bouwstenen van een robots.txt-bestand

Een robots.txt bestaat uit blokjes met steeds dezelfde opbouw. Elke regel begint met een sleutelwoord, gevolgd door een dubbele punt en een waarde. Dit zijn de vier die je moet kennen:

Regel Wat doet het?
User-agent Voor welke bot gelden de regels die eronder staan. Een sterretje (*) betekent: voor alle bots zonder eigen blok.
Disallow Welk pad de bot niet mag bezoeken. Disallow: / blokkeert de hele site, een lege waarde blokkeert niets.
Allow Een uitzondering op een Disallow, om binnen een geblokkeerde map toch iets toe te staan.
Sitemap De volledige URL van je XML-sitemap, zodat crawlers al je pagina’s kunnen vinden.

Zo ziet de standaard robots.txt van een WordPress-site eruit:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://jouwdomein.nl/sitemap_index.xml

Vertaald: alle bots zijn welkom op de hele site, behalve in de admin-omgeving, met één technische uitzondering daarbinnen. En de sitemap staat op deze plek. Prima basis, en tot een paar jaar geleden was je hiermee gewoon klaar.

Jouw nieuwe bezoekers: AI-bots

Sinds de opkomst van AI-assistenten wordt je robots.txt door een heel nieuw gezelschap gelezen. Die bots hebben verschillende doelen, en dat onderscheid is belangrijk voor de keuzes die je zo gaat maken. Grofweg zijn er drie soorten.

Trainingsbots verzamelen content waarmee AI-modellen getraind worden. Wat zij ophalen, kan later in de basiskennis van een model terechtkomen. Zoekbots vullen de zoekindex waaruit AI-assistenten live citeren, vergelijkbaar met wat Googlebot voor Google doet. Gebruikersbots halen een specifieke pagina op wanneer een gebruiker daar in een chat om vraagt. Dit zijn de bekendste namen per categorie:

Bot

Van

Soort

GPTBot OpenAI (ChatGPT) Training
ClaudeBot Anthropic (Claude) Training
Google-Extended Google (Gemini) Training
Applebot-Extended Apple Training
Meta-ExternalAgent Meta Training
CCBot Common Crawl Training (dataset voor veel partijen)
OAI-SearchBot OpenAI (ChatGPT search) Zoeken
Claude-SearchBot Anthropic Zoeken
PerplexityBot Perplexity Zoeken
ChatGPT-User OpenAI Gebruikersactie
Perplexity-User Perplexity Gebruikersactie

Belangrijk

Google-Extended en Applebot-Extended zijn geen aparte crawlers maar instellingen. Blokkeer je ze, dan blijft je site gewoon vindbaar in Google en Spotlight, alleen wordt je content niet meer gebruikt voor het trainen van hun AI-modellen. Je normale SEO raakt dit dus niet.

Hoe ziet een ideale robots.txt er nu uit?

Dé ideale robots.txt bestaat niet, want het hangt af van wat je wilt. De kernvraag is: wil je vindbaar zijn in AI-assistenten, wil je je content beschermen tegen modeltraining, of allebei een beetje? Voor de meeste bedrijven die klanten via AI willen aantrekken, is dit de logische opzet:

Variant 1: maximaal vindbaar (onze aanrader voor de meeste merken)

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

# AI-zoekbots expliciet welkom
User-agent: OAI-SearchBot
Disallow:

User-agent: PerplexityBot
Disallow:

Sitemap: https://jouwdomein.nl/sitemap_index.xml

Strikt genomen zijn de expliciete AI-blokken hier overbodig, want alles wat niet genoemd wordt, valt al onder het sterretje. Maar expliciet welkom heten heeft een voordeel: het kan nooit per ongeluk stukgaan wanneer iemand later een strengere sterretjes-regel toevoegt, en het maakt je intentie helder voor iedereen die het bestand leest.

Variant 2: wel vindbaar in AI-zoekresultaten, niet meetrainen

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

# Zoekbots welkom
User-agent: OAI-SearchBot
Disallow:

User-agent: PerplexityBot
Disallow:

# Trainingsbots niet
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

Sitemap: https://jouwdomein.nl/sitemap_index.xml

Deze variant zie je veel bij uitgevers en mediabedrijven: wél geciteerd worden in live antwoorden, niet gratis bijdragen aan modeltraining. Voor content-gedreven bedrijven een verdedigbare keuze. Weeg wel mee dat een model dat jouw merk niet uit training kent, je ook minder snel spontaan zal noemen in antwoorden zonder live zoekopdracht. Vindbaarheid en bescherming zijn hier echt communicerende vaten.

Wat je vrijwel nooit wilt: alle AI-bots blokkeren. Daarmee verdwijn je uit ChatGPT search en vergelijkbare kanalen, terwijl juist daar een groeiend deel van de oriëntatie van jouw doelgroep plaatsvindt. Hoe die vindbaarheid precies werkt, lees je in ons artikel over vindbaar worden in ChatGPT.

Zo check je je eigen robots.txt

Checken kan gewoon in je browser: typ je domein gevolgd door /robots.txt. Liever via de terminal (Terminal op Mac, PowerShell op Windows), zodat je meteen ziet wat een bot precies terugkrijgt:

# Mac / Linux
curl https://jouwdomein.nl/robots.txt

# Windows (PowerShell)
curl.exe https://jouwdomein.nl/robots.txt

Let bij het lezen op drie dingen. Eén: krijg je überhaupt een tekstbestand terug, en geen foutmelding of HTML-pagina? Twee: staat er nergens per ongeluk Disallow: / onder een bot die je juist wilt toelaten? Drie: staat je sitemap-regel erin en klopt die URL?

Vergeet daarna niet dat robots.txt maar de helft van het verhaal is. Je firewall of bot-protection kan een bot alsnog blokkeren, ook als je robots.txt alles toestaat. Hoe je dat test met een user-agent-check, staat stap voor stap in het ChatGPT-artikel, inclusief de exacte commando’s.

En llms.txt dan?

Misschien ben je de term llms.txt al tegengekomen: een voorstel voor een apart bestand waarin je AI-systemen in begrijpelijke taal vertelt waar je belangrijkste content staat, een soort sitemap voor taalmodellen. Het idee is sympathiek, maar het is vooralsnog geen standaard: de grote AI-partijen hebben niet toegezegd het bestand actief te gebruiken. Ons advies is daarom nuchter: het toevoegen kost weinig en kan geen kwaad, maar verwacht er geen meetbaar effect van. Je robots.txt, je content en je autoriteit doen het echte werk. Wil je precies weten wat er in zo’n bestand hoort en voor wie het wél zinvol is? Lees dan ons artikel llms.txt: hype of handig? met daarin ook wat er minimaal in het bestand moet staan.

Klein bestand; grote gevolgen

Robots.txt is een klein bestand met grote gevolgen. Vijf minuten aandacht bepaalt of jouw content straks vindbaar is in de kanalen waar je doelgroep steeds vaker zoekt, en onder welke voorwaarden AI-partijen je content mogen gebruiken. Check dus vandaag nog wat er in dat bestand van jou staat. De kans is groot dat er sinds de lancering van je site niemand meer naar heeft gekeken, terwijl het rijtje bots dat het leest intussen drie keer zo lang is geworden.

FAQ: Veelgestelde vragen over over robots.txt

Klik op één van de meest gestelde vragen over de Robots.txt en lees direct het antwoord.

Waar vind ik mijn robots.txt?

Op de hoofdmap van je domein: jouwdomein.nl/robots.txt. Bij WordPress kun je het bestand meestal aanpassen via je SEO-plugin, bijvoorbeeld via Yoast (Extra, Bestandsbewerker) of Rank Math. Staat er fysiek een robots.txt-bestand op je server, dan gaat dat bestand voor.

Houden alle bots zich aan robots.txt?

Nee. De grote partijen zoals OpenAI, Anthropic, Google en Apple respecteren het bestand volgens hun eigen documentatie. Agressieve scrapers en sommige kleinere bots trekken zich er niets van aan. Wil je die echt weren, dan heb je server- of firewall-regels nodig.

Schaadt het blokkeren van AI-trainingsbots mijn Google-ranking?

Nee. Trainingsbots als GPTBot en Google-Extended staan volledig los van de crawlers die zoekresultaten vullen. Je kunt ze blokkeren zonder je SEO te raken. Blokkeer alleen nooit Googlebot zelf, en voor vindbaarheid in ChatGPT search laat je OAI-SearchBot toe.

Hoe snel werkt een aanpassing?

Bots halen je robots.txt regelmatig opnieuw op. OpenAI geeft aan wijzigingen binnen ongeveer 24 uur te verwerken, bij andere partijen kan het iets langer duren. Reken op een paar dagen voordat elke bot je nieuwe regels volgt.

Dit interesseert je misschien ook