Concept, nog niet gepubliceerd

Blokkeert je website ChatGPT zonder dat je het weet?

het geobureauLeestijd ongeveer 4 minuten

Je kunt een uitstekende website hebben en toch nooit in een antwoord van ChatGPT of Perplexity verschijnen. De oorzaak zit dan vaak in een klein tekstbestand dat bijna niemand ooit opent: robots.txt. Eén regel daarin volstaat om een AI-dienst de toegang tot je hele site te ontzeggen. Hieronder lees je hoe dat werkt, welke crawlers er zijn en welke keuze je bewust maakt.

Wat robots.txt doet

Robots.txt is een bestand met instructies voor crawlers, de programma's die websites automatisch lezen. Volgens de officiële standaard RFC 9309 moet het bestand exact robots.txt heten en in de hoofdmap van je domein staan. Je vindt het dus op jouwdomein.be/robots.txt.

In het bestand staat per crawler, aangeduid met "User-agent", welke delen van de site hij mag lezen. Een regel "Disallow: /" betekent: niets. Google benadrukt in zijn inleiding op robots.txt twee beperkingen. Het bestand is bedoeld om het verkeer van crawlers te sturen en houdt een pagina niet uit de zoekresultaten. Bovendien volgen respectabele crawlers de instructies, terwijl andere crawlers dat mogelijk niet doen. Robots.txt werkt dus als een afspraak die crawlers vrijwillig volgen.

De bekende AI-crawlers

De grote AI-bedrijven gebruiken meestal meerdere crawlers, elk met een eigen doel. Het onderscheid tussen training en zoeken is voor een kmo het belangrijkste.

OpenAI beschrijft in zijn overzicht van crawlers drie namen:

  • GPTBot verzamelt inhoud voor het trainen van modellen. Blokkeer je hem, dan geef je aan dat je inhoud niet voor training gebruikt mag worden.
  • OAI-SearchBot leest sites om ze te tonen in de zoekantwoorden van ChatGPT. Volgens OpenAI verschijnen sites die hem blokkeren niet in die antwoorden.
  • ChatGPT-User haalt een pagina op wanneer een gebruiker daarom vraagt. OpenAI schrijft dat robots.txt hier mogelijk niet geldt, omdat de actie van een gebruiker komt.

Perplexity heeft volgens zijn documentatie over crawlers twee namen:

  • PerplexityBot zoekt en linkt websites in de zoekresultaten van Perplexity en wordt volgens het bedrijf niet gebruikt om modellen te trainen. Hij respecteert robots.txt.
  • Perplexity-User bezoekt pagina's wanneer een gebruiker een vraag stelt en negeert robots.txt volgens Perplexity doorgaans, omdat een gebruiker de opdracht gaf.

Anthropic, het bedrijf achter Claude, beschrijft in zijn helpartikel over crawlers drie namen:

  • ClaudeBot verzamelt inhoud die kan bijdragen aan de training van modellen.
  • Claude-SearchBot leest inhoud om de zoekresultaten van Claude te verbeteren. Blokkeren kan je zichtbaarheid in die resultaten verminderen.
  • Claude-User haalt pagina's op wanneer een gebruiker Claude iets vraagt.

Google werkt met een aparte naam: Google-Extended. Volgens de lijst van Google-crawlers bepaal je daarmee of inhoud die Google crawlt gebruikt mag worden voor het trainen van toekomstige Gemini-modellen. Google schrijft uitdrukkelijk dat Google-Extended geen invloed heeft op je opname in Google Search en geen rankingsignaal is. Of je in AI Overviews verschijnt, hangt volgens de uitleg van Google over AI-functies af van de gewone indexering: je pagina moet in Google Search staan en met een fragment kunnen verschijnen.

Wat blokkeren betekent

De gevolgen verschillen sterk per crawler:

  • Blokkeer je een trainingscrawler zoals GPTBot, ClaudeBot of Google-Extended, dan vraag je dat je inhoud niet in toekomstige modellen terechtkomt. Volgens de documentatie van die bedrijven staat dat los van je zichtbaarheid in hun zoekfuncties.
  • Blokkeer je een zoekcrawler zoals OAI-SearchBot, PerplexityBot of Claude-SearchBot, dan verdwijn je grotendeels uit de antwoorden van die dienst.
  • Een algemene regel "User-agent: *" met "Disallow: /" blokkeert alle crawlers die zich eraan houden, ook Googlebot.

Dat laatste komt voor op sites die nog in ontwikkeling waren en waarvan de blokkering na de lancering is blijven staan. Soms voegt een plug-in of een beveiligingsdienst automatisch regels toe. Ook een firewall kan AI-crawlers weren zonder dat er iets in robots.txt staat, waardoor een nazicht van het bestand alleen niet altijd volstaat.

Wat je bewust kiest

Voor de meeste kmo's is de logische keuze: zoekcrawlers toelaten, omdat je gevonden wilt worden door wie via ChatGPT of Perplexity naar een leverancier zoekt. Over trainingscrawlers kun je verschillend denken. Wie unieke inhoud publiceert waar het verdienmodel op steunt, zoals een uitgever of een opleider, kan die weren. Voor een installateur, een advocatenkantoor of een groothandel weegt dat argument meestal minder zwaar.

Een robots.txt die zoekcrawlers toelaat en training weigert, ziet er zo uit:

``` User-agent: OAI-SearchBot Allow: /

User-agent: PerplexityBot Allow: /

User-agent: Claude-SearchBot Allow: /

User-agent: GPTBot Disallow: /

User-agent: ClaudeBot Disallow: /

User-agent: Google-Extended Disallow: / ```

Belangrijker dan de exacte keuze is dat je ze zelf maakt en noteert, zodat een volgende webbouwer ze niet ongemerkt ongedaan maakt. Wij bekijken dit bestand bij elke analyse, samen met de firewallinstellingen, voor kmo's uit Gent en de rest van Vlaanderen.

Wat je nu kunt doen

  • Open jouwdomein.be/robots.txt en zoek naar de namen uit dit artikel en naar "Disallow: /".
  • Vraag je webbouwer of hostingpartij of er een firewall of beveiligingsdienst is die bots weert. Vraag ook of AI-crawlers daaronder vallen.
  • Beslis per type crawler, zoeken of training, wat je wilt toelaten en leg die keuze vast.

Laat ons dit nakijken in de gratis AI-analyse. Wordt je website binnenkort vernieuwd, geef dan ook ons zusterbureau hetdesignbureau.be deze afspraken mee.