Concept, nog niet gepubliceerd

Wat is llms.txt en heeft je site er een nodig?

het geobureauLeestijd ongeveer 4 minuten

Wie zich verdiept in vindbaarheid via AI, komt al snel de term llms.txt tegen. Sommige aanbieders presenteren het als een verplicht onderdeel van elke site die in ChatGPT wil verschijnen. Dat is te stellig. Hieronder lees je wat het bestand is, wat erin hoort en hoe wij het inschatten voor een Vlaamse kmo.

Waar llms.txt vandaan komt

llms.txt is een voorstel van Jeremy Howard, gepubliceerd op llmstxt.org in september 2024. Het vertrekt van een eenvoudige vaststelling: webpagina's zijn gebouwd voor mensen, met menu's, banners, cookiemeldingen en scripts. Een taalmodel dat snel wil begrijpen waar een site over gaat, heeft meer aan een beknopt overzicht op één vaste plaats.

Het voorstel is dat je een bestand in markdown publiceert op jouwdomein.be/llms.txt, naast het bekende robots.txt. Waar robots.txt zegt wat een crawler mag lezen, wil llms.txt zeggen wat de moeite waard is om te lezen.

Wat erin staat

Het voorstel beschrijft een vaste opbouw in markdown:

  • een kop met de naam van je zaak of project, het enige verplichte onderdeel
  • een korte samenvatting in een citaatblok, met de kerninformatie die nodig is om de rest te begrijpen
  • eventueel enkele alinea's met extra uitleg
  • lijsten met links naar je belangrijkste pagina's, gegroepeerd onder tussenkoppen, telkens met een korte omschrijving

Het voorstel raadt daarnaast aan om van belangrijke pagina's een schone markdownversie aan te bieden, op hetzelfde adres met .md erachter. Voor een kmo is dat meestal een stap te ver. Een goed llms.txt-bestand met de juiste links volstaat als vertrekpunt.

Voor een installatiebedrijf kan dat er zo uitzien:

```

Voorbeeld Installaties

Installateur van warmtepompen en zonnepanelen voor particulieren en kmo's in Oost-Vlaanderen, opgericht in 2009.

Diensten

Over ons

  • Contact: adres, telefoon, openingsuren

```

Wat het bewezen oplevert

Hier moeten we eerlijk zijn: dat een grote AI-dienst llms.txt gebruikt om te bepalen welke bronnen in een antwoord komen, is niet aangetoond. In de documentatie van Google en OpenAI die wij nakeken, staat llms.txt nergens als factor voor hun zoekfuncties.

Google is het duidelijkst. In zijn uitleg over AI-functies schrijft Google dat je geen nieuwe machineleesbare bestanden, AI-tekstbestanden of speciale opmaak hoeft te maken om in AI Overviews of AI Mode te verschijnen. Wat telt, is dat je pagina geïndexeerd is en met een fragment in de zoekresultaten kan staan.

OpenAI vermeldt llms.txt evenmin in zijn documentatie over crawlers. Wat daar wel staat: OAI-SearchBot moet toegang hebben tot je site, anders verschijn je niet in de zoekantwoorden van ChatGPT.

Op llmstxt.org staat dat onder meer grote AI-bedrijven een llms.txt publiceren voor hun eigen documentatie. Dat zegt iets over het nut voor ontwikkelaars die met een AI-assistent in technische documentatie zoeken. Het zegt niets over de manier waarop een zoekfunctie bronnen kiest voor een vraag als "welke boekhouder in Aalst raad je aan?".

Waarom we het toch vaak plaatsen

Ondanks die onzekerheid raden we het bestand meestal aan. De redenen zijn nuchter:

  • Het kost weinig. Een goed bestand voor een kmo-site schrijf je in een uur. Er is geen technische ingreep in je site voor nodig.
  • Het doet geen kwaad. Een AI-dienst die het bestand negeert, merkt er niets van.
  • Het dwingt tot helderheid. Wie een samenvatting van drie regels over zijn zaak moet schrijven, ontdekt vaak dat die zinnen op de homepagina zelf ontbreken. Dat inzicht is waardevoller dan het bestand.
  • Het is klaar als de standaard doorbreekt. Kiest een grote dienst er later voor om het bestand te gebruiken, dan sta je er al.

Zie llms.txt dus als een klein en goedkoop signaal zonder garantie. Het komt helemaal op het einde van de lijst, na de zaken die de aanbieders zelf documenteren of die aantoonbaar helpen: crawlers toegang geven, duidelijke teksten schrijven, vermeldingen op andere sites verzamelen en gestructureerde data toevoegen.

Wanneer je het beter laat

Heb je geen tijd om het bestand bij te werken, laat het dan weg. Een llms.txt dat verwijst naar verdwenen pagina's of oude diensten, geeft een AI-dienst net verkeerde informatie. Dat risico weegt zwaarder dan het onzekere voordeel. Het bestand hoort dus thuis in dezelfde onderhoudsroutine als je site zelf: wijzigt er een dienst of een adres, dan pas je het ook in llms.txt aan.

Wij schrijven het bestand vanuit Gent voor kmo's in heel Vlaanderen altijd in het Nederlands, in dezelfde bewoordingen als de site, zodat een AI-dienst niet twee versies van dezelfde feiten tegenkomt.

Wat je nu kunt doen

  • Kijk of je site al een llms.txt heeft door jouwdomein.be/llms.txt te openen.
  • Schrijf drie zinnen die zeggen wat je zaak doet, voor wie en in welke regio. Staan die zinnen niet op je homepagina, zet ze daar eerst.
  • Maak een lijst van je vijf belangrijkste pagina's met per pagina één regel uitleg. Daarmee heb je de inhoud van een llms.txt al klaar.

In onze eenmalige optimalisatie schrijven en plaatsen we het bestand samen met de maatregelen die zwaarder wegen. Wil je je website zelf herwerken, dan helpt ons zusterbureau hetdesignbureau.be je verder.