Blog

llms.txt: wat het is en of je het nodig hebt

Geen standaard, wel een groeiende praktijk.

Wat llms.txt is, of grote AI-aanbieders er al iets mee doen, en of jouw site het nodig heeft.


llms.txt op een website

llms.txt is een voorstel voor een markdownbestand in de root van je site dat AI-assistenten een geordend overzicht van je inhoud geeft.
Het is geen vastgelegde standaard en geen enkele grote AI-aanbieder heeft publiek beloofd het te lezen.
Google zei zelfs uitdrukkelijk dat Search het bestand niet gebruikt.
Hieronder staat wat er in hoort en wanneer het de moeite is.

Wat is llms.txt?

llms.txt is een kort markdownbestand dat beschrijft wat er op je site staat en waar de belangrijkste pagina's te vinden zijn.
Het voorstel komt van Jeremy Howard en staat sinds 3 september 2024 op llmstxt.org, waar het sindsdien is bijgewerkt.
De reden erachter is technisch, niet commercieel.
Een taalmodel dat een pagina ophaalt krijgt HTML binnen met navigatie, cookiemeldingen en scripts, terwijl het contextvenster beperkt is.
Een lijst links met per link één regel uitleg kost veel minder tokens.

Hoe ziet zo'n bestand eruit?

Het formaat is strak en kent precies één verplicht onderdeel: de H1.
De rest is optioneel, maar wel in een vaste orde.

  • H1: de naam van de site of het project, het enige verplichte deel.
  • Blockquote: een samenvatting van een paar regels over wat de site is en voor wie.
  • Vrije paragrafen: optionele achtergrond zonder koppen.
  • H2-secties: per sectie een lijst markdownlinks, elk optioneel gevolgd door een dubbele punt en een korte notitie.
  • Sectie Optional: bij afspraak de plek voor links die een agent mag overslaan bij krappe context.
llms.txt naast robots.txt en een sitemap

Mijn eigen bestand staat op /llms.txt en volgt dat schema grotendeels: een H1 met mijn naam, een blockquote over vijftien jaar Drupal, Herk-de-Stad en mijn werktalen, daarna H2-secties voor diensten, realisaties, artikels, expertise, contact en de Engelstalige versie.
Achter de links bij diensten en realisaties staat één zin die zegt waar de pagina over gaat.
Geen verkooptaal, want het bestand is bedoeld om gelezen te worden, niet om te overtuigen.

Waar hoort het bestand te staan?

In de root van je domein, dus op /llms.txt, als platte tekst met markdown erin.
Een bestand op een subpad mag ook, bijvoorbeeld /docs/llms.txt, dat dan geldt voor de URL's onder dat pad waarbij het meest specifieke bestand voorgaat.
Dat is bedoeld voor documentatiesites met verschillende productlijnen.
Het voorstel gaat trouwens verder dan dat ene bestand: je biedt ook schone markdownversies van je pagina's aan, op dezelfde URL met .md erachter of met .md in plaats van de extensie.
Dat stuk is meer werk, want het vraagt een aparte weergave in je CMS.

llms.txt, robots.txt en sitemap.xml: drie verschillende dingen

Alleen robots.txt en sitemap.xml zijn afspraken waar crawlers zich effectief aan houden. llms.txt lijkt er oppervlakkig op, maar het verschil zit in de status en in wie het uitleest.

Bestand Status Waarvoor het dient Wie het leest
robots.txt RFC 9309, standaard sinds september 2022 Toegang toestaan of weigeren per user-agent Zoekmachines en de meeste AI-crawlers
sitemap.xml Sitemapprotocol 0.9, ondersteund sinds 2006 Alle indexeerbare URL's opsommen in XML Zoekmachines, machinaal
llms.txt Voorstel, geen standaard De site samenvatten en de kernpagina's aanwijzen Onbekend, geen aanbieder bevestigt het

Een llms.txt vervangt dus geen van beide.
Of AI-crawlers je pagina's mogen ophalen regel je in robots.txt en dat alles gevonden wordt blijft het werk van je sitemap.
Daarom kijk ik bij technische SEO eerst naar die twee voor er een nieuw bestand bijkomt.

Wat hoort er wel en niet in?

Links naar de pagina's waarvan je wil dat ze geciteerd worden, met per link één zin uitleg.
Dat is de hele inhoud.
Een bestand met enkele tientallen links werkt in de praktijk beter dan een uitputtende lijst, want de winst zit net in de selectie die je maakt.

Wat er niet in hoort is even belangrijk.
Geen zoekwoordenlijst, want het bestand wordt door jou beheerd en is daarmee even betrouwbaar als de oude keywords-metatag.
Geen instructies aan het model, want je eigen server is geen plek om gedrag van een assistent af te dwingen.
Geen URL's die je uit de index wil houden, want je publiceert ze hier gewoon.
En geen inhoud die afwijkt van de pagina's zelf.

Wat mag je er realistisch van verwachten?

Structured data doet wel wat llms.txt belooft

Wil je vandaag iets doen voor AI-vindbaarheid, dan begin je bij schema.org in plaats van bij een los bestand.
Structured data is geen extra URL maar een laag in de pagina zelf: een blok JSON-LD dat in machinetaal herhaalt wat er in de tekst staat.
Wie de auteur is, wanneer het artikel bijgewerkt werd, welke organisatie erachter zit, welke vraag bij welk antwoord hoort.
Omdat het op dezelfde URL leeft als de inhoud, kan het niet los gaan lopen van je pagina's zoals een handmatig beheerde linklijst dat wel kan.
Verhuis je je site, dan moet dat allemaal blijven kloppen: daar gaat migreren zonder je vindbaarheid te verliezen over.

Structured data maakt content machineleesbaar in een netwerk

Het verschil met llms.txt zit opnieuw in de status. schema.org is een gedeelde woordenlijst die zoekmachines effectief uitlezen, met documentatie over welke types ondersteund zijn en validators om te controleren of je markup klopt.
Types als Article, Organization, Person, BreadcrumbList en FAQPage dekken het meeste van wat een bedrijfssite nodig heeft.
Voor een AI-assistent levert dat dezelfde winst op als voor een crawler: minder gokwerk over wat een stuk tekst betekent en wie het zegt.

In Drupal zet ik die markup bij voorkeur in de templates en in de velden die je toch al invult, niet in een los tekstveld dat iemand moet onthouden.
Dan krijgt elke nieuwe pagina hem automatisch mee en blijft hij kloppen als je content verandert.
Dat is werk aan je Drupal-architectuur en ontwikkeling en hoe je je eigen inhoud en data verder bruikbaar maakt voor modellen schreef ik uit in je website als AI-bron.

Heb je llms.txt nodig?

Voor de meeste websites niet, of in elk geval niet als eerste.
Heb je een bedrijfssite van dertig pagina's, dan levert een correcte HTML-structuur, een logische koppenhiërarchie, kloppende structured data en snelle pagina's meer op dan een bestand dat misschien niemand opvraagt.
Dat is de eerlijke versie, ook al verkoopt die minder.

Het heeft wel zin in een paar gevallen.
Bij uitgebreide technische documentatie, een API-referentie of een kennisbank waar ontwikkelaars met AI-tools in zoeken, verdient het bestand zijn plek snel.
Hetzelfde geldt als je site groot en gelaagd is en je wil sturen welke twintig pagina's het gezicht van je organisatie vormen.
En het kost weinig: een uur schrijven, daarna bijwerken als je structuur verandert.
Daarom staat er één op mijn eigen site, als proef, niet omdat ik weet dat hij gelezen wordt.

Wil je weten waar je site technisch staat voor zoekmachines en AI-assistenten, dan begin je bij die basis.
Ik breng dat in kaart bij technische SEO en frontend performance en zeg er telkens bij wat je rustig kan laten liggen.
Stuur je vraag door via contact en je krijgt binnen 24 uur een eerlijk beeld.

Veelgestelde vragen

Wat is llms.txt?

llms.txt is een markdownbestand in de root van een website dat AI-assistenten een samenvatting geeft van die site, plus links naar de belangrijkste pagina's.
Het voorstel komt van Jeremy Howard en dateert van 3 september 2024.
Het bestaat uit een verplichte H1, een blockquote en H2-secties met linklijsten.
Het blijft een voorstel en geen standaard, dus niemand is verplicht het te lezen.

Gebruikt Google llms.txt?

Voor Search niet.
Google Search ondersteunt llms.txt niet: Gary Illyes zei op Search Central Live Deep Dive Asia Pacific (juli 2025) dat het geen Google-initiatief is en er zijn geen plannen bekend en John Mueller vergeleek het met de keywords-metatag die al meer dan tien jaar genegeerd wordt omdat de sitebeheerder hem zelf invult.
Chrome's Lighthouse controleert het bestand sinds mei 2026 wel, in de experimentele categorie Agentic Browsing, dus voor agent-leesbaarheid en niet voor Search.

Wat is het verschil tussen llms.txt en robots.txt?

robots.txt regelt toegang, llms.txt beschrijft inhoud. robots.txt is sinds september 2022 een echte standaard, RFC 9309 en zegt per user-agent welke paden gecrawld mogen worden. llms.txt zegt niets over toestemming en geeft alleen een overzicht van je pagina's.
Wil je AI-crawlers blokkeren of toelaten, dan doe je dat in robots.txt.

Moet ik ook een llms-full.txt maken?

Dat hoeft niet, want het staat niet in het voorstel. llms-full.txt is een gewoonte uit het veld, meestal een bestand met de volledige tekst van een documentatiesite in één keer.
Het voorstel vraagt iets anders: schone markdownversies van je bestaande pagina's.
Zo'n tekstbestand wordt snel groot en verouderd, dus onderhoud weegt hier zwaarder dan volledigheid.

Helpt structured data meer dan llms.txt voor AI-assistenten?

Waarschijnlijk wel, want structured data zit in de pagina zelf en wordt effectief uitgelezen.
Je schrijft een blok JSON-LD volgens de woordenlijst van schema.org dat in machinetaal zegt wie de auteur is, waar de pagina over gaat en welke vraag bij welk antwoord hoort.
Types als Article, Organization, Person, BreadcrumbList en FAQPage dekken het meeste van wat een bedrijfssite nodig heeft.
Omdat het op dezelfde URL staat als je tekst, kan het niet uit de pas lopen met je inhoud en dat is precies het zwakke punt van een handmatig beheerde linklijst zoals llms.txt.

Kan ik zelf SEO-optimalisatie doen?

Een groot deel wel.
Titels, metadescriptions, koppenstructuur, interne links en afbeeldingen op de juiste afmeting beheer je zelf in Drupal en Lighthouse geeft je een eerste beeld.
Wat handwerk blijft is caching op de juiste laag, renderblokkerende bronnen, structured data in code en dubbele URL's opruimen.
Tools voor de basis, handwerk voor de rest.

Een vraag over dit onderwerp?

Beschrijf kort je situatie, dan laat ik weten wat er speelt en wat het zou kosten. Zonder offertetraject.

Privacybeleid

Wie we zijn
Dit beleid geldt voor David Porschmann (freelance webdeveloper). 
Contact: support@porschmann.be.

Welke gegevens we verwerken
Naam, e-mail, bedrijfsnaam (optioneel) en je bericht/aanvraag. Bij websitebezoek verwerken we ook beperkte technische gegevens (zoals IP-adres en browser) voor beveiliging en analytics.

Waarom we je gegevens verwerken (rechtsgrond)

  • Om je vraag te beantwoorden of een offerte te bezorgen (toestemming of precontractuele noodzaak).

  • Voor administratie en facturatie bij samenwerking (contractuele noodzaak).

  • Voor beveiliging en foutopsporing (gerechtvaardigd belang).

Bewaartermijnen
Inzendingen via het contactformulier: maximaal 24 maanden. Klantdossiers en facturatie: volgens wettelijke bewaartermijnen.

Delen met derden
We delen je gegevens niet met derden, behalve met verwerkers die ons helpen de website te hosten, e-mail te versturen of administratie te doen. Met deze partijen zijn verwerkersovereenkomsten gesloten.

Jouw rechten
Recht op inzage, correctie, verwijdering, beperking, overdraagbaarheid en het intrekken van toestemming. 
Mail ons op support@porschmann.be.

Beveiliging
We nemen passende technische en organisatorische maatregelen om je gegevens te beschermen.

Cookies en analytics
Korte uitleg over gebruikte tools (bv. Matomo/Clarity/GA) en link naar cookie-verklaring indien van toepassing.

Contact
Vragen over dit beleid? 
support@porschmann.be.

Verder lezen