Kennisbank · Begrip
robots.txt: sturen wat crawlers wel en niet ophalen
Een bestand in de root van je domein dat crawlers vertelt welke paden ze mogen crawlen. Blokkeren in robots.txt voorkomt crawlen, niet indexeren — daarvoor gebruik je noindex.
Door Amanda, Content Strategist & GEO Editor · Laatst bijgewerkt:
Belangrijkste punten
- robots.txt regelt crawlen, niet indexeren.
- Een geblokkeerde URL kan alsnog in Google verschijnen, zonder snippet.
- Het bestand hoort in de root: /robots.txt, met statuscode 200.
- Verwijs naar je XML-sitemap onderaan het bestand.
- AI-crawlers zoals GPTBot en PerplexityBot stuur je hier expliciet aan.
Wat robots.txt wel en niet kan
robots.txt is een tekstbestand in de root van je domein dat crawlers vertelt welke paden ze mogen ophalen. Het is een vrijwillig protocol: nette crawlers houden zich eraan, kwaadwillende bots niet. Belangrijkste misverstand: Disallow voorkomt crawlen, geen indexering. Wordt er extern naar een geblokkeerde URL gelinkt, dan kan Google die URL alsnog opnemen — zonder titel of omschrijving, want de inhoud mag niet worden opgehaald. Wil je een pagina echt uit de index, gebruik dan noindex en laat de pagina crawlbaar.
De basisstructuur
Een blok begint met User-agent (voor welke crawler geldt dit) gevolgd door Disallow- en Allow-regels. Paden zijn hoofdlettergevoelig en relatief aan de root. Het teken * werkt als wildcard, $ markeert het einde van een URL. Regels worden per crawler toegepast op basis van het meest specifieke matchende blok — een crawler die zichzelf herkent in een eigen blok negeert het generieke User-agent: * blok volledig. Sluit af met een Sitemap-regel met de volledige URL van je XML-sitemap.
Wat je meestal wél blokkeert
Verstandige Disallow-kandidaten zijn: interne zoekresultaten, filter- en facetten-URL's met parameters, winkelwagen- en checkoutpagina's, admin- en loginpaden, en dubbele printversies. Dit bespaart crawl budget bij grote sites. Blokkeer nooit je CSS- en JavaScript-bestanden: Google rendert je pagina en heeft die nodig om de layout en content correct te beoordelen.
AI-crawlers aansturen
Sinds 2023 hebben AI-platforms eigen user-agents: GPTBot en OAI-SearchBot (OpenAI), ClaudeBot en Claude-User (Anthropic), PerplexityBot, Google-Extended (voor Gemini-training, los van Googlebot) en CCBot (Common Crawl). Wil je zichtbaar zijn in AI-antwoorden, dan geef je deze bots expliciet toegang. Blokkeer je Google-Extended of GPTBot, dan verklein je de kans dat je content als bron wordt gebruikt. Een llms.txt of llms-full.txt naast je robots.txt helpt modellen daarnaast om je belangrijkste pagina's gestructureerd te vinden.
Testen en veelgemaakte fouten
Controleer je bestand met de robots.txt-rapportage in Google Search Console en de URL-inspectie per pagina. De duurste fouten: een Disallow: / die vanuit een staging-omgeving meeverhuist naar productie, een robots.txt die een 404 of 500 teruggeeft (bij een 5xx stopt Google tijdelijk met crawlen), en het blokkeren van paden die je juist wilt laten indexeren. Zet na elke deploy een simpele check op: haal /robots.txt op en verifieer de statuscode en inhoud.
Veelgestelde vragen
Haalt robots.txt een pagina uit Google?+
Nee. robots.txt voorkomt dat de pagina wordt opgehaald, niet dat de URL wordt geïndexeerd. Gebruik een noindex-instructie en houd de pagina crawlbaar, anders ziet Google die instructie nooit.
Waar moet robots.txt staan?+
In de root van elk hostnaam-domein, bijvoorbeeld https://voorbeeld.nl/robots.txt. Subdomeinen hebben een eigen bestand; een robots.txt in een submap wordt genegeerd.
Moet ik AI-crawlers blokkeren?+
Alleen als je principieel niet wilt dat je content in AI-antwoorden en trainingsdata terechtkomt. Wil je zichtbaar zijn in ChatGPT, Perplexity of AI Overviews, dan geef je deze bots juist toegang.
Wat gebeurt er als ik geen robots.txt heb?+
Dan mogen crawlers alles ophalen wat ze kunnen vinden. Voor kleine sites is dat prima; vanaf enkele duizenden URL's is sturing zinvol om crawl budget efficiënt te gebruiken.
Kan ik crawlsnelheid regelen in robots.txt?+
Googlebot ondersteunt crawl-delay niet; dat regel je via de crawlstatistieken in Search Console of door je server te ontlasten. Sommige andere crawlers respecteren crawl-delay wel.
Verder lezen
Gerelateerde artikelen
Alles in de kennisbank →SEO fundamenten
Linkbuilding uitbesteden · Kosten, keuze & valkuilen 2026
Zelf doen of uitbesteden? Het omslagpunt, marktprijzen per link, 8 rode vlaggen bij bureaus, contractafspraken en hoe je resultaat na 6 maanden beoordeelt.
Lees meerSEO fundamenten
Wat kost linkbuilding? · Eerlijke prijsgids 2026
Prijzen per backlink (€ 90–600) en per traject, de vijf factoren achter de prijs, wat je per maandbudget krijgt en een ROI-rekenmodel in vier stappen.
Lees meerSEO fundamenten
Linkbuilding strategie · Stappenplan met gap-analyse
Van gap-analyse tegen de top 3 naar maandcadans: paginaprioritering (60-30-10), 9 tactieken, anchor-plan, interne doorstroming en kwartaalreview.
Lees meerSEO fundamenten
Linkbuilding bureau kiezen · 10 criteria & 12 vragen
Bureau, specialist of linkshop? De 10 harde criteria, de 12 vragen voor je eerste gesprek, de rode vlaggen en waar je na 6 maanden op afrekent.
Lees meerAlles over dit thema op één plek: hub AI-strategie
Ready?
Klaar om gespot te worden?
Plan een gratis kennismaking van 30 minuten. We kijken mee naar je huidige vindbaarheid en vertellen eerlijk wat we zouden doen — wel of geen samenwerking.
Stuur ons een bericht