Kennisbank · Begrip

Crawler: de bot die je site ontdekt

Een programma dat automatisch webpagina's ophaalt en de links daarin volgt, zodat zoekmachines en AI-systemen het web in kaart brengen.

Door , Content Strategist & GEO Editor · Laatst bijgewerkt:

Belangrijkste punten

  • Een crawler haalt pagina's op en volgt links naar nieuwe URL's.
  • Googlebot rendert JavaScript, veel AI-crawlers doen dat niet.
  • Elke bot identificeert zich met een user agent die je kunt herkennen en sturen.
  • Interne links bepalen grotendeels wat er ontdekt wordt.
  • Log file analyse laat zien wat bots werkelijk doen.

Wat een crawler doet

Een crawler, spider of bot is een programma dat automatisch webpagina's opvraagt, de inhoud opslaat en de gevonden links toevoegt aan een wachtrij om later te bezoeken. Zo bouwt een zoekmachine een beeld van het web. De cyclus is: ontdekken via links en sitemaps, ophalen van de HTML, eventueel renderen van JavaScript, en doorgeven aan de indexeringsfase.

Belangrijke crawlers

Googlebot voor Google Search, Bingbot voor Bing en Copilot, en daarnaast een groeiende groep AI-crawlers: GPTBot en OAI-SearchBot van OpenAI, ClaudeBot van Anthropic, PerplexityBot en Google-Extended. Elke bot heeft een eigen user agent en eigen gedrag. Een deel voert alleen een simpele HTML-fetch uit zonder JavaScript te draaien.

Wat crawlgedrag bepaalt

Hoe vaak en hoe diep een bot je site bezoekt hangt af van je autoriteit, hoe vaak je content wijzigt, hoe snel je server reageert en hoeveel foutmeldingen hij tegenkomt. Trage responstijden en veel 5xx-fouten zorgen ervoor dat Googlebot terugschakelt. Duidelijke interne links, een actuele sitemap en een schone URL-structuur zorgen juist voor efficiënte dekking.

Crawlers sturen

Met robots.txt bepaal je welke bots welke paden mogen ophalen. Met meta robots en de X-Robots-Tag stuur je wat er met de opgehaalde pagina mag gebeuren. Belangrijk verschil: robots.txt voorkomt ophalen, noindex voorkomt indexeren. Blokkeer je een pagina in robots.txt, dan kan de bot de noindex niet lezen — een klassieke oorzaak van pagina's die blijven staan.

Controleren wat er echt gebeurt

Serverlogs zijn de enige harde bron: welke user agent, welke URL, welke statuscode, op welk moment. Daarin zie je of Googlebot je nieuwe cluster al heeft gevonden, of hij crawlbudget verspilt aan filter-URL's, en of AI-crawlers je site überhaupt bezoeken. Verifieer verdachte bots via reverse DNS; user agents zijn eenvoudig te vervalsen.

Veelgestelde vragen

Wat is een crawler?+

Een crawler is een programma dat automatisch webpagina's ophaalt en de links daarin volgt, zodat zoekmachines en AI-systemen het web in kaart brengen.

Rendert Googlebot JavaScript?+

Ja, in een tweede fase met een Chromium-renderer. Veel AI-crawlers doen dat niet en zien alleen de initiële HTML.

Hoe blokkeer ik een crawler?+

Met een Disallow-regel voor de betreffende user agent in robots.txt. Voor het weren uit de index gebruik je noindex op een crawlbare pagina.

Hoe weet ik welke bots mijn site bezoeken?+

Via je serverlogs, waarin per verzoek de user agent en statuscode staan. Verifieer belangrijke bots met reverse DNS.

Wat is het verschil tussen crawler en indexer?+

De crawler haalt pagina's op; de indexer beslist welke opgehaalde pagina's in de zoekindex worden opgenomen.

Verder lezen

Gerelateerde artikelen

Alles in de kennisbank →

Alles over dit thema op één plek: hub AI-strategie

Ready?

Klaar om gespot te worden?

Plan een gratis kennismaking van 30 minuten. We kijken mee naar je huidige vindbaarheid en vertellen eerlijk wat we zouden doen — wel of geen samenwerking.

Stuur ons een bericht