AI Ranking Tools
Alle artikelen
Door De redactieai-crawlerscrawler logstechniek

AI-crawlers in 2026: wie bezoekt je site?

Niet iedere AI-bot doet hetzelfde. Leer trainingscrawlers, zoekindexcrawlers en live fetchers uit elkaar houden voordat je ze blokkeert of meet.

Een regel met GPTBot in je log vertelt alleen dat een verzoek die naam gebruikte. Je weet nog niet waarom de bot kwam, of het IP-adres bij de genoemde aanbieder hoort en of het bezoek ooit tot een citatie leidde. Toch worden AI-crawlers vaak als één groep behandeld. Een beheerder staat ze allemaal toe, of blokkeert ze allemaal met een gekopieerde robots.txt-regel.

Dat is in 2026 een te grove aanpak. Aanbieders gebruiken verschillende crawlers voor modeltraining, zoekindexen en het live ophalen van een pagina tijdens een gebruikersvraag. Die rollen hebben niet hetzelfde effect op je zichtbaarheid. Je moet dus eerst weten welke bezoeker voor de deur staat.

De naam zegt iets over de taak

De Promptwatch-documentatie over crawlability verdeelt AI-bots in drie functionele groepen. Dit is productdocumentatie van Promptwatch, geen onafhankelijk register. Controleer namen en beleid daarom ook bij de actuele officiële documentatie van iedere provider voordat je toegangsregels aanpast.

Crawlers voor training

Trainingscrawlers verzamelen materiaal dat een aanbieder kan gebruiken voor toekomstige modellen. GPTBot van OpenAI en ClaudeBot van Anthropic vallen volgens de documentatie in deze groep. Toegang tot zulke crawlers is een afzonderlijke beleidskeuze. Je kunt training willen weigeren en tegelijk wel gevonden willen worden in een actuele AI-zoekfunctie.

Een blokkade voor een trainingscrawler betekent niet automatisch dat een zoekindexcrawler of live fetcher ook wordt geweigerd. Dat hangt af van je regels. Schrijf ze daarom per user agent en documenteer waarom je een bepaalde bot toestaat of blokkeert.

Google-Extended vraagt extra aandacht. Volgens de crawlability-uitleg is dit een robots.txt-token, geen aparte bot die onder die naam je pagina's ophaalt. Een logfilter dat uitsluitend naar Google-Extended zoekt, geeft dus geen compleet beeld van Googles activiteit.

Crawlers voor een zoekindex

OAI-SearchBot, Claude-SearchBot en PerplexityBot worden in dezelfde documentatie gekoppeld aan zoekfuncties van hun aanbieders. Deze bots helpen pagina's vindbaar te maken voor actuele AI-antwoorden. Als GEO je doel is, wil je een blokkade van deze crawlers niet per ongeluk meenemen in een algemene regel tegen modeltraining.

Een succesvolle crawl garandeert overigens niets. De bot kan de pagina ophalen en vervolgens besluiten een andere bron te gebruiken. Logs tonen bereikbaarheid en interesse, geen rangschikkingsbelofte.

Fetchers tijdens een gebruikersvraag

ChatGPT-User, Claude-User en Perplexity-User halen volgens de documentatie pagina's op wanneer een actuele vraag daar aanleiding toe geeft. Zo'n verzoek ligt dichter bij een concreet antwoordmoment dan een brede trainingscrawl. Ook hier geldt: een fetch is nog geen bewijs dat jouw URL zichtbaar in de uiteindelijke bronlijst belandde.

Bekijk de statuscode en het opgevraagde pad. Een live fetch naar een belangrijke handleiding met status 403 is direct bruikbare technische informatie. Een 200 laat zien dat het verzoek slaagde, maar je moet het antwoord of de citatiedata openen om te zien of de pagina werd gebruikt.

Vertrouw een user agent niet blind

Een user-agentwaarde is tekst in een verzoek. Een willekeurige crawler kan zich voordoen als een bekende bot. Gebruik die naam daarom niet als enig bewijs in managementrapportages of firewallregels.

Sommige aanbieders publiceren IP-ranges of een verificatiemethode. Match waar mogelijk de user agent met die actuele gegevens. De Promptwatch-documentatie zegt dat het platform verificatie toepast voor providers die zulke informatie publiceren. Voor crawlers zonder openbare IP-lijst blijft meer onzekerheid bestaan. Ook dit kan veranderen, dus sla geen oude IP-reeks voor onbepaalde tijd op.

Let bij een CDN op waar de volledige verzoeken zichtbaar zijn. Als een edge-laag het antwoord uit cache serveert of een bot al blokkeert, bereikt het verzoek je origin mogelijk niet. Alleen originlogs lezen kan dan een onvolledig beeld geven. Controleer de logbron, retentie en eventuele sampling voordat je aantallen met een vorige periode vergelijkt.

Wat je in crawler logs wilt controleren

Begin niet met een totaal aantal botbezoeken. Splits op provider, rol, statuscode en paginatype. Een trainingscrawler die duizenden assets bezoekt en een live fetcher die één productpagina opent, zijn inhoudelijk niet vergelijkbaar.

Zoek eerst naar fouten. Veel 403-fouten kunnen wijzen op firewall- of botbescherming. Een piek in 404's kan na een migratie ontstaan. Bij 5xx-fouten ligt het probleem op je eigen infrastructuur. Controleer daarna redirects. Een lange keten vertraagt het ophalen en kan eindigen op een pagina die niet meer over hetzelfde onderwerp gaat.

Kijk vervolgens naar belangrijke URL-groepen. Worden documentatie, productpagina's en actuele artikelen bereikt? Welke bots komen terug nadat je iets publiceert? Ontbreekt één provider volledig terwijl andere vergelijkbare bots je site wel ophalen, onderzoek dan diens officiële toegangsvoorwaarden en je eigen regels.

Bewaar de tijdsdimensie. Eén geslaagde fetch zegt weinig over structurele bereikbaarheid. Een logreeks laat zien of een reparatie standhoudt en of een bepaalde bot later terugkomt.

De Promptwatch-gids voor LLM-crawler user agents biedt een uitgebreid vertrekpunt. De pagina is leverancierscontent en de URL verwijst nog naar 2025, ook al is de inhoud later bijgewerkt. Neem user-agentstrings en prestatieclaims daarom niet zonder controle over. Voor een firewallwijziging blijft de provider zelf de primaire bron.

Van crawl naar zichtbaarheid

Crawler logs beantwoorden de vraag of een bot een pagina probeerde te lezen en welke statuscode je site teruggaf. Ze vertellen niet of het model je merk noemde, welke bronkaart de gebruiker zag of hoeveel mensen klikten.

Leg daarom citaties naast de logs. Als een pagina regelmatig succesvol wordt opgehaald maar niet in gemeten antwoorden verschijnt, ligt het volgende onderzoek bij bronkeuze en inhoud. Als een geciteerde pagina geen crawl in jouw logweergave heeft, controleer dan eerst of je naar de juiste bot, periode en loglaag kijkt. Een cache of ontbrekende integratie kan het spoor verbergen.

Voor commerciële attributie gaat de route verder. De Promptwatch-handleiding over AI-verkeer ordent die route als crawl, citatie, klik en conversie. Promptwatch stelt in deze productdocumentatie de eerste drie stappen te meten. Conversies en omzet lees je in je eigen analytics of CRM. Geen enkel crawlerverzoek is op zichzelf omzet.

Een werkbare controle voor je team

Maak een lijst van bots die je bewust wilt toestaan, bots waarvoor training een beleidsvraag is en bots die je niet herkent. Koppel aan elke regel een eigenaar en controledatum. Test belangrijke pagina's na wijzigingen aan robots.txt, CDN, WAF of routing. Bewaar zowel geslaagde verzoeken als fouten.

Rapporteer daarna per rol. Zoekindexcrawls zeggen iets anders dan live fetches, en trainingsverkeer hoort niet in hetzelfde succesgetal. Voeg voor zichtbaarheid de citaties en merkvermeldingen van een vaste promptset toe. Zo blijft duidelijk welke observatie uit je infrastructuur komt en welke uit een AI-antwoord.

Op onze Promptwatch-toolpagina vind je de Nederlandse productuitleg. We raden Promptwatch aan wanneer je crawler logs wilt koppelen aan prompt tracking, citaties en bezoekersanalyse. Gebruik het dashboard als onderzoekslaag, niet als reden om officiële providerregels over te slaan. De juiste vraag is niet hoeveel AI-bots je site bezochten, maar welke bot welke pagina kon lezen en wat er daarna gebeurde.