GEO & AEO

Robots.txt voor AI-Crawlers: Praktische Handleiding

7 min read·WeArkMedia

Vorige maand analyseerde ik de server logs van een e-commerce klant en zag iets opvallends: GPTBot deed 40.000 requests per maand, ClaudeBot zat op 12.000, en PerplexityBot kwam elke paar minuten langs. Geen van die crawlers stond vermeld in hun robots.txt. Ze wisten niet eens dat deze bots bestonden — laat staan dat ze er iets mee deden. Dat is het probleem waar de meeste bedrijven nu tegenaan lopen: je robots.txt is waarschijnlijk nog geschreven voor Googlebot en Bingbot, terwijl een heel nieuw leger crawlers je site indexeert voor ChatGPT, Claude en Perplexity.

Dit artikel is een praktische handleiding, geen theorie. We laten je exact zien welke user-agents je moet kennen, hoe je ze configureert, en we delen onze eigen implementatie (app/robots.ts) die we bij WeArkMedia-projecten gebruiken.

Waarom robots.txt nu anders werkt dan vijf jaar geleden

Robots.txt bestaat al sinds 1994 en deed altijd één ding: crawlers vertellen welke paden ze wel of niet mogen bezoeken. Simpel, statisch, voorspelbaar. Het probleem is dat de aannames achter dat bestand niet meer kloppen.

Traditionele crawlers zoals Googlebot indexeren je pagina's om ze te ranken in een lijst met resultaten. Jij krijgt daar in ruil klikverkeer voor terug. AI-crawlers werken fundamenteel anders: GPTBot, ClaudeBot en PerplexityBot halen content op om die te verwerken in trainingsdata of om realtime antwoorden te genereren binnen een chatinterface. De gebruiker ziet je merknaam misschien wel, maar klikt vaak nooit door naar je site.

Dat verandert de afweging volledig. Blokkeer je deze bots, dan bestaat je bedrijf simpelweg niet in het antwoord dat een gebruiker krijgt wanneer die ChatGPT of Perplexity vraagt naar producten in jouw sector. Sta je ze allemaal toe zonder nadenken, dan geef je mogelijk je volledige contentbibliotheek weg zonder enige controle over hoe die wordt gebruikt. De juiste strategie ligt ergens in het midden, en die moet je bewust kiezen — niet toevallig laten gebeuren omdat je robots.txt nooit is bijgewerkt.

Wil je begrijpen hoe deze crawlers je site precies vinden en verwerken, dan is deze GEO-gids over hoe ChatGPT je website vindt een goede aanvulling op dit artikel.

De belangrijkste AI-crawlers die je moet kennen

Voordat je iets configureert, moet je weten wie er precies langskomt. Hier zijn de crawlers die er in 2026 het meest toe doen.

GPTBot (OpenAI)

GPTBot is de crawler die OpenAI gebruikt om content te verzamelen voor training en voor het genereren van antwoorden in ChatGPT, inclusief de browse-functionaliteit. User-agent string: GPTBot. OpenAI publiceert de IP-ranges van deze crawler, wat het makkelijker maakt om verkeer te verifiëren in je logs.

ClaudeBot (Anthropic)

ClaudeBot crawlt voor Anthropic's Claude-modellen. Er bestaat ook een variant, anthropic-ai, die specifiek gebruikt wordt voor het ophalen van content tijdens gebruikersinteracties (denk aan Claude's web search). Beide user-agents zijn relevant om afzonderlijk te beheren, omdat ze verschillende doelen dienen.

PerplexityBot

Perplexity is inmiddels een serieuze bron van AI-verkeer geworden, vooral omdat het antwoorden geeft met directe bronvermeldingen — vaak met een klikbare link naar jouw site. Dit maakt PerplexityBot een van de weinige AI-crawlers waar toestaan bijna altijd loont, omdat het écht referral-traffic oplevert in plaats van alleen content-extractie.

Overige relevante crawlers

  • Google-Extended — bepaalt of Google je content mag gebruiken voor Gemini en AI Overviews, los van reguliere Googlebot-indexering.
  • CCBot — de crawler van Common Crawl, waarvan de dataset door talloze AI-labs wordt gebruikt om modellen te trainen.
  • Applebot-Extended — regelt gebruik van je content voor Apple Intelligence.
  • Bytespider — gekoppeld aan ByteDance (TikTok), agressief in crawlgedrag en vaak reden tot zorg qua serverbelasting.

Elke crawler heeft een ander doel en een ander businessmodel achter zich. Dat betekent dat een uniforme "allow all" of "disallow all"-regel bijna altijd verkeerd is.

Praktische implementatie: onze eigen robots.ts

Bij WeArkMedia-projecten met Next.js gebruiken we een dynamisch gegenereerd robots.txt-bestand via app/robots.ts, in plaats van een statisch bestand in de public-map. Dat geeft ons de flexibiliteit om regels per crawler te definiëren en aan te passen zonder een deploy te forceren voor elke wijziging.

import type { MetadataRoute } from 'next'

export default function robots(): MetadataRoute.Robots {
  return {
    rules: [
      {
        userAgent: '*',
        allow: '/',
        disallow: ['/admin/', '/api/', '/_next/'],
      },
      {
        userAgent: 'GPTBot',
        allow: '/',
        disallow: ['/admin/', '/api/'],
      },
      {
        userAgent: 'ClaudeBot',
        allow: '/',
        disallow: ['/admin/', '/api/'],
      },
      {
        userAgent: 'PerplexityBot',
        allow: '/',
      },
      {
        userAgent: 'Google-Extended',
        allow: '/',
      },
      {
        userAgent: 'Bytespider',
        disallow: '/',
      },
      {
        userAgent: 'CCBot',
        disallow: '/',
      },
    ],
    sitemap: 'https://wearkmedia.com/sitemap.xml',
  }
}

Waarom deze keuzes

We staan GPTBot, ClaudeBot en PerplexityBot bewust toe op alle publieke content, omdat onze klanten juist zichtbaar willen zijn in AI-antwoorden — dat is de kern van GEO/AEO-werk. We blokkeren Bytespider standaard, omdat deze crawler bekend staat om agressief crawlgedrag zonder duidelijke waarde voor de meeste westerse bedrijven. CCBot blokkeren we vaak ook, tenzij een klant specifiek wil bijdragen aan open trainingsdatasets, omdat het onduidelijk is welk model uiteindelijk profiteert van die data en er geen directe attributie terugkomt.

Belangrijk detail: robots.txt is een verzoek, geen slot op de deur. Serieuze crawlers zoals GPTBot en ClaudeBot respecteren de regels doorgaans, maar er bestaan ook minder scrupuleuze scrapers die de user-agent spoofen of het bestand negeren. Voor echte bescherming van gevoelige content heb je server-side rate limiting of een WAF nodig — robots.txt regelt alleen het gedrag van bots die zich netjes identificeren.

Strategie: wanneer blokkeren wél zin heeft

Niet elke situatie vraagt om volledige openheid. Er zijn drie scenario's waarin blokkeren van AI-crawlers de betere keuze is.

Content achter een betaalmuur of login

Als je premium content, cursusmateriaal of klantportalen hebt, wil je niet dat GPTBot dat weghaalt zonder dat er ooit een klant voor betaalt. Blokkeer deze paden specifiek in de disallow-regels per crawler, in plaats van je hele domein dicht te zetten.

Sites die uitsluitend op advertentie-inkomsten draaien

Voor uitgevers en contentsites die leven van paginaweergaven en advertentie-impressies, kan het weglekken van content naar AI-antwoorden direct omzet kosten. Hier is een bewuste afweging nodig tussen zichtbaarheid in AI-antwoorden en directe inkomsten uit bezoekers.

Serverbelasting bij kleinere hostingpakketten

Sommige AI-crawlers, vooral de minder bekende, crawlen inefficiënt en kunnen shared hosting-omgevingen zwaar belasten. Als je merkt dat je serverkosten stijgen door bot-traffic zonder duidelijke voordelen terug, is selectief blokkeren een legitieme keuze.

Voor de meeste MKB-bedrijven en dienstverleners geldt echter het omgekeerde: toegang toestaan is de norm, omdat zichtbaarheid in AI-antwoorden precies het doel is van moderne AEO-strategieën. Een dichtgetimmerde robots.txt is dan zelfmoord voor je vindbaarheid, hoe goed je content ook is.

Veelgestelde vragen

Blokkeert robots.txt AI-crawlers automatisch als ik niets doe?

Nee. Zonder specifieke regels crawlen de meeste AI-bots je site standaard, alsof er geen robots.txt-restricties gelden. Sommige crawlers, zoals GPTBot, controleren wel actief op regels, maar als je user-agent niet genoemd wordt, valt deze meestal onder een generieke *-regel of wordt toegang default toegestaan.

Kan ik GPTBot toestaan maar ClaudeBot blokkeren?

Ja, dat is precies waarom je crawlers per user-agent moet definiëren in plaats van één algemene regel te gebruiken. In het robots.ts-voorbeeld hierboven zie je hoe je per bot afzonderlijke allow- en disallow-paden instelt, zodat je volledige controle houdt over welke AI-dienst toegang krijgt.

Respecteren AI-crawlers robots.txt echt, of doen ze toch wat ze willen?

Grote, gereputeerde crawlers zoals GPTBot en ClaudeBot respecteren robots.txt-regels over het algemeen, omdat ze belang hebben bij een goede reputatie en juridische risico's willen vermijden. Minder transparante scrapers negeren de regels soms wel. Voor extra zekerheid combineer je robots.txt met server-side monitoring van user-agents en IP-ranges.

Moet ik robots.txt aanpassen als ik net begin met AEO?

Ja, dit is een van de eerste technische stappen. Voordat je aan content-optimalisatie begint, moet je zeker weten dat AI-crawlers überhaupt toegang hebben tot je pagina's. Zie het als de fundering: zonder toegang kunnen alle GEO-inspanningen die je daarna doet, zoals beschreven in effectieve GEO-strategieën, simpelweg niet renderen in AI-antwoorden.

Hoe controleer ik welke AI-crawlers mijn site al bezoeken?

Kijk in je server- of CDN-logs naar de user-agent header en filter op bekende namen zoals GPTBot, ClaudeBot, PerplexityBot en CCBot. Tools als Cloudflare geven dit vaak al gecategoriseerd weer onder "AI crawlers" in het analytics-dashboard, wat het overzicht een stuk makkelijker maakt dan handmatig loggen doorzoeken.

Klaar om te starten met GEO?

Neem contact op voor een gratis audit van je website.

Start gesprek
WhatsApp