Aller au contenu
snorklee
Trafic IA Analytics Tarifs Manifeste Documentation Contact Connexion Essai gratuit 14 jours

Hoe AI-verkeer wordt gemeten

Alles wat het tabblad AI-verkeer toont, komt van uw eigen server: geen peilingen, geen gesimuleerde vragen aan ChatGPT, geen geraden score. Deze pagina beschrijft precies wat wordt waargenomen, wat wordt geverifieerd en vooral wat de meting niet bewijst.

Drie niveaus, drie verschillende signalen

NiveauWat wordt waargenomenWat het betekent
VerkendEen indexerings- of verzamelrobot (GPTBot, ClaudeBot, PerplexityBot…) vraagt een pagina opUw inhoud belandt in het corpus van een model of in een index
Live geraadpleegdEen agent die door een vraag van een gebruiker is geactiveerd (ChatGPT-User, Perplexity-User, Claude-User…) vraagt een pagina opEen assistent haalde die pagina op terwijl hij iemand antwoordde
BezochtEen mens landt op uw site met een assistent-referrer (chatgpt.com, perplexity.ai…)Iemand klikte door vanuit een AI-antwoord

De drie niveaus tellen nooit bij elkaar op: het zijn drie verschillende populaties. Robots worden nooit bij uw bezoekers geteld.

Wat de meting niet bewijst

Dit is het deel waar de meeste tools over zwijgen, dus zetten we het op papier.

Een live raadpleging bewijst dat een systeem uw pagina heeft opgehaald terwijl het iemand antwoordde. Het bewijst niet dat:

  • het uiteindelijke antwoord uw pagina citeerde;
  • uw inhoud dat antwoord heeft beïnvloed;
  • de persoon uw naam heeft gezien;
  • de gestelde vraag commercieel iets met uw activiteit te maken had.

Evenmin kennen we ooit de vraag die een bezoek of ophaling veroorzaakte: die wordt nergens doorgegeven. Daarom spreekt de interface over “landingspagina's” en “live geraadpleegd”, nooit over “geciteerd”.

Waarschijnlijke aankomsten — afgeleid uit een tekstfragment in de URL, de typische signatuur van een klik vanuit een AI-antwoord zonder referrer — worden apart geteld en nooit vermengd met het gemetene.

Hoe de identiteit van robots wordt geverifieerd

Een user-agent is een bewering: elk programma kan zich GPTBot noemen, en veel scrapers doen dat juist om blokkades te omzeilen. Alleen op de user-agent vertrouwen betekent meten wat men u vertelt.

Snorklee toetst daarom het IP-adres van elk bezoek aan de reeksen die de aanbieders zelf publiceren:

AanbiederOfficiële lijst
OpenAI — GPTBotopenai.com/gptbot.json
OpenAI — OAI-SearchBotopenai.com/searchbot.json
OpenAI — ChatGPT-Useropenai.com/chatgpt-user.json
Perplexity — PerplexityBotperplexity.ai/perplexitybot.json
Perplexity — Perplexity-Userperplexity.ai/perplexity-user.json
Anthropic — ClaudeBot, Claude-User, Claude-SearchBotclaude.com/crawling/bots.json

De verificatie gebeurt robot voor robot, niet aanbieder voor aanbieder: GPTBot en ChatGPT-User publiceren verschillende reeksen, dus een adres dat voor de een geldig is, bevestigt de ander niet. De lijsten worden elke nacht opnieuw opgehaald; mislukt een download, dan blijft de vorige versie van kracht.

Drie mogelijke oordelen, getoond onder de crawlertabel:

  • Bevestigd — het adres valt binnen de reeksen die de aanbieder van die robot publiceert.
  • Verklaard — die aanbieder publiceert geen reeksen (Common Crawl, Bytespider, Amazonbot…). We kunnen alleen vastleggen wat de robot beweert, en presenteren dat nooit als bevestigd.
  • Afgewezen — de robot claimde een aanbieder vanaf een adres dat niet van hem is. Die bezoeken worden uit alle tellers van het tabblad verwijderd; alleen het totaal aan vervalsingen blijft zichtbaar, zodat u weet wat er is weggelaten.

Waar het signaal wordt opgevangen

Robots lezen alleen ruwe HTML: ze voeren geen JavaScript uit en zijn dus onzichtbaar voor een klassiek meetscript. De tag w.js alleen zal ze nooit zien.

Voor het niveau “Verkend” is een signaal aan serverzijde nodig — de crawler-beacon (WordPress-plug-in, Next.js-middleware, Cloudflare-worker, PHP-snippet…). Zonder die beacon worden alleen menselijke bezoeken vanuit AI-chats gemeten. De beacon geeft het adres van de robot door zodat de hierboven beschreven verificatie kan plaatsvinden.

Wat de bots hebben gelezen, pagina per pagina

Elk bezoek draagt het exacte token dat de bot opgeeft (GPTBot, ChatGPT-User…), niet alleen de naam van zijn uitgever. Dat is wat twee tegengestelde feiten over dezelfde pagina onderscheidt: verzamelen voor training, en een live opvraging terwijl een AI iemand antwoordt.

De kaart “Wie leest wat” kruist dus bot × pagina, in beide richtingen. De tellingen daar zijn exact, zonder drempel en zonder afronding: die regels bevatten geen enkel gegeven van menselijke bezoekers, dus geldt er geen anonimiseringsdrempel — een bot is geen persoon. Tellers die mensen en bots mengen, blijven wel onderworpen aan de regels uit Verzamelde gegevens.

Het token wordt pas sinds augustus 2026 opgeslagen: eerdere bezoeken blijven toegewezen aan hun uitgever, zonder detail per bot.

Naleving van robots.txt

Elke nacht leest Snorklee de robots.txt van uw site en vergelijkt die met wat de bots werkelijk hebben opgehaald. Omdat de regels van een robots.txt per token worden geschreven, gebeurt de vergelijking op datzelfde niveau.

Het resultaat wordt alleen getoond bij een volledig feit:

  • Bestand niet gelezen (time-out, serverfout, domein onbereikbaar) → er wordt niets beweerd. Een uitblijvend antwoord wordt nooit als naleving gepresenteerd.
  • Geen robots.txt → wij zeggen het precies zo: geen enkele regel kan aan de bots worden tegengeworpen.
  • Niet-identificeerbare bot → zijn bezoek wordt uit de berekening gehaald en apart geteld, nooit als conform meegerekend.

Wordt een overtreding vastgesteld, dan worden de betrokken pagina en de exacte regel uit het bestand die haar verbiedt geciteerd, zodat de vaststelling verifieerbaar is.

Uw robots.txt genereren

Vanuit het tabblad AI-verkeer maakt Snorklee een robots.txt op basis van de bots die uw site werkelijk hebben bezocht — geen generieke lijst. U vinkt aan wie u wilt weren, kopieert de tekst en plakt hem bij uw hoster.

Standaard wordt alleen het verzamelen voor training geblokkeerd. Bots die indexeren (search) of een pagina live opvragen om iemand te antwoorden (assistant) sturen u bezoekers: blokkeren zou dat verkeer afsnijden. Snorklee verbiedt het u niet, maar waarschuwt u.

Alleen werkelijk waargenomen bots staan voorgevinkt: een regel voor een bot die nooit langskwam maakt het bestand langer zonder iets te beschermen.

Twee uitvoeren: het toe te voegen blok (uw bestaande regels worden nooit aangeraakt) of het volledige bestand, samengevoegd met het bestaande — uw Disallow- en Sitemap-regels blijven behouden. De generator opnieuw draaien vervangt het vorige Snorklee-blok in plaats van er een op te stapelen.

PlatformWaar plakken
WordPress, zelfgehoste sitebestand robots.txt in de hoofdmap
Shopifythema → robots.txt.liquid
WixSEO → Tools → Robots.txt-editor
WebflowSite-instellingen → tabblad SEO
Squarespaceniet mogelijk — het bestand is een systeemroute die niet te wijzigen is

Wat de generator niet doet. Snorklee levert uw robots.txt niet uit en wijzigt hem nooit: zolang u de tekst niet plakt, is er niets veranderd. En een robots.txt blijft een beleefd verzoek, geen barrière — precies daarom bestaat de nalevingscontrole hierboven: die vertelt u wie hem negeert.

Privacy

Het IP-adres wordt uitsluitend op het moment van de aanvraag gebruikt om op landniveau te lokaliseren, verkeer te classificeren en de identiteit van robots te verifiëren. Het wordt nooit opgeslagen in de events — zie Verzamelde gegevens.