Aller au contenu
snorklee
Trafic IA Analytics Tarifs Manifeste Documentation Contact Connexion Essai gratuit 14 jours

Cómo se mide el tráfico de IA

Todo lo que muestra la pestaña Tráfico IA procede de su propio servidor: sin sondeos, sin preguntas simuladas a ChatGPT, sin puntuaciones adivinadas. Esta página describe exactamente qué se observa, qué se verifica y, sobre todo, qué no demuestra la medición.

Tres niveles, tres señales distintas

NivelQué se observaQué significa
ExploradoUn robot de indexación o recopilación (GPTBot, ClaudeBot, PerplexityBot…) solicita una páginaSu contenido entra en el corpus de un modelo o en un índice
Consultado en directoUn agente activado por la pregunta de un usuario (ChatGPT-User, Perplexity-User, Claude-User…) solicita una páginaUn asistente fue a buscar esa página mientras respondía a alguien
VisitadoUna persona llega a su sitio con un referente de asistente (chatgpt.com, perplexity.ai…)Alguien hizo clic desde una respuesta de IA

Los tres niveles nunca se suman: son tres poblaciones distintas. Los robots nunca se cuentan entre sus visitantes.

Qué no demuestra la medición

Es la parte que la mayoría de las herramientas callan, así que dejémosla por escrito.

Una consulta en directo demuestra que un sistema recuperó su página mientras respondía a alguien. No demuestra que:

  • la respuesta final citara su página;
  • su contenido influyera en esa respuesta;
  • la persona viera su nombre;
  • la pregunta formulada tuviera relación comercial con su actividad.

Del mismo modo, nunca conocemos la pregunta que originó una visita o una recuperación: no se transmite en ningún sitio. Por eso la interfaz habla de «páginas de entrada» y de «consulta en directo», nunca de «cita».

Las llegadas probables —deducidas de un fragmento de texto en la URL, firma típica de un clic desde una respuesta de IA sin referente— se cuentan aparte y nunca se mezclan con lo medido.

Cómo se verifica la identidad de los robots

Un user-agent es una declaración: cualquier programa puede llamarse GPTBot, y muchos scrapers lo hacen precisamente para saltarse los bloqueos. Fiarse solo del user-agent es medir lo que a uno le cuentan.

Por eso Snorklee contrasta la dirección IP de cada paso con los rangos publicados por los propios proveedores:

ProveedorLista oficial
OpenAI — GPTBotopenai.com/gptbot.json
OpenAI — OAI-SearchBotopenai.com/searchbot.json
OpenAI — ChatGPT-Useropenai.com/chatgpt-user.json
Perplexity — PerplexityBotperplexity.ai/perplexitybot.json
Perplexity — Perplexity-Userperplexity.ai/perplexity-user.json
Anthropic — ClaudeBot, Claude-User, Claude-SearchBotclaude.com/crawling/bots.json

La verificación se hace robot por robot, no proveedor por proveedor: GPTBot y ChatGPT-User publican rangos distintos, así que una dirección válida para uno no valida al otro. Las listas se vuelven a descargar cada noche; si una descarga falla, sigue vigente la versión anterior.

Tres veredictos posibles, mostrados bajo la tabla de rastreadores:

  • Confirmado — la dirección pertenece a los rangos publicados por el proveedor de ese robot.
  • Declarado — ese proveedor no publica rangos (Common Crawl, Bytespider, Amazonbot…). Solo podemos registrar lo que el robot afirma, y nunca lo presentamos como confirmado.
  • Descartado — el robot decía ser de un proveedor desde una dirección que no es suya. Esos pasos se eliminan de todos los contadores de la pestaña; solo queda visible el total de suplantaciones, para que sepa qué se ha apartado.

Dónde se capta la señal

Los robots solo leen el HTML en bruto: no ejecutan JavaScript y son por tanto invisibles para un script de medición clásico. La etiqueta w.js por sí sola nunca los verá.

Para captar el nivel «Explorado» hace falta una señal en el servidor: el beacon de rastreadores (plugin de WordPress, middleware de Next.js, worker de Cloudflare, snippet PHP…). Sin él solo se miden las visitas humanas procedentes de chats de IA. El beacon transmite la dirección del robot para permitir la verificación descrita arriba.

Qué han leído los bots, página por página

Cada paso lleva el token exacto que declara el bot (GPTBot, ChatGPT-User…), no solo el nombre de su editor. Es lo que distingue dos hechos opuestos sobre una misma página: una recopilación para entrenamiento y una consulta en directo mientras una IA responde a alguien.

La tarjeta «Quién lee qué» cruza por tanto bot × página, en ambos sentidos. Los recuentos son exactos, sin umbral ni redondeo: esas filas no contienen ningún dato de visitante humano, así que no se aplica ningún umbral de anonimización — un bot no es una persona. Los contadores que mezclan humanos y bots sí siguen sujetos a las reglas descritas en Datos recogidos.

El token solo se registra desde agosto de 2026: los pasos anteriores siguen atribuidos a su editor, sin detalle por bot.

Conformidad con robots.txt

Cada noche Snorklee lee el robots.txt de tu sitio y lo compara con lo que los bots han recuperado realmente. Como las reglas de un robots.txt se escriben por token, la comparación se hace al mismo nivel.

El resultado solo se muestra sobre un hecho completo:

  • Archivo no leído (tiempo agotado, error del servidor, dominio inaccesible) → no se afirma nada. Una respuesta ausente nunca se presenta como conformidad.
  • Sin robots.txt → lo decimos tal cual: ninguna regla es oponible a los bots.
  • Bot no identificable → su paso se excluye del cálculo y se cuenta aparte, nunca entre los conformes.

Cuando se constata una infracción, se citan la página afectada y la línea exacta del archivo que la prohíbe, para que la constatación sea verificable.

Genera tu robots.txt

Desde la pestaña Tráfico IA, Snorklee produce un robots.txt construido a partir de los bots que realmente han pasado por tu sitio — no una lista genérica. Marcas a los que quieres negar el acceso, copias el texto y lo pegas en tu alojamiento.

Por defecto solo se bloquea la recopilación para entrenamiento. Los bots que indexan (search) o que consultan una página en directo para responder a alguien (assistant) te envían visitantes: bloquearlos cortaría ese tráfico. Snorklee no te lo prohíbe, pero te avisa.

Solo están premarcados los bots realmente observados: una regla dirigida a un bot que nunca ha venido alarga el archivo sin proteger nada.

Dos salidas: el bloque que hay que añadir (tus reglas existentes nunca se tocan) o el archivo completo, fusionado con el que ya existe — tus Disallow y tus Sitemap se conservan. Volver a ejecutar el generador sustituye el bloque Snorklee anterior en lugar de acumularlo.

PlataformaDónde pegar
WordPress, sitio autoalojadoarchivo robots.txt en la raíz
Shopifytema → robots.txt.liquid
WixSEO → Herramientas → Editor de robots.txt
WebflowConfiguración del sitio → pestaña SEO
Squarespaceimposible — el archivo es una ruta de sistema no modificable

Lo que el generador no hace. Snorklee no sirve tu robots.txt ni lo modifica nunca: mientras no pegues el texto, nada ha cambiado. Y un robots.txt sigue siendo una petición cortés, no una barrera — precisamente por eso existe la verificación de conformidad descrita arriba: te dice quién la ignora.

Privacidad

La dirección IP se usa únicamente, en el momento de la solicitud, para geolocalizar a nivel de país, clasificar el tráfico y verificar la identidad de los robots. Nunca se almacena en los eventos — véase Datos recopilados.