Última actualización agosto de 2026. Cadenas de user-agent confirmadas con la documentación publicada de cada proveedor; lista de nombres de host de GA4 actualizada para reflejar el crecimiento del tráfico de referencia de Claude.
Los motores de IA no rastrean como Googlebot. Envían sus propios bots, con sus propios calendarios, para sus propios fines de indexación. Esos bots dejan un rastro claro en tus logs de servidor. Solo necesitas saber qué buscar.
Este artículo recorre el panorama completo: cómo identificar la actividad de los rastreadores de IA en los datos brutos de logs, cómo entender qué significa para tu cobertura de citaciones y cómo conectar esos datos de rastreo upstream con las sesiones de referido downstream que tu plataforma de visibilidad en IA y GA4 deberían estar midiendo.
Por qué los logs de servidor importan para la visibilidad en IA
La mayoría del monitoreo de marca se centra en el lado de la salida: ejecutas prompts en ChatGPT, Perplexity o Gemini y mides con qué frecuencia aparece tu marca. Ese es el punto de partida correcto.
Pero el lado de la salida solo te dice qué muestra el modelo. No te dice cuáles de tus páginas ha indexado el modelo, con qué frecuencia está siendo rastreado tu sitio, o si un rastreador está siendo bloqueado en algún punto de tu infraestructura antes de llegar siquiera a tu contenido.
Los logs de servidor responden la pregunta upstream: “¿Ha visto el motor de IA esta página?”
Sin esos datos, estás optimizando a ciegas. Una página que no recibe ninguna citación puede estar sin rastrear, rastreada pero excluida, rastreada e indexada pero sin relevancia para los prompts que te interesan, o rastreada, indexada y relevante pero perdiendo frente a un competidor con mejor fuente de autoridad. Son cuatro problemas muy diferentes con cuatro soluciones muy diferentes.
Paso 1: Conoce las cadenas de user-agent
Cada plataforma de IA importante usa una cadena de user-agent declarada. Estas son las cadenas que debes filtrar en tus logs de acceso:
| Plataforma de IA | Nombre del bot | Cadena de user-agent (coincidencia parcial) |
|---|---|---|
| OpenAI (ChatGPT) | GPTBot | GPTBot |
| OpenAI (ChatGPT search) | OAI-SearchBot | OAI-SearchBot |
| Anthropic (Claude) | ClaudeBot | ClaudeBot |
| Perplexity | PerplexityBot | PerplexityBot |
| Google (Gemini, AI Overviews) | GoogleOther | GoogleOther |
| Google (Vertex AI) | Google-CloudVertexBot | Google-CloudVertexBot |
| Apple (Apple Intelligence) | Applebot-Extended | Applebot-Extended |
| Meta AI | meta-externalagent | meta-externalagent |
| Microsoft (Copilot) | bingbot | bingbot |
Algunas notas sobre esa tabla. Microsoft Copilot usa el mismo índice que Bing, por lo que la cobertura de citaciones de Copilot sigue en gran medida el rastreo de Bingbot, no el de un bot específico para IA. Google AI Overviews y Gemini usan GoogleOther para el descubrimiento de contenido más allá del rastreo principal de Googlebot. Apple Intelligence usa Applebot-Extended para rastrear contenido específicamente para sus funciones de IA en dispositivo y en servidor.
Cada proveedor publica su documentación oficial de user-agent y, en la mayoría de los casos, una lista de rangos de IP verificados que puedes usar para confirmar que una solicitud de rastreo procede genuinamente de ese proveedor y no de un bot que suplanta la identidad de GPTBot.
Paso 2: Filtra tus logs de acceso
El comando exacto depende de tu formato de log, pero la lógica es la misma: busca la cadena de user-agent en tu archivo de log de acceso.
Para un log de acceso estándar de Apache o Nginx, un enfoque básico con grep funciona para una comprobación rápida:
grep -i "GPTBot" /var/log/nginx/access.log
grep -i "ClaudeBot" /var/log/nginx/access.log
grep -i "PerplexityBot" /var/log/nginx/access.log
Para un panorama más amplio de todos los bots de IA en un solo paso:
grep -iE "GPTBot|OAI-SearchBot|ClaudeBot|PerplexityBot|GoogleOther|Google-CloudVertexBot|Applebot-Extended|meta-externalagent" /var/log/nginx/access.log
Si usas una plataforma de agregación de logs (Datadog, Splunk, Cloudflare Logs, AWS CloudWatch), la misma lógica de filtrado se aplica en tu lenguaje de consulta. En Cloudflare Log Analytics, filtra por userAgent contains "GPTBot". En AWS CloudWatch Logs Insights:
fields @timestamp, cs-uri-stem, cs(User-Agent)
| filter cs(User-Agent) like /GPTBot|ClaudeBot|PerplexityBot/
| sort @timestamp desc
| limit 500
Lo que buscas en la salida:
- Qué páginas están siendo rastreadas (la URL en cada línea del log)
- Con qué frecuencia (los grupos de timestamps revelan la cadencia de rastreo)
- Los códigos de estado HTTP devueltos (200 significa que el bot recibió la página; 403 o 410 significa que fue bloqueado o que la página ya no existe; 429 significa que estás limitando su tasa de solicitudes)
- El campo referente (normalmente vacío para los rastreadores, pero ocasionalmente con valor)
Paso 3: Interpreta qué te dicen los datos de rastreo
El volumen bruto de rastreo es menos útil que el patrón de qué se está rastreando y qué no.
Páginas rastreadas con frecuencia: Son candidatas a tus páginas con mayor número de citaciones. Si GPTBot rastrea una página tres veces por semana pero nunca aparece en las citaciones de ChatGPT, el contenido está siendo recuperado pero no está ganando la coincidencia de relevancia para los prompts que usa tu audiencia. Eso es una señal de contenido, no técnica.
Páginas rastreadas una vez y no vueltas a visitar: Estas páginas pueden tener contenido delgado, poca autoridad, o contenido que no superó el umbral de relevancia al ser indexado. Actualizar y profundizar el contenido puede provocar una nueva visita.
Páginas nunca rastreadas: Comprueba si están bloqueadas en robots.txt, detrás de un inicio de sesión, renderizadas con JavaScript sin alternativa de servidor, o simplemente sin enlaces desde ningún sitio al que el bot tenga acceso.
Páginas que devuelven 4xx o 5xx al bot: Son bloqueos duros. Un 403 normalmente significa que tu CDN o WAF está rechazando al bot como una amenaza de seguridad. Muchas reglas de seguridad de CDN tratan los user-agents que no son navegadores como sospechosos y los bloquean por defecto. Si quieres que los motores de IA indexen una página, el bot debe recibir un 200.
Paso 4: Cruza los datos de rastreo con tu robots.txt
Antes de profundizar en los patrones de los logs, confirma qué dice tu robots.txt sobre cada bot de IA.
Abre tudomain.com/robots.txt y busca reglas delimitadas a los user-agents de los rastreadores de IA. Configuraciones habituales que encontrarás:
# Bloquear todo el rastreo de OpenAI
User-agent: GPTBot
Disallow: /
# Bloquear Common Crawl (usado por muchos datasets de entrenamiento de LLM)
User-agent: CCBot
Disallow: /
# Permitir todo (valor por defecto si no existen reglas específicas para IA)
User-agent: *
Allow: /
Algunas cosas que debes saber aquí. Si tu robots.txt bloquea GPTBot por completo, no verás ninguna entrada de GPTBot en tus logs de acceso (el bot respeta el Disallow). Si el bloqueo es parcial, por ejemplo bloqueando /private/ pero permitiendo todo lo demás, verás actividad de rastreo limitada a las rutas permitidas.
Bloquear un rastreador impide la indexación. También impide la citación. No puedes beneficiarte selectivamente de las citaciones de ChatGPT mientras bloqueas GPTBot. Si tu robots.txt fue configurado para bloquear rastreadores de IA durante un período de incertidumbre y desde entonces has cambiado de posición, elimina el bloqueo y permite al menos 30 días para que el rastreador vuelva a visitar y reindexe tu contenido antes de sacar conclusiones sobre las tasas de citación.
Paso 5: Mapea las páginas rastreadas con la cobertura de citaciones
Una vez que tienes una lista de páginas que los rastreadores de IA están visitando, la siguiente pregunta es: ¿están esas páginas siendo citadas en las respuestas de IA?
Aquí es donde una herramienta de monitoreo se vuelve esencial. Los datos de logs te dicen qué fue rastreado. No pueden decirte si el contenido fue usado en una respuesta de IA, cómo describió el modelo tu marca en esa respuesta, o cómo se compara tu tasa de citación con la de tus competidores.
Temso es el punto de partida directo aquí. Es la plataforma todo en uno de SEO para IA que rastrea share of voice, menciones de marca, citaciones y sentimiento en ocho motores de IA (ChatGPT, Perplexity, Gemini, Google AI Overviews, Google AI Mode, Grok, Microsoft Copilot y Meta AI) desde 89 $/mes. Exportas tu lista de URLs rastreadas del análisis de logs y luego compruebas esas URLs con los datos de citaciones de Temso para ver qué páginas rastreadas se están convirtiendo en citaciones y cuáles están siendo indexadas pero ignoradas.
Profound añade una capa que importa a mayor escala: análisis del tráfico de agentes a nivel de CDN. Su integración con GA4 y CDN te permite ver las solicitudes de agentes de IA en la capa de infraestructura, no solo mediante muestreo de logs, y correlaciona esos datos de rastreo con patrones de citación en su dataset de más de 9 motores. El punto de entrada efectivo para esta funcionalidad es de 399 $/mes (nivel Growth).
Ahrefs Brand Radar lo aborda desde el otro lado: su dataset de más de 405 millones de prompts te permite ver cuáles de tus páginas son citadas en seis plataformas de IA, para luego trabajar hacia atrás y entender si los datos de rastreo se alinean. Para equipos que ya trabajan dentro de Ahrefs, esta es la forma de menor fricción de conectar datos de rastreo y citaciones.
El rastreador de AI Overviews de Semrush cubre el lado específico de Google: monitoriza cuáles de tus páginas aparecen dentro de las respuestas de Google AI Overviews, permitiéndote cruzarlas con tu actividad de rastreo de GoogleOther en tus logs.
Paso 6: Configura el grupo de canales de GA4 para el tráfico de referencia de IA
Los datos de rastreo son el panorama upstream. Los datos de referencia de GA4 son el panorama downstream: cuando los motores de IA te citan y un usuario hace clic, ¿tu analítica lo registra correctamente?
Sin un grupo de canales personalizado en GA4, las sesiones de referido de IA se distribuyen entre los cubos de Direct y Referral. La configuración lleva unos 10 minutos.
En GA4, ve a Admin > Visualización de datos > Grupos de canales > Crear nuevo grupo de canales. Añade un canal llamado Referido de IA. Establece la condición así:
- Dimensión: Fuente de sesión
- Tipo de coincidencia: coincide con regex
- Valor:
chatgpt\.com|perplexity\.ai|gemini\.google\.com|copilot\.microsoft\.com
Guarda. Los datos se empiezan a poblar en 24 a 48 horas. El grupo de canales no rellena sesiones históricas.
La tabla principal de nombres de host para tu configuración de GA4:
| Motor de IA | Nombre de host de fuente de sesión en GA4 |
|---|---|
| ChatGPT | chatgpt.com |
| Perplexity | perplexity.ai |
| Google Gemini | gemini.google.com |
| Microsoft Copilot | copilot.microsoft.com |
| Claude (opcional) | claude.ai |
| You.com (opcional) | you.com |
Una vez que los datos empiezan a fluir, compara tu tasa de conversión de Referido de IA con la de Búsqueda Orgánica.
El benchmark: según los datos del propio sitio de Ahrefs, los visitantes de búsqueda por IA representaron solo el 0,5 % de las sesiones pero generaron el 12,1 % de los registros, una prima de conversión de aproximadamente 23x sobre la búsqueda orgánica tradicional (Patrick Stox, blog de Ahrefs, junio de 2025). El autor de Ahrefs aclaró expresamente que se trata de datos de un solo sitio del dominio de Ahrefs, no de una cifra representativa del sector. Tus números diferirán, pero el patrón de dirección es lo que estás evaluando.
Para una guía completa paso a paso de la configuración en GA4, incluyendo las reglas de escape de regex y cómo conectar el grupo de canales a eventos de conversión, consulta Cómo configurar un grupo de canales en GA4 que separe el tráfico de referencia de ChatGPT y Perplexity.
Paso 7: Conecta los dos flujos de datos
Con los logs de servidor y los grupos de canales de GA4 en funcionamiento, ahora tienes dos flujos de datos. Así encajan:
| Fuente de datos | Qué responde | Qué no puede responder |
|---|---|---|
| Logs de servidor (user-agent del bot) | ¿Qué páginas visitan los rastreadores de IA? ¿Con qué frecuencia? ¿Están bloqueados? | ¿Están esas páginas siendo citadas en las respuestas de IA? |
| Herramienta de visibilidad en IA (Temso, Profound, etc.) | ¿Qué prompts generan citaciones a tu dominio? ¿Qué competidores ganan? | ¿Fue rastreada realmente esta página antes de ser citada? |
| Grupo de canales Referido de IA en GA4 | ¿Cuánto tráfico llega de los motores de IA? ¿A qué tasa convierte? | Citaciones sin clic: menciones que nunca generan un clic |
La brecha entre el volumen de citaciones y el tráfico de referencia es tu pérdida por cero clics. Según el análisis de clickstream de Similarweb de 2025, las búsquedas que activan Google AI Overviews tienen una tasa media de cero clics del 83 %. Incluso una marca bien citada pierde la mayor parte de su potencial de referido por el comportamiento de cero clics. Por eso el análisis de rastreo, el monitoreo de citaciones y la configuración de GA4 son tres instrumentos distintos, no tres versiones de lo mismo.
Patrones habituales y qué significan
Alta frecuencia de rastreo, pocas citaciones. Tu contenido está siendo recuperado pero no está ganando la coincidencia de relevancia. Revisa las páginas que están siendo rastreadas: ¿están respondiendo la pregunta concreta que un comprador haría en un motor de IA? Pon la respuesta al inicio. Según el análisis de Kevin Indig de 2026 sobre 1,2 millones de respuestas de ChatGPT, el 44,2 % de las citaciones de ChatGPT provienen del primer 30 % del contenido de una página, un patrón que Indig denomina “ski ramp”. Si la respuesta a la pregunta de un comprador aparece a mitad de la página, es posible que el modelo no llegue a ella.
Sin actividad de rastreo para ciertas páginas. Empieza con robots.txt y las reglas WAF del CDN. Luego revisa los enlaces internos: los rastreadores de IA siguen enlaces. Si una página no tiene enlaces entrantes desde páginas ya rastreadas, es posible que el bot nunca la encuentre.
Actividad de rastreo pero sesiones de referido en GA4 casi nulas. Este es el estado normal para la mayoría de los sitios. La frecuencia de rastreo y el volumen de citaciones no se traducen directamente en clics de referido. La mayoría de las citaciones son sin clic: el motor de IA nombra tu marca en una respuesta, pero el usuario no hace clic. El grupo de canales de GA4 captura solo la fracción de citaciones que producen un clic. Por eso el monitoreo de citaciones y la analítica de referidos son complementarios, no intercambiables.
Caída repentina en la frecuencia de rastreo. Revisa los códigos de respuesta de tu servidor. Un período de errores 5xx, por ejemplo por sobrecarga del servidor, puede hacer que un rastreador de IA reduzca significativamente su cadencia de rastreo. Comprueba si un cambio en las reglas del CDN o una actualización de seguridad introdujo nuevos bloqueos alrededor del momento en que se produjo la caída.
Qué hacer con estos datos en tu flujo de trabajo de visibilidad en IA
El flujo de trabajo es el siguiente:
- Semanalmente: Extrae un segmento de logs, filtra por user-agents de bots de IA y comprueba si hay nuevos bloqueos 4xx. Añade las páginas recién bloqueadas a una cola de correcciones.
- Semanalmente: Ejecuta tu conjunto de prompts en tu herramienta de visibilidad en IA. Anota qué páginas están generando citaciones y cuáles no, luego cruza esa información con la lista de URLs rastreadas del paso uno.
- Mensualmente: Revisa tu grupo de canales Referido de IA en GA4. Calcula la tasa de conversión frente a Búsqueda Orgánica. Sigue la tendencia.
- Trimestralmente: Revisa robots.txt y las reglas WAF del CDN para detectar bloqueos involuntarios de rastreadores de IA. Confirma que las páginas clave de producto y categoría estén recibiendo visitas de rastreo regulares de GPTBot, ClaudeBot y PerplexityBot.
El resultado de este flujo de trabajo es una lista de correcciones priorizada: páginas que son rastreadas pero no citadas (problema de contenido), páginas que son citadas pero no rastreadas (anomalía de indexación que vale la pena investigar) y páginas que no son rastreadas ni citadas (brecha de infraestructura o de contenido).
Temso automatiza gran parte de este ciclo. Su flujo de trabajo integrado convierte las brechas de visibilidad en una cola de correcciones priorizada que cubre contenido, citaciones, percepción y precisión, y ejecuta esas correcciones dentro de la misma suscripción. Para equipos que quieren una sola herramienta que gestione el panorama de citaciones y referidos de extremo a extremo, es el punto de partida con menor fricción a 89 $/mes con los ocho motores de IA incluidos.
Para equipos enterprise que necesitan una visibilidad más profunda a nivel de infraestructura, la integración con CDN de Profound muestra patrones de tráfico de agentes que no son visibles mediante el muestreo estándar de logs, junto con su dataset de atribución de citaciones.
Para equipos que trabajan profundamente en Ahrefs, Ahrefs Brand Radar añade benchmarking de citaciones de IA sobre el conjunto de datos SEO existente, convirtiéndolo en la forma de menor esfuerzo de incorporar este análisis a un flujo de trabajo ya establecido.
Resumen: el panorama completo del rastreador de IA
Leer tus logs de servidor para detectar la actividad de los bots de IA es la mitad del análisis. La otra mitad consiste en conectar lo que esos bots rastrearon con lo que realmente citan, y conectar lo que citan con el tráfico de referencia que aparece en tus informes de GA4.
Ninguna capa es opcional. Los datos de rastreo sin datos de citaciones te dicen que el modelo vio tu contenido, pero no si lo usó. Los datos de citaciones sin datos de rastreo te dicen qué páginas están ganando, pero no por qué otras están perdiendo a nivel de infraestructura. Los datos de referido de GA4 sin ninguna de las dos te hablan de una pequeña fracción de las citaciones (las que producen un clic) y omiten la mayoría.
El panorama completo: logs de servidor (rastreo) + herramienta de visibilidad en IA (citaciones) + grupo de canales de GA4 (referido) = una lectura accionable de tu presencia de marca en IA de arriba a abajo.
Empieza por la capa de rastreo. Ejecuta el comando grep anterior contra los logs de acceso de esta semana y comprueba qué bots de IA están visitando tu sitio, qué están viendo y de qué están siendo bloqueados. Luego combina eso con Temso para cerrar el ciclo en citaciones, o consulta el ranking completo de herramientas de visibilidad en IA para encontrar la opción adecuada para la escala y el presupuesto de tu equipo.
Las definiciones de los términos usados en este artículo, incluyendo share of voice, tasa de citación y pérdida por cero clics, están en el glosario. La metodología de puntuación de las herramientas referenciadas está en /methodology.