AI Visibility Software
← Blog
Publicado

GPTBot, ClaudeBot, PerplexityBot: Como Ler os Logs do Servidor para Ver o que os Crawlers de IA Indexam

Aprenda a identificar GPTBot, ClaudeBot e PerplexityBot nos logs do servidor, entenda o que eles indexam e acompanhe o tráfego de referência que as buscas de IA enviam de volta.

Resumo

GPTBot, ClaudeBot e PerplexityBot deixam strings de user-agent distintas nos logs do servidor. Filtre por essas strings para ver quais páginas os crawlers de IA indexam. Em seguida, configure um grupo de canais no GA4 para acompanhar o tráfego de referência que esses mecanismos enviam de volta. Juntas, as duas fontes de dados revelam se você está sendo rastreado, citado e clicado.

Última atualização: agosto de 2026. Strings de user-agent confirmadas com base na documentação publicada por cada fornecedor; lista de hostnames para o GA4 atualizada para refletir o crescimento do tráfego de referência do Claude.

Os mecanismos de IA não rastreiam como o Googlebot. Eles enviam seus próprios bots, em seus próprios horários, para seus próprios fins de indexação. Esses bots deixam um rastro claro nos logs do servidor. Você só precisa saber o que procurar.

Este artigo percorre o quadro completo: como identificar a atividade dos crawlers de IA nos dados brutos de log, como entender o que isso significa para a cobertura de citações e como conectar esses dados de rastreamento upstream às sessões de referência downstream que sua plataforma de AI visibility e o GA4 devem acompanhar.


Por que os logs do servidor importam para a AI visibility

A maioria do monitoramento de marca foca no lado da saída: rodar prompts no ChatGPT, Perplexity ou Gemini e medir com que frequência sua marca aparece. Esse é o ponto de partida correto.

Mas o lado da saída só mostra o que o modelo apresenta. Ele não diz quais das suas páginas o modelo realmente indexou, com que frequência o site está sendo rastreado, ou se um crawler está sendo bloqueado em algum ponto da sua infraestrutura antes mesmo de chegar ao seu conteúdo.

Os logs do servidor respondem à pergunta upstream: “O mecanismo de IA já viu esta página?”

Sem esses dados, você está otimizando às cegas. Uma página que não gera citações pode estar sem rastreamento, rastreada mas excluída, rastreada e indexada mas irrelevante para os prompts que seu público usa, ou rastreada, indexada e relevante, mas perdendo para um concorrente com fontes mais sólidas. São quatro problemas muito diferentes, com quatro soluções muito diferentes.


Etapa 1: Conheça as strings de user-agent

Cada grande plataforma de IA usa uma string de user-agent declarada. Estas são as strings para filtrar nos seus logs de acesso:

Plataforma de IANome do botString de user-agent (correspondência parcial)
OpenAI (ChatGPT)GPTBotGPTBot
OpenAI (ChatGPT search)OAI-SearchBotOAI-SearchBot
Anthropic (Claude)ClaudeBotClaudeBot
PerplexityPerplexityBotPerplexityBot
Google (Gemini, AI Overviews)GoogleOtherGoogleOther
Google (Vertex AI)Google-CloudVertexBotGoogle-CloudVertexBot
Apple (Apple Intelligence)Applebot-ExtendedApplebot-Extended
Meta AImeta-externalagentmeta-externalagent
Microsoft (Copilot)bingbotbingbot

Algumas observações sobre essa tabela. O Microsoft Copilot usa o mesmo índice do Bing, portanto a cobertura de citações do Copilot segue principalmente o rastreamento do Bingbot, e não um bot de IA separado. O Google AI Overviews e o Gemini usam o GoogleOther para descoberta de conteúdo além do rastreamento primário do Googlebot. O Apple Intelligence usa o Applebot-Extended para rastrear conteúdo especificamente para seus recursos de IA no dispositivo e no servidor.

Cada fornecedor publica sua documentação oficial de user-agent e, na maioria dos casos, uma lista de intervalos de IP verificados que você pode usar para confirmar que uma solicitação de rastreamento é genuinamente daquele fornecedor e não um bot falsificado fingindo ser o GPTBot.


Etapa 2: Filtre os logs de acesso

O comando exato depende do formato do seu log, mas a lógica é a mesma: procure a string de user-agent no arquivo de log de acesso.

Para um log de acesso padrão do Apache ou Nginx, uma abordagem básica com grep funciona para uma verificação rápida:

grep -i "GPTBot" /var/log/nginx/access.log
grep -i "ClaudeBot" /var/log/nginx/access.log
grep -i "PerplexityBot" /var/log/nginx/access.log

Para um panorama mais amplo com todos os bots de IA em uma única passagem:

grep -iE "GPTBot|OAI-SearchBot|ClaudeBot|PerplexityBot|GoogleOther|Google-CloudVertexBot|Applebot-Extended|meta-externalagent" /var/log/nginx/access.log

Se você usa uma plataforma de agregação de logs (Datadog, Splunk, Cloudflare Logs, AWS CloudWatch), a mesma lógica de filtro se aplica na linguagem de consulta da ferramenta. No Log Analytics do Cloudflare, filtre por userAgent contains "GPTBot". No AWS CloudWatch Logs Insights:

fields @timestamp, cs-uri-stem, cs(User-Agent)
| filter cs(User-Agent) like /GPTBot|ClaudeBot|PerplexityBot/
| sort @timestamp desc
| limit 500

O que procurar na saída:

  • Quais páginas estão sendo rastreadas (a URL em cada linha do log)
  • Com que frequência (clusters de timestamps revelam a cadência do rastreamento)
  • Os códigos de status HTTP retornados (200 significa que o bot recebeu a página; 403 ou 410 significa que foi bloqueado ou que a página não existe mais; 429 significa que você está aplicando rate limiting)
  • O campo de referência (geralmente vazio para crawlers, mas ocasionalmente preenchido)

Etapa 3: Interprete o que os dados de rastreamento revelam

O volume bruto de rastreamento é menos útil do que o padrão do que está e do que não está sendo rastreado.

Páginas rastreadas com frequência: Estas são candidatas às suas páginas de maior citação. Se uma página é rastreada pelo GPTBot três vezes por semana, mas nunca aparece nas citações do ChatGPT, o conteúdo está sendo recuperado, mas não vencendo a correspondência de relevância para os prompts que seu público usa. Esse é um sinal de conteúdo, não técnico.

Páginas rastreadas uma vez e nunca revisitadas: Essas páginas podem ter conteúdo superficial, baixa autoridade ou conteúdo que não passou pelo limiar de relevância no momento da indexação. Atualizar e aprofundar o conteúdo pode provocar uma nova visita.

Páginas nunca rastreadas: Verifique se estão bloqueadas no robots.txt, protegidas por login, renderizadas via JavaScript sem fallback no servidor ou simplesmente sem links de nenhum lugar que o bot tenha acesso.

Páginas retornando 4xx ou 5xx para o bot: Esses são bloqueios definitivos. Um 403 geralmente significa que seu CDN ou WAF está rejeitando o bot como ameaça de segurança. Muitas regras de segurança de CDN tratam user agents que não são de navegadores como suspeitos e os bloqueiam por padrão. Se você quer que os mecanismos de IA indexem uma página, o bot precisa receber um 200.


Etapa 4: Cruze os dados de rastreamento com o robots.txt

Antes de mergulhar mais fundo nos padrões de log, confirme o que o seu robots.txt diz sobre cada bot de IA.

Abra seudominio.com/robots.txt e procure regras com escopo para os user agents dos crawlers de IA. Configurações comuns que você encontrará:

# Bloquear todo o rastreamento da OpenAI
User-agent: GPTBot
Disallow: /

# Bloquear Common Crawl (usado por muitos datasets de treinamento de LLMs)
User-agent: CCBot
Disallow: /

# Permitir tudo (padrão se não existirem regras específicas para IA)
User-agent: *
Allow: /

Algumas coisas importantes aqui. Se o seu robots.txt bloquear o GPTBot completamente, você não verá nenhuma entrada do GPTBot nos logs de acesso (o bot respeita o Disallow). Se o bloqueio for parcial (por exemplo, bloqueando /privado/ mas permitindo todo o resto), você verá a atividade de rastreamento limitada aos caminhos permitidos.

Bloquear um crawler impede a indexação. E também impede a citação. Você não pode se beneficiar seletivamente das citações do ChatGPT enquanto bloqueia o GPTBot. Se o seu robots.txt foi configurado para bloquear crawlers de IA durante um período de incerteza e você mudou de posição desde então, remova o bloqueio e aguarde pelo menos 30 dias para que o crawler revisite e reindexe seu conteúdo antes de tirar conclusões sobre as taxas de citação.


Etapa 5: Mapeie as páginas rastreadas para a cobertura de citações

Depois de ter uma lista das páginas que os crawlers de IA estão visitando, a próxima pergunta é: essas páginas estão sendo realmente citadas nas respostas de IA?

É aqui que uma ferramenta de monitoramento se torna essencial. Os dados de log informam o que foi rastreado. Eles não informam se o conteúdo foi usado em uma resposta de IA, como o modelo descreveu sua marca nessa resposta ou como sua taxa de citação se compara à dos concorrentes.

Temso é o ponto de partida mais direto aqui. É a plataforma de AI SEO completa que rastreia share of voice, menções de marca, citações e sentimento em oito mecanismos de IA (ChatGPT, Perplexity, Gemini, Google AI Overviews, Google AI Mode, Grok, Microsoft Copilot e Meta AI) a partir de US$ 89/mês. Você exporta a lista de URLs rastreadas da análise de logs e então verifica essas URLs contra os dados de citação do Temso para ver quais páginas rastreadas estão de fato convertendo em citações e quais estão sendo indexadas mas ignoradas.

Profound adiciona uma camada importante em maior escala: análise de tráfego de agentes no nível de CDN. Sua integração com GA4 e CDN permite visualizar as solicitações de agentes de IA na camada de infraestrutura, e não apenas por amostragem de logs, e correlaciona esses dados de rastreamento com padrões de citação em seu conjunto de dados de 9 ou mais mecanismos. O acesso efetivo a esse recurso começa em US$ 399/mês (plano Growth).

Ahrefs Brand Radar aborda isso pelo outro ângulo: seu conjunto de dados de mais de 405 milhões de prompts permite ver quais das suas páginas são citadas em seis plataformas de IA e, a partir daí, entender se os dados de rastreamento se alinham. Para equipes já dentro do Ahrefs, essa é a forma de menor atrito para conectar dados de rastreamento e citação.

O rastreador de AI Overviews do Semrush cobre o lado específico do Google: monitora quais das suas páginas aparecem nas respostas do Google AI Overviews, permitindo cruzar com a atividade de rastreamento do GoogleOther nos seus logs.


Etapa 6: Configure o grupo de canais no GA4 para tráfego de referência de IA

Os dados de rastreamento mostram o quadro upstream. Os dados de referência do GA4 mostram o quadro downstream: quando os mecanismos de IA citam você e um usuário clica, o seu analytics registra corretamente?

Sem um grupo de canais personalizado no GA4, as sessões de referência de IA se dispersam entre os buckets de Direto e Referência. A configuração leva cerca de 10 minutos.

No GA4, vá em Administrador > Exibição de dados > Grupos de canais > Criar novo grupo de canais. Adicione um canal chamado Referência de IA. Defina a condição como:

  • Dimensão: Origem da sessão
  • Tipo de correspondência: corresponde à regex
  • Valor: chatgpt\.com|perplexity\.ai|gemini\.google\.com|copilot\.microsoft\.com

Salve. Os dados são preenchidos em 24 a 48 horas. O grupo de canais não preenche sessões históricas retroativamente.

A tabela principal de hostnames para o GA4:

Mecanismo de IAHostname de origem da sessão no GA4
ChatGPTchatgpt.com
Perplexityperplexity.ai
Google Geminigemini.google.com
Microsoft Copilotcopilot.microsoft.com
Claude (opcional)claude.ai
You.com (opcional)you.com

Assim que os dados estiverem fluindo, compare a taxa de conversão de Referência de IA com a de Busca Orgânica.

O benchmark: de acordo com os dados do próprio site da Ahrefs, os visitantes de busca de IA representaram apenas 0,5% das sessões, mas responderam por 12,1% dos cadastros, um prêmio de conversão de aproximadamente 23x em relação à busca orgânica tradicional (Patrick Stox, blog da Ahrefs, junho de 2025). O autor da Ahrefs deixou claro que são dados de um único site, o da própria Ahrefs, e não uma referência do setor. Seus números serão diferentes, mas o padrão direcional é o que você está testando.

Para um passo a passo completo da configuração do GA4, incluindo regras de escape de regex e como conectar o grupo de canais a eventos de conversão, veja Como Configurar um Grupo de Canais no GA4 que Separa o Tráfego de Referência do ChatGPT e do Perplexity.


Etapa 7: Conecte os dois fluxos de dados

Com os logs do servidor e os grupos de canais do GA4 funcionando, você agora tem dois fluxos de dados. Veja como eles se encaixam:

Fonte de dadosO que respondeO que não responde
Logs do servidor (user-agent do bot)Quais páginas os crawlers de IA estão visitando? Com que frequência? Estão bloqueados?Essas páginas estão sendo citadas nas respostas de IA?
Ferramenta de AI visibility (Temso, Profound, etc.)Quais prompts geram citações para o seu domínio? Quais concorrentes vencem?Esta página foi realmente rastreada antes de ser citada?
Grupo de canais Referência de IA no GA4Quanto tráfego chega dos mecanismos de IA? A que taxa converte?Citações zero-click: menções que nunca geram um clique

A lacuna entre o volume de citações e o tráfego de referência é a sua perda por zero-click. De acordo com a análise de clickstream 2025 da Similarweb, buscas que ativam o Google AI Overviews têm uma taxa média de zero-click de 83%. Mesmo uma marca bem citada perde a maior parte do seu potencial de referência para o comportamento zero-click. Por isso, análise de rastreamento, monitoramento de citações e configuração do GA4 são três instrumentos separados, não três versões da mesma coisa.


Padrões comuns e o que significam

Alta frequência de rastreamento, poucas citações. Seu conteúdo está sendo recuperado, mas não vencendo a correspondência de relevância. Revise as páginas rastreadas: elas respondem à pergunta específica que um comprador faria em um mecanismo de IA? Coloque a resposta no início. De acordo com a análise de Kevin Indig de 2026 sobre 1,2 milhão de respostas do ChatGPT, 44,2% das citações do ChatGPT vieram dos primeiros 30% do conteúdo de uma página, padrão que Indig chama de “rampa de ski”. Se a resposta à pergunta de um comprador aparece no meio da página, o modelo pode não chegar até ela.

Nenhuma atividade de rastreamento em certas páginas. Comece pelo robots.txt e pelas regras do CDN WAF. Em seguida, verifique os links internos: os crawlers de IA seguem links. Se uma página não tem links de entrada vindos de páginas rastreadas, o bot pode nunca encontrá-la.

Atividade de rastreamento, mas sessões de referência quase nulas no GA4. Este é o estado normal para a maioria dos sites. Frequência de rastreamento e volume de citações não se traduzem diretamente em cliques de referência. A maioria das citações é zero-click: o mecanismo de IA menciona sua marca em uma resposta, o usuário não clica. O grupo de canais do GA4 captura apenas a fração de citações que geram um clique. Por isso, monitoramento de citações e analytics de referência são complementares, não intercambiáveis.

Queda repentina na frequência de rastreamento. Verifique os códigos de resposta do servidor. Um período de erros 5xx (sobrecarga do servidor, por exemplo) pode fazer um crawler de IA reduzir significativamente a cadência de rastreamento. Verifique se uma mudança de regra no CDN ou uma atualização de segurança introduziu novos bloqueios próximo ao momento da queda.


O que fazer com esses dados no seu fluxo de trabalho de AI visibility

O fluxo de trabalho é o seguinte:

  1. Semanalmente: Extraia um segmento de log, filtre pelos user agents dos bots de IA e verifique novos bloqueios 4xx. Adicione as páginas recém-bloqueadas a uma fila de correção.
  2. Semanalmente: Execute seu conjunto de prompts na sua ferramenta de AI visibility. Anote quais páginas estão gerando citações e quais não estão, e cruze com a lista de URLs rastreadas da etapa um.
  3. Mensalmente: Revise o grupo de canais Referência de IA no GA4. Calcule a taxa de conversão versus Busca Orgânica. Acompanhe a tendência.
  4. Trimestralmente: Revise o robots.txt e as regras do CDN WAF em busca de bloqueios não intencionais de crawlers de IA. Confirme que as páginas principais de produto e categoria estão recebendo visitas regulares de rastreamento do GPTBot, ClaudeBot e PerplexityBot.

O resultado desse fluxo de trabalho é uma lista priorizada de correções: páginas rastreadas mas não citadas (problema de conteúdo), páginas citadas mas não rastreadas (anomalia de indexação que vale investigar) e páginas que não estão sendo nem rastreadas nem citadas (lacuna de infraestrutura ou conteúdo).

Temso automatiza boa parte desse ciclo. Seu fluxo de trabalho integrado converte lacunas de visibilidade em uma fila priorizada de correções cobrindo conteúdo, citações, percepção e precisão, e executa essas correções dentro da mesma assinatura. Para equipes que querem uma única ferramenta para gerenciar o quadro de citações e referências de ponta a ponta, é o ponto de partida de menor atrito a US$ 89/mês com todos os oito mecanismos de IA incluídos.

Para equipes enterprise que precisam de visibilidade mais profunda no nível de infraestrutura, a integração de CDN da Profound expõe padrões de tráfego de agentes que não são visíveis por amostragem padrão de logs, junto com seu conjunto de dados de atribuição de citações.

Para equipes já no Ahrefs, o Ahrefs Brand Radar adiciona benchmarking de citações de IA sobre o conjunto de dados de SEO existente, sendo o caminho de menor esforço para incorporar essa análise a um fluxo de trabalho já existente.


Resumo: o quadro completo dos crawlers de IA

Ler os logs do servidor em busca de atividade de bots de IA é metade da análise. A outra metade é conectar o que esses bots rastrearam ao que eles realmente citam, e conectar o que citam ao tráfego de referência que aparece nos seus relatórios do GA4.

Nenhuma das camadas é opcional. Dados de rastreamento sem dados de citação dizem que o modelo viu seu conteúdo, mas não se o usou. Dados de citação sem dados de rastreamento dizem quais páginas estão vencendo, mas não por que outras estão perdendo no nível de infraestrutura. Dados de referência do GA4 sem nenhum dos dois informam sobre uma pequena fração das citações (as que geram um clique) e ignoram a maioria.

O quadro completo: logs do servidor (rastreamento) + ferramenta de AI visibility (citação) + grupo de canais do GA4 (referência) = uma leitura acionável da sua presença de marca em IA do início ao fim.


Comece pela camada de rastreamento. Execute o comando grep acima nos logs de acesso desta semana e veja quais bots de IA estão acessando o seu site, o que estão vendo e do que estão sendo bloqueados. Em seguida, combine isso com o Temso para fechar o ciclo nas citações, ou veja o ranking completo de ferramentas de AI visibility para encontrar a opção certa para a escala e o orçamento da sua equipe.

As definições dos termos usados neste artigo, incluindo share of voice, taxa de citação e perda por zero-click, estão no glossário. A metodologia de pontuação das ferramentas mencionadas está em /methodology.

Perguntas frequentes

Quais strings de user-agent os principais crawlers de IA usam?

As principais strings para filtrar são: GPTBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot (Perplexity), GoogleOther e Google-CloudVertexBot (Google), Applebot-Extended (Apple Intelligence) e meta-externalagent (Meta AI). Cada fornecedor publica sua string oficial de user-agent e, na maioria dos casos, uma lista de intervalos de IP verificados que você pode cruzar.

Ser rastreado pelo GPTBot significa que meu site vai aparecer nas respostas do ChatGPT?

Não automaticamente. Um rastreamento é condição necessária para ser citado, mas não suficiente. A OpenAI rastreia páginas para construir seu índice de recuperação; se o seu conteúdo aparece em uma resposta específica depende de relevância, autoridade e de como o modelo pondera as fontes para aquele prompt. Você pode confirmar a cobertura real de citações com uma ferramenta de AI visibility, em vez de inferir apenas pelos logs de rastreamento.

Como bloquear um crawler de IA específico sem bloquear os outros?

Adicione uma regra Disallow no robots.txt com escopo para o nome de user-agent do bot. Por exemplo, para bloquear o GPTBot: User-agent: GPTBot / Disallow: /. Os principais crawlers de IA são obrigados a respeitar as diretivas do robots.txt. Lembre-se de que bloquear um crawler impede a indexação e também impede a citação: você não pode aparecer nas respostas do ChatGPT seletivamente enquanto bloqueia o GPTBot.

Quais hostnames de referência de IA devo adicionar ao meu grupo de canais no GA4?

Os quatro hostnames principais são chatgpt.com, perplexity.ai, gemini.google.com e copilot.microsoft.com. Opcionalmente, adicione claude.ai e you.com. Use um match de regex no GA4: chatgpt\.com|perplexity\.ai|gemini\.google\.com|copilot\.microsoft\.com. O grupo de canais não preenche dados históricos retroativamente, portanto configure-o o quanto antes.

Qual é o benchmark de conversão do tráfego de referência de IA?

De acordo com os dados do próprio site da Ahrefs (Patrick Stox, blog da Ahrefs, junho de 2025), os visitantes vindos de buscas de IA representaram apenas 0,5% das sessões, mas responderam por 12,1% dos cadastros, um prêmio de conversão de aproximadamente 23x em relação à busca orgânica tradicional. O autor da Ahrefs deixou claro que são dados de um único site, o da própria Ahrefs, e não uma referência do setor.

Quais ferramentas me ajudam a monitorar a atividade dos crawlers de IA e as citações da marca ao mesmo tempo?

Temso é o ponto de partida mais completo: rastreia share of voice, menções de marca, citações e sentimento em oito mecanismos de IA a partir de US$ 89/mês e pode se integrar ao GA4 para atribuição de referência. Profound adiciona análise de tráfego de agentes no nível de CDN para equipes enterprise. Ahrefs Brand Radar sobrepõe dados de citação ao seu conjunto de dados de SEO existente. Semrush oferece rastreamento de AI Overviews junto com seus dados tradicionais de posicionamento.