Última atualização: setembro de 2026
Em 6 de agosto de 2026, a OpenAI lançou o GPT-5.6 (nas variantes Sol, Terra e Luna) como a nova família de modelos padrão do ChatGPT, segundo a OpenAI e a cobertura da Releasebot. Usuários dos planos Free e Go receberam o Luna, com chats de texto ilimitados e um novo botão Think. Usuários dos planos Plus e Pro receberam o Sol, com um controle deslizante de esforço de raciocínio construído em torno de uma promessa específica: fatos mais confiáveis.
Essa é uma frase de marketing vinda de um fornecedor de modelos. Mas também é um sinal. Quando a OpenAI coloca a confiabilidade factual no rótulo, a alucinação deixa de ser uma nota de rodapé de pesquisa e vira uma métrica que os compradores esperam que os fornecedores divulguem. A taxa de alucinação de marca é essa métrica, aplicada à sua própria marca.
Por que essa métrica existe
A maioria das respostas de IA sobre sua marca não carrega opinião nenhuma. Uma análise de fevereiro de 2026, com 1,8 milhão de respostas de IA que mencionavam marcas, descobriu que 80,6% eram neutras e descritivas, 18,4% positivas e cerca de 1% negativas.
Essa distribuição importa mais do que parece. Quando quatro em cada cinco respostas são descrições neutras e de aparência factual, os fatos dentro dessas respostas fazem o trabalho que o sentimento normalmente faria. Uma frase neutra que declara seu preço errado causa mais dano do que uma abertamente negativa, porque parece objetiva. O leitor não tem motivo para duvidar dela.
Um “fato” errado dito com confiança, repetido em respostas amostradas suficientes, define como a IA descreve sua marca por meses. A taxa de alucinação é como você identifica isso antes que um comprador o faça.
A fórmula
Rode um conjunto fixo de prompts relevantes para a marca nos mecanismos que você quer acompanhar. Para cada resposta, confira cada alegação factual sobre sua marca contra sua própria fonte de verdade atual: sua página de preços, sua documentação de produto, sua página de liderança, sua página de conformidade. Marque a resposta como alucinada se qualquer alegação falhar nessa checagem.
Um exemplo prático
Digamos que você rode 12 prompts sobre sua marca, 10 vezes cada, no ChatGPT. Isso te dá 120 respostas amostradas.
| Prompt | Execuções amostradas | Respostas alucinadas | Exemplo de alegação falsa |
|---|---|---|---|
| ”Quanto custa a [Marca]?“ | 10 | 4 | Declara um plano de preços descontinuado |
| ”Quais recursos a [Marca] tem?“ | 10 | 2 | Alega um recurso que nunca foi lançado |
| ”Quem fundou a [Marca]?“ | 10 | 1 | Aponta um ex-executivo como CEO atual |
| ”A [Marca] é compatível com SOC 2?“ | 10 | 3 | Declara que não há certificação quando existe uma |
| ”Como a [Marca] se compara à [concorrente]?“ | 10 | 0 | Nenhum erro factual encontrado |
| Demais 7 prompts (10 execuções cada) | 70 | 5 | Mistura de erros de preço e recursos |
| Total | 120 | 15 |
Taxa de alucinação = (15 ÷ 120) × 100 = 12,5%
Sozinho, esse número quase não te diz nada. O detalhamento por prompt e tipo de alegação te mostra onde corrigir o material de origem primeiro: neste exemplo, preço e status de conformidade são suas duas piores categorias, e é exatamente onde a decisão de um comprador se define.
Lista de verificação: tipos de alegação para auditar
Rode cada resposta amostrada contra estas cinco categorias de alegação, no mínimo. Cada uma corresponde a uma decisão que um comprador toma sem nunca visitar seu site.
- Preços. Nomes dos planos atuais, valores e condições de cobrança. O preço muda rápido e respostas desatualizadas são o tipo de alucinação mais comum.
- Recursos. O que o produto faz e não faz. Inclui tanto recursos inventados quanto recursos que você já removeu.
- Liderança. Fundadores e executivos atuais. Os mecanismos de IA costumam apontar um ex-CEO ou um fundador de uma empresa adquirida como se ainda liderassem a companhia.
- Status de conformidade e certificação. Alegações de SOC 2, HIPAA, GDPR e afins. Uma resposta errada aqui pode te tirar de uma lista de fornecedores pré-selecionados antes mesmo de um humano revisar o negócio.
- Integrações e parcerias. Quais ferramentas seu produto conecta. Uma alegação de integração falsa cria uma expectativa no comprador que você não consegue cumprir na implementação.
Registre cada falha com o prompt, o mecanismo, a data e a alegação falsa exata. Esse registro é o que transforma um único número de taxa de alucinação em um plano de correção de fonte acionável.
Redefina a linha de base a cada troca de modelo
Uma taxa de alucinação só é comparável a uma taxa de alucinação medida no mesmo modelo.
O GPT-5.6 se tornar o padrão do ChatGPT em 6 de agosto de 2026 redefiniu a linha de base para toda marca que acompanha respostas do ChatGPT. Uma taxa de 12% medida sob o modelo padrão antigo e uma taxa de 8% medida sob o Sol ou o Luna não são prova de que seu conteúdo melhorou. São prova de que o modelo mudou.
Trate isso como um registro contínuo, não uma anotação pontual. Toda vez que o ChatGPT, o Perplexity, o Google AI Overviews, o Gemini ou o Microsoft Copilot trocar um modelo padrão, adicione uma linha, rode seu conjunto de prompts de novo e redefina a data de início na sua linha de tendência. O protocolo completo de redefinição da linha de base, incluindo uma lista de verificação passo a passo para isolar um efeito de modelo de uma correção de conteúdo real, está em Como auditar se o ChatGPT descreve sua marca do jeito que você quer.
Para onde essa tendência está indo
A OpenAI não é a única fornecedora prestes a competir nisso. Assim que um grande laboratório divulgar a confiabilidade factual como recurso de destaque, espere que a taxa de alucinação vire um número testado e comparado publicamente entre os mecanismos, do jeito que a latência e a janela de contexto viraram pontos de comparação antes dela. As marcas que já tiverem uma linha de base de taxa de alucinação antes que essa comparação se torne padrão vão ser as que conseguem sustentar suas alegações com um número.
Comece a acompanhar agora, não depois que o primeiro benchmark público te forçar a isso.
Ferramentas que acompanham isso
AthenaHQ divulga a detecção de alegações de marca e alucinações como um recurso próprio, feito para equipes que querem uma resposta direta para “a IA declarou algo falso sobre nós” sem precisar construir o pipeline de auditoria sozinhas.
Evertune roda cada prompt até 100 vezes por modelo antes de divulgar um número, o nível de rigor de amostragem que uma taxa de alucinação precisa para ser mais do que um chute. É esse volume que torna os painéis de precisão dela estatisticamente defensáveis, e não apenas indicativos.
Temso inclui monitoramento de alucinação e precisão em todos os planos, a partir de $89/mês, dentro de uma plataforma tudo-em-um que também acompanha share of voice, sentimento e citações. É ideal para equipes que querem a checagem de precisão na mesma assinatura que já entrega a correção de conteúdo.
Profound oferece detecção no nível da alegação em escala empresarial, com atribuição de citação profunda o suficiente para rastrear uma alegação alucinada até o material de origem que provavelmente a gerou. É indicado para equipes que reportam a taxa de alucinação para um conselho.
A comparação completa de como cada plataforma lida com precisão e monitoramento no nível da alegação está em /rankings/ai-visibility-tools. Termos relacionados, incluindo grounding e share of voice, estão definidos em /glossary.
Rode a fórmula acima na sua própria marca esta semana: de 10 a 12 prompts, 10 execuções cada, checados contra seus preços, recursos, liderança e status de conformidade atuais. Se o número vier mais alto do que você esperava, a Temso acompanha a taxa de alucinação junto com o resto das suas métricas de visibilidade em IA e transforma cada alegação sinalizada em uma tarefa de correção de fonte, a partir de $89/mês.