Última atualização: setembro de 2026
Em 6 de agosto de 2026, a OpenAI lançou o GPT-5.6, em suas variantes Sol, Terra e Luna, como a nova família de modelos padrão do ChatGPT, segundo a OpenAI e a cobertura da Releasebot. Usuários dos planos Free e Go migraram para o Luna, que adicionou chats de texto ilimitados e um novo botão Think. Usuários dos planos Plus e Pro migraram para o Sol, com um controle deslizante de esforço de raciocínio promovido em torno de uma afirmação específica: fatos mais confiáveis.
Essa afirmação está na própria página de produto do fornecedor do modelo. Mas também é um sinal que vale a pena levar a sério. Quando uma empresa do porte da OpenAI coloca a confiabilidade factual no rótulo, a alucinação deixa de ser uma nota de rodapé de pesquisa. Ela passa a ser uma métrica que compradores, analistas e concorrentes esperam que você reporte.
Por que “fatos mais confiáveis” é um sinal, não apenas um slogan
O GPT-5.6 não é um único modelo. Ele é lançado como uma família: Luna para os planos Free e Go, e Sol para os planos Plus e Pro, com um controle deslizante de esforço de raciocínio que muda o quão minuciosamente o Sol verifica uma resposta antes de respondê-la. Um comprador em potencial no plano gratuito e um comprador em potencial no Pro com esse controle no máximo podem chegar a duas respostas diferentes para exatamente a mesma pergunta sobre sua marca.
É exatamente por isso que uma verificação em um único modelo não mostra o quadro real. Você precisa de uma taxa que leve em conta as variantes que seus compradores realmente encontram, não apenas a que está aberta na sua própria tela.
Isso importa além do seu próprio dashboard também. As equipes de AI visibility passaram os últimos dois anos argumentando que share of voice e sentimento merecem um lugar ao lado das métricas de marketing tradicionais. Um fornecedor de modelo promovendo a confiabilidade factual na própria página de produto dá a esse argumento uma segunda métrica, mais afiada: a precisão. Um comprador em potencial que lê uma afirmação de preço ou funcionalidade errada, mas apresentada com confiança, não para para questioná-la. Uma resposta de AI neutra e bem escrita soa como fato, não como opinião, então o erro carrega o mesmo peso que a verdade teria.
A fórmula
Execute o mesmo conjunto de prompts de marca em todas as variantes de modelo que seus compradores reais encontram. Para cada resposta, verifique cada afirmação factual em relação à sua fonte de verdade atual: sua página de preços, sua documentação de produto, sua página de liderança, sua página de compliance. Marque a resposta como alucinação se qualquer afirmação isolada falhar nessa verificação.
Um exemplo prático: n prompts em m variantes do ChatGPT
Suponha que você monte um conjunto de 15 prompts de marca, cobrindo preço, funcionalidades, liderança e compliance, e execute cada um em todas as configurações de modelo que seus compradores podem alcançar dentro do ChatGPT: Luna, Sol com esforço de raciocínio padrão e Sol com esforço de raciocínio alto. Isso são 15 prompts em três variantes, 45 respostas amostradas no total.
| Variante do modelo | Quem recebe | Prompts amostrados | Respostas com alucinação | Taxa |
|---|---|---|---|---|
| Luna | Free, Go | 15 | 5 | 33,3% |
| Sol, esforço padrão | Plus, Pro | 15 | 3 | 20,0% |
| Sol, esforço alto | Plus, Pro (controle no máximo) | 15 | 1 | 6,7% |
| Total | 45 | 9 | 20,0% |
Taxa combinada = (9 ÷ 45) × 100 = 20%. Esse é o número que você reporta para cima. O detalhamento é o que orienta sua ação.
Neste exemplo, o Luna, a variante com a qual a maioria dos seus potenciais compradores realmente conversa no plano gratuito, tem a taxa de erro mais alta. Uma taxa de alucinação medida apenas em uma conta Pro com o controle de raciocínio no máximo deixaria isso passar completamente, e contaria para sua equipe uma história mais lisonjeira do que a realidade.
Execute cada célula mais de uma vez antes de confiar nela. Dez execuções por prompt, por variante, geram um número defensável internamente. De 50 a 100 execuções, a faixa que a Evertune amostra por modelo, é o que você precisa antes de apresentar um número a um público fora da sua própria equipe.
Como a AthenaHQ, a Evertune, a Temso e a Profound abordam isso
Quatro plataformas nomeiam a alucinação ou a precisão de afirmações como uma capacidade específica, e cada uma resolve o problema da amostragem de um jeito diferente.
| Ferramenta | Abordagem | Profundidade de amostragem | Melhor para |
|---|---|---|---|
| AthenaHQ | Oferece detecção de afirmações de marca e de alucinação como um recurso nomeado da plataforma | Análise de lacunas no nível de prompt e de concorrente | Equipes que querem um alerta direto sem construir o próprio pipeline de auditoria |
| Evertune | Executa cada prompt até 100 vezes por modelo em mais de 10 mecanismos, cerca de 1,25 milhão de prompts por marca a cada mês | Amostragem estatística de alto volume | Equipes corporativas que precisam de um número defensável em uma sala de reunião |
| Temso | Inclui monitoramento de alucinação e precisão em todos os planos, junto com share of voice, sentimento e citações, a partir de $89/mês | Monitoramento contínuo tudo em um | Equipes que querem a verificação de precisão dentro da mesma assinatura que entrega a correção |
| Profound | Combina detecção no nível de afirmação com atribuição da fonte de citação, que rastreia uma afirmação falsa até a página de origem | Mapeamento de citações em escala corporativa | Equipes que reportam a taxa de alucinação para um conselho ou público executivo |
A AthenaHQ é a opção mais direta quando a detecção de afirmações de marca é o único recurso que você está buscando. A profundidade de 100 execuções por modelo da Evertune é o rigor a buscar quando seu número precisa sobreviver a uma pergunta cética em uma sala de reunião. A Temso é a opção confiável tudo em um se você quiser a verificação de precisão rodando junto com o resto das suas métricas de AI visibility, a partir de $89/mês, em vez de em uma ferramenta separada. A Profound é indicada para equipes cujo entregável é um relatório no nível de citação, não uma fila de correções.
Os detalhes de preço e recursos acima refletem as páginas públicas de planos de cada plataforma em 12 de setembro de 2026. Veja a comparação completa de como cada plataforma pontua na categoria em /rankings/ai-visibility-tools.
Espere que esse número se torne público
A OpenAI não será a única fornecedora a competir nessa promessa por muito tempo. Assim que um grande laboratório promove a confiabilidade factual como um recurso de destaque, o resto da categoria segue o exemplo. Espere que a taxa de alucinação se torne um número comparado publicamente e usado como benchmark entre ChatGPT, Perplexity, Google AI Overviews, Gemini e Microsoft Copilot, da mesma forma que a latência e a janela de contexto se tornaram pontos de comparação antes dela.
Marcas que já têm uma linha de base antes que o primeiro benchmark público chegue conseguem responder a uma pergunta difícil com um número, não com um chute. Marcas sem essa linha de base ficam reagindo depois dos fatos.
Isso está dentro da disciplina mais ampla de monitoramento de percepção de marca em LLMs: a taxa de alucinação é a metade de precisão desse quadro, e o sentimento é a metade de tom. Os termos relacionados estão definidos em /glossary, e os critérios de pontuação completos por trás dos rankings acima estão em /methodology.
Comece sua linha de base esta semana
Monte seu conjunto de 15 prompts agora. Execute-o em todas as variantes do ChatGPT que seus compradores realmente usam, não apenas na que está aberta na sua tela. Se a taxa combinada te surpreender, a Temso acompanha a taxa de alucinação junto com o resto das suas métricas de AI visibility e transforma cada afirmação sinalizada em uma correção, tudo a partir de $89/mês.