Última actualización: septiembre de 2026
El 6 de agosto de 2026, OpenAI lanzó GPT-5.6 (en sus variantes Sol, Terra y Luna) como la nueva familia de modelos predeterminada de ChatGPT, según OpenAI y la cobertura de Releasebot. Los usuarios de los planes Free y Go recibieron Luna, con chats de texto ilimitados y un nuevo botón Think. Los usuarios de Plus y Pro recibieron Sol, con un control deslizante de esfuerzo de razonamiento comercializado en torno a una promesa concreta: datos más fiables.
Esa es una frase de marketing de un proveedor de modelos. También es una señal. Cuando OpenAI pone la fiabilidad factual en la etiqueta, la alucinación deja de ser una nota a pie de página de investigación y pasa a ser una métrica que los compradores esperan que los proveedores reporten. La tasa de alucinación de marca es esa métrica, aplicada a tu propia marca.
Por qué existe esta métrica
La mayoría de las respuestas de IA sobre tu marca no llevan ninguna opinión. Un análisis de febrero de 2026 sobre 1,8 millones de respuestas de IA que mencionaban marcas encontró que el 80,6 % eran neutro-descriptivas, el 18,4 % positivas y alrededor del 1 % negativas.
Esa distribución importa más de lo que parece. Cuando cuatro de cada cinco respuestas son descripciones planas y con apariencia factual, los datos que contienen esas respuestas hacen el trabajo que normalmente haría el sentimiento. Una frase neutra que indica tu precio equivocado hace más daño que una abiertamente negativa, porque se lee como objetiva. El lector no tiene motivo para dudar de ella.
Un solo “dato” erróneo, dicho con seguridad y repetido en suficientes respuestas muestreadas, define cómo la IA describe tu marca durante meses. La tasa de alucinación es cómo lo detectas antes de que lo haga un comprador.
La fórmula
Ejecuta un conjunto fijo de prompts relevantes para tu marca en tus motores objetivo. Para cada respuesta, comprueba cada afirmación factual sobre tu marca contra tu propia fuente de verdad actual: tu página de precios, tu documentación de producto, tu página de liderazgo, tu página de cumplimiento. Marca la respuesta como alucinada si alguna afirmación no pasa esa comprobación.
Un ejemplo resuelto
Supón que ejecutas 12 prompts sobre tu marca, 10 veces cada uno, en ChatGPT. Eso te da 120 respuestas muestreadas.
| Prompt | Ejecuciones muestreadas | Respuestas alucinadas | Ejemplo de afirmación falsa |
|---|---|---|---|
| ”¿Cuánto cuesta [Marca]?“ | 10 | 4 | Indica un plan de precios ya retirado |
| ”¿Qué funciones tiene [Marca]?“ | 10 | 2 | Afirma una función que nunca se lanzó |
| ”¿Quién fundó [Marca]?“ | 10 | 1 | Nombra a un exejecutivo como CEO actual |
| ”¿[Marca] cumple con SOC 2?“ | 10 | 3 | Indica que no hay certificación cuando sí existe |
| ”¿Cómo se compara [Marca] con [competidor]?“ | 10 | 0 | No se encontró ningún error factual |
| Los 7 prompts restantes (10 ejecuciones cada uno) | 70 | 5 | Errores mixtos de precios y funciones |
| Total | 120 | 15 |
Tasa de alucinación = (15 ÷ 120) × 100 = 12,5 %
Esa única cifra, por sí sola, casi no te dice nada. El desglose por prompt y tipo de afirmación te indica qué material de origen corregir primero: en este ejemplo, precios y estado de cumplimiento son tus dos peores categorías, y es justo ahí donde se toma la decisión de un comprador.
Checklist: tipos de afirmaciones que auditar
Contrasta cada respuesta muestreada con estas cinco categorías de afirmaciones, como mínimo. Cada una corresponde a una decisión que un comprador toma sin visitar nunca tu sitio.
- Precios. Nombres de planes vigentes, importes y condiciones de facturación. Los precios cambian rápido y las respuestas desactualizadas son el tipo de alucinación más común.
- Funciones. Qué hace y qué no hace el producto. Incluye tanto funciones inventadas como funciones que ya has eliminado.
- Liderazgo. Fundadores y ejecutivos actuales. Los motores de IA muestran con frecuencia a un exCEO o a un fundador adquirido como si siguieran liderando la empresa.
- Estado de cumplimiento y certificación. Afirmaciones sobre SOC 2, HIPAA, RGPD y similares. Una respuesta equivocada aquí puede descartarte de una preselección de compras antes de que un humano revise siquiera el trato.
- Integraciones y alianzas. Con qué herramientas se conecta tu producto. Una afirmación falsa de integración crea en el comprador una expectativa que no puedes cumplir en la implementación.
Registra cada fallo con el prompt, el motor, la fecha y la afirmación falsa exacta. Ese registro es lo que convierte una simple cifra de tasa de alucinación en un plan de corrección de fuentes que puedes ejecutar.
Vuelve a fijar la línea base después de cada cambio de modelo
Una tasa de alucinación solo es comparable con otra tasa de alucinación medida en el mismo modelo.
Que GPT-5.6 se convirtiera en el modelo predeterminado de ChatGPT el 6 de agosto de 2026 reinició la línea base de toda marca que hace seguimiento de las respuestas de ChatGPT. Una tasa del 12 % medida con el antiguo modelo predeterminado y una tasa del 8 % medida con Sol o Luna no son prueba de que tu contenido mejoró. Son prueba de que el modelo cambió.
Trátalo como un registro vivo, no como una nota puntual. Cada vez que ChatGPT, Perplexity, Google AI Overviews, Gemini o Microsoft Copilot cambie de modelo predeterminado, añade una fila, vuelve a ejecutar tu conjunto de prompts y reinicia la fecha de inicio de tu línea de tendencia. El protocolo completo para volver a fijar la línea base, con una checklist paso a paso para aislar el efecto de un modelo de una mejora real de contenido, está en Cómo auditar si ChatGPT describe tu marca como tú quieres.
Hacia dónde se dirige esta métrica
OpenAI no es el único proveedor a punto de competir en esto. En cuanto un gran laboratorio comercialice la fiabilidad factual como función estrella, espera que la tasa de alucinación se convierta en una cifra de referencia comparada públicamente entre motores, tal como antes lo fueron la latencia y la ventana de contexto. Las marcas que ya tengan una línea base de tasa de alucinación antes de que esa comparación se vuelva habitual serán las que puedan respaldar sus afirmaciones con una cifra.
Empieza a hacer seguimiento ahora, no después de que el primer benchmark público te obligue a hacerlo.
Herramientas que hacen seguimiento de esto
AthenaHQ publica la detección de afirmaciones y alucinaciones de marca como una función con nombre propio, pensada para equipos que quieren una respuesta directa a “¿dijo la IA algo falso sobre nosotros?” sin construir ellos mismos el pipeline de auditoría.
Evertune ejecuta cada prompt hasta 100 veces por modelo antes de reportar una cifra, el nivel de rigor de muestreo que una tasa de alucinación necesita para ser algo más que una suposición. Ese volumen es lo que hace que sus paneles de precisión sean defendibles estadísticamente y no solo orientativos.
Temso incluye monitorización de alucinaciones y precisión en todos sus planes, desde 89 €/mes, dentro de una plataforma todo en uno que también hace seguimiento de share of voice, sentimiento y citas. Es ideal para equipos que quieren la comprobación de precisión en la misma suscripción que resuelve el contenido.
Profound ofrece detección a nivel de afirmación individual a escala empresarial, con una atribución de citas lo bastante profunda como para rastrear una afirmación alucinada hasta el material de origen que probablemente la produjo. Encaja con equipos que reportan la tasa de alucinación a su consejo.
La comparación completa de cómo cada plataforma gestiona la precisión y la monitorización a nivel de afirmación está en /rankings/ai-visibility-tools. Los términos relacionados, incluidos grounding y share of voice, están definidos en /glossary.
Aplica la fórmula anterior a tu propia marca esta semana: de 10 a 12 prompts, 10 ejecuciones cada uno, contrastados con tus precios, funciones, liderazgo y estado de cumplimiento actuales. Si la cifra es más alta de lo que esperabas, Temso hace seguimiento de la tasa de alucinación junto al resto de tus métricas de visibilidad en IA y convierte cada afirmación marcada en una tarea de corrección de fuente, desde 89 €/mes.