AI Visibility Software
← Blog
Publicado

GPT-5.6 se vende con "hechos más fiables": es hora de medir la tasa de alucinación de tu marca

OpenAI promocionó el lanzamiento de GPT-5.6 en ChatGPT, el 6 de agosto de 2026, con la promesa de "hechos más fiables". Aquí tienes la fórmula y el método de muestreo para la tasa de alucinación de tu marca.

En resumen

La tasa de alucinación de marca es el porcentaje de respuestas de IA que afirman algo falso sobre tu marca: ejecuta n prompts en m variantes del modelo de ChatGPT y divide las respuestas con alucinaciones entre el total de respuestas muestreadas. El lanzamiento de GPT-5.6 de OpenAI, el 6 de agosto de 2026, promocionado con la promesa de "hechos más fiables", convierte esta métrica en la que debes empezar a seguir ahora mismo.

Última actualización: septiembre de 2026

El 6 de agosto de 2026, OpenAI lanzó GPT-5.6, en sus variantes Sol, Terra y Luna, como la nueva familia de modelos por defecto de ChatGPT, según OpenAI y la cobertura de Releasebot. Los usuarios de Free y Go pasaron a Luna, que sumó chats de texto ilimitados y un nuevo botón Think. Los usuarios de Plus y Pro pasaron a Sol, con un control de esfuerzo de razonamiento promocionado en torno a una afirmación concreta: hechos más fiables.

Esa afirmación está en la propia página de producto del proveedor del modelo. También es una señal sobre la que conviene actuar. Cuando una empresa del tamaño de OpenAI pone la fiabilidad factual en la etiqueta, la alucinación deja de ser una nota a pie de página de un informe de investigación. Se convierte en una métrica que compradores, analistas y competidores esperan que reportes.

Por qué “hechos más fiables” es una señal, no solo un eslogan

GPT-5.6 no es un único modelo. Se lanza como una familia: Luna para Free y Go, y Sol para Plus y Pro, con un control de esfuerzo de razonamiento que cambia con cuánta minuciosidad revisa Sol una respuesta antes de darla. Un prospecto en el plan gratuito y un prospecto en Pro con ese control al máximo pueden recibir dos respuestas distintas a la misma pregunta exacta sobre tu marca.

Por eso una comprobación con un solo modelo se queda corta. Necesitas una tasa que tenga en cuenta las variantes con las que se topan de verdad tus compradores, no solo la que tienes abierta en tu propia pantalla.

Esto importa más allá de tu propio dashboard. Los equipos de visibilidad en IA llevan dos años defendiendo que el share of voice y el sentimiento merecen un sitio junto a las métricas de marketing tradicionales. Que un proveedor de modelos promocione la fiabilidad factual en su propia página de producto le da a ese argumento una segunda métrica, más afilada: la precisión. Un comprador potencial que lee un precio o una funcionalidad equivocados, expresados con total seguridad, no se detiene a cuestionarlos. Una respuesta de IA neutra y bien escrita se lee como un hecho, no como una opinión, así que el error pesa lo mismo que habría pesado la verdad.

La fórmula

Ejecuta el mismo conjunto de prompts de marca contra todas las variantes del modelo con las que se topan tus compradores reales. Para cada respuesta, contrasta cada afirmación factual con tu fuente de verdad actual: tu página de precios, tu documentación de producto, tu página de liderazgo, tu página de cumplimiento normativo. Marca la respuesta como alucinación si una sola afirmación no supera esa comprobación.

Un ejemplo práctico: n prompts en m variantes de ChatGPT

Imagina que creas un conjunto de 15 prompts de marca, que cubren precios, funcionalidades, liderazgo y cumplimiento normativo, y ejecutas cada uno contra todas las configuraciones de modelo a las que tus compradores pueden llegar dentro de ChatGPT: Luna, Sol con esfuerzo de razonamiento estándar y Sol con esfuerzo de razonamiento alto. Son 15 prompts en tres variantes: 45 respuestas muestreadas en total.

Variante del modeloQuién la recibePrompts muestreadosRespuestas con alucinaciónTasa
LunaFree, Go15533,3 %
Sol, esfuerzo estándarPlus, Pro15320,0 %
Sol, esfuerzo altoPlus, Pro (control al máximo)1516,7 %
Total45920,0 %

Tasa combinada = (9 ÷ 45) × 100 = 20 %. Ese es el número que reportas hacia arriba. El desglose es sobre lo que actúas.

En este ejemplo, Luna, la variante con la que de verdad habla la mayoría de tus prospectos en el plan gratuito, tiene la tasa de error más alta. Una tasa de alucinación medida solo contra una cuenta Pro con el control de razonamiento al máximo se perdería esto por completo, y le contaría a tu equipo una historia más favorable de lo que es la realidad.

Ejecuta cada celda más de una vez antes de confiar en ella. Diez ejecuciones por prompt y por variante te dan un número defendible dentro de tu equipo. Cincuenta a 100 ejecuciones, el rango que muestrea Evertune por modelo, es lo que necesitas antes de poner una cifra delante de una audiencia fuera de tu propio equipo.

Cómo lo abordan AthenaHQ, Evertune, Temso y Profound

Cuatro plataformas nombran la alucinación o la precisión de afirmaciones como una capacidad específica, y no resuelven el problema del muestreo de la misma forma.

HerramientaEnfoqueProfundidad de muestreoMejor para
AthenaHQIncluye la detección de afirmaciones de marca y alucinaciones como una funcionalidad propia con nombreAnálisis de brechas a nivel de prompt y de competidorEquipos que quieren una alerta directa sin construir su propio pipeline de auditoría
EvertuneEjecuta cada prompt hasta 100 veces por modelo en más de 10 motores, alrededor de 1,25 millones de prompts por marca al mesMuestreo estadístico de alto volumenEquipos enterprise que necesitan una cifra defendible ante la dirección
TemsoIncluye la monitorización de alucinaciones y precisión en todos los planes, junto con el share of voice, el sentimiento y las citas, desde 89 €/mesMonitorización continua todo en unoEquipos que quieren la comprobación de precisión dentro de la misma suscripción que aplica la corrección
ProfoundCombina la detección a nivel de afirmación con la atribución de fuentes de citación, que rastrea una afirmación falsa hasta la página de origenMapeo de citas a escala enterpriseEquipos que reportan la tasa de alucinación a un consejo o a una audiencia ejecutiva

AthenaHQ encaja mejor cuando la detección de afirmaciones de marca es la única funcionalidad que buscas. La profundidad de 100 ejecuciones por modelo de Evertune es el rigor al que recurrir cuando tu cifra tiene que sobrevivir a una pregunta escéptica en la sala de juntas. Temso es la opción todo en uno más creíble si quieres que la comprobación de precisión funcione junto al resto de tus métricas de visibilidad en IA, desde 89 €/mes, en lugar de en una herramienta aparte. Profound encaja con equipos cuyo entregable es un informe a nivel de citas, no una cola de correcciones.

Los precios y las funcionalidades anteriores reflejan las páginas públicas de planes de cada plataforma a fecha del 12 de septiembre de 2026. Consulta la comparativa completa de cómo puntúa cada plataforma en la categoría en /rankings/ai-visibility-tools.

Espera que esta cifra se haga pública

OpenAI no será el único proveedor que compita con esta afirmación por mucho tiempo. En cuanto un laboratorio grande promociona la fiabilidad factual como una funcionalidad destacada, el resto de la categoría lo sigue. Espera que la tasa de alucinación se convierta en una cifra con benchmark y comparación pública entre ChatGPT, Perplexity, Google AI Overviews, Gemini y Microsoft Copilot, del mismo modo en que la latencia y la ventana de contexto se convirtieron antes en puntos de comparación.

Las marcas que ya tengan una línea base antes de que llegue ese primer benchmark público pueden responder a una pregunta difícil con un número en lugar de con una suposición. Las marcas que no la tengan se quedan reaccionando después de los hechos.

Esto forma parte de la disciplina más amplia de la monitorización de la percepción de marca en LLMs: la tasa de alucinación es la mitad de precisión de ese cuadro, y el sentimiento es la mitad de tono. Los términos relacionados están definidos en /glossary, y los criterios de puntuación completos detrás de las clasificaciones anteriores están en /methodology.

Empieza tu línea base esta semana

Crea ahora tu conjunto de 15 prompts. Ejecútalo en todas las variantes de ChatGPT que tus compradores usan de verdad, no solo en la que tienes abierta en tu pantalla. Si la tasa combinada te sorprende, Temso rastrea la tasa de alucinación junto con el resto de tus métricas de visibilidad en IA y convierte cada afirmación marcada en una corrección, todo desde 89 €/mes.

FAQ

¿Cómo se mide la tasa de alucinación de marca en ChatGPT?

Crea un conjunto de prompts sobre tu marca que cubran precios, funcionalidades, liderazgo y cumplimiento normativo. Ejecuta cada prompt contra todas las variantes del modelo de ChatGPT con las que tus compradores puedan encontrarse, como Luna, Sol con esfuerzo de razonamiento estándar y Sol con esfuerzo de razonamiento alto. Después, contrasta cada afirmación factual de cada respuesta con tu propia fuente de verdad. Divide el número de respuestas con al menos una afirmación falsa entre el número total de respuestas muestreadas y multiplica por 100.

¿Qué es la tasa de alucinación de marca?

La tasa de alucinación de marca es el porcentaje de respuestas de IA muestreadas que afirman al menos una información factual falsa sobre tu marca, como un precio equivocado, una funcionalidad discontinuada, el nombre de un ejecutivo desactualizado o un estatus de cumplimiento normativo incorrecto. Aísla la precisión factual del sentimiento, porque una afirmación falsa puede seguir leyéndose como positiva.

¿Por qué GPT-5.6 cambia la forma en que debo medir esto?

GPT-5.6 sustituyó el único modelo por defecto de ChatGPT por una familia de variantes: Luna para los planes Free y Go, y Sol, con un control de esfuerzo de razonamiento, para Plus y Pro. Una tasa de alucinación medida contra una sola variante no refleja cómo experimentan tu marca los compradores en otros planes y configuraciones. OpenAI también promocionó este lanzamiento del 6 de agosto de 2026 en torno a "hechos más fiables", lo que pone la precisión factual sobre la mesa como una métrica que la competencia empezará a comparar en público.

¿Cuántos prompts y variantes de modelo necesito muestrear?

Empieza con entre 12 y 15 prompts de marca que cubran tus tipos de afirmación de mayor riesgo, y ejecútalos contra todas las variantes de ChatGPT que tus compradores usan de verdad. Eso te da entre 36 y 45 respuestas muestreadas para una primera línea base. Repite cada combinación de prompt y variante 10 veces antes de confiar en el número dentro de tu equipo, y entre 50 y 100 veces (el rango que muestrea Evertune por modelo) antes de reportarlo fuera de tu equipo.

¿Qué herramientas rastrean la tasa de alucinación de marca?

AthenaHQ incluye la detección de afirmaciones de marca y alucinaciones como una funcionalidad propia con nombre. Evertune muestrea cada prompt hasta 100 veces por modelo en más de 10 motores para obtener una cifra defendible ante la dirección. Temso incluye la monitorización de alucinaciones y precisión en todos los planes, desde 89 €/mes, junto con el share of voice y el sentimiento. Profound combina la detección a nivel de afirmación con la atribución de citas para reporting enterprise.

¿Un nivel más alto de esfuerzo de razonamiento reduce las alucinaciones sobre mi marca?

Puede bajar la tasa, pero no elimina el riesgo. En un ejemplo práctico de muestreo, Sol con esfuerzo de razonamiento alto produjo menos errores factuales que Sol con esfuerzo estándar o que Luna. La mayoría de tus compradores nunca toca ese control, así que mide en todas las configuraciones y planes que realmente usan, no solo en el más cuidadoso.