Última actualización: septiembre de 2026
El 6 de agosto de 2026, OpenAI lanzó GPT-5.6, en sus variantes Sol, Terra y Luna, como la nueva familia de modelos por defecto de ChatGPT, según OpenAI y la cobertura de Releasebot. Los usuarios de Free y Go pasaron a Luna, que sumó chats de texto ilimitados y un nuevo botón Think. Los usuarios de Plus y Pro pasaron a Sol, con un control de esfuerzo de razonamiento promocionado en torno a una afirmación concreta: hechos más fiables.
Esa afirmación está en la propia página de producto del proveedor del modelo. También es una señal sobre la que conviene actuar. Cuando una empresa del tamaño de OpenAI pone la fiabilidad factual en la etiqueta, la alucinación deja de ser una nota a pie de página de un informe de investigación. Se convierte en una métrica que compradores, analistas y competidores esperan que reportes.
Por qué “hechos más fiables” es una señal, no solo un eslogan
GPT-5.6 no es un único modelo. Se lanza como una familia: Luna para Free y Go, y Sol para Plus y Pro, con un control de esfuerzo de razonamiento que cambia con cuánta minuciosidad revisa Sol una respuesta antes de darla. Un prospecto en el plan gratuito y un prospecto en Pro con ese control al máximo pueden recibir dos respuestas distintas a la misma pregunta exacta sobre tu marca.
Por eso una comprobación con un solo modelo se queda corta. Necesitas una tasa que tenga en cuenta las variantes con las que se topan de verdad tus compradores, no solo la que tienes abierta en tu propia pantalla.
Esto importa más allá de tu propio dashboard. Los equipos de visibilidad en IA llevan dos años defendiendo que el share of voice y el sentimiento merecen un sitio junto a las métricas de marketing tradicionales. Que un proveedor de modelos promocione la fiabilidad factual en su propia página de producto le da a ese argumento una segunda métrica, más afilada: la precisión. Un comprador potencial que lee un precio o una funcionalidad equivocados, expresados con total seguridad, no se detiene a cuestionarlos. Una respuesta de IA neutra y bien escrita se lee como un hecho, no como una opinión, así que el error pesa lo mismo que habría pesado la verdad.
La fórmula
Ejecuta el mismo conjunto de prompts de marca contra todas las variantes del modelo con las que se topan tus compradores reales. Para cada respuesta, contrasta cada afirmación factual con tu fuente de verdad actual: tu página de precios, tu documentación de producto, tu página de liderazgo, tu página de cumplimiento normativo. Marca la respuesta como alucinación si una sola afirmación no supera esa comprobación.
Un ejemplo práctico: n prompts en m variantes de ChatGPT
Imagina que creas un conjunto de 15 prompts de marca, que cubren precios, funcionalidades, liderazgo y cumplimiento normativo, y ejecutas cada uno contra todas las configuraciones de modelo a las que tus compradores pueden llegar dentro de ChatGPT: Luna, Sol con esfuerzo de razonamiento estándar y Sol con esfuerzo de razonamiento alto. Son 15 prompts en tres variantes: 45 respuestas muestreadas en total.
| Variante del modelo | Quién la recibe | Prompts muestreados | Respuestas con alucinación | Tasa |
|---|---|---|---|---|
| Luna | Free, Go | 15 | 5 | 33,3 % |
| Sol, esfuerzo estándar | Plus, Pro | 15 | 3 | 20,0 % |
| Sol, esfuerzo alto | Plus, Pro (control al máximo) | 15 | 1 | 6,7 % |
| Total | 45 | 9 | 20,0 % |
Tasa combinada = (9 ÷ 45) × 100 = 20 %. Ese es el número que reportas hacia arriba. El desglose es sobre lo que actúas.
En este ejemplo, Luna, la variante con la que de verdad habla la mayoría de tus prospectos en el plan gratuito, tiene la tasa de error más alta. Una tasa de alucinación medida solo contra una cuenta Pro con el control de razonamiento al máximo se perdería esto por completo, y le contaría a tu equipo una historia más favorable de lo que es la realidad.
Ejecuta cada celda más de una vez antes de confiar en ella. Diez ejecuciones por prompt y por variante te dan un número defendible dentro de tu equipo. Cincuenta a 100 ejecuciones, el rango que muestrea Evertune por modelo, es lo que necesitas antes de poner una cifra delante de una audiencia fuera de tu propio equipo.
Cómo lo abordan AthenaHQ, Evertune, Temso y Profound
Cuatro plataformas nombran la alucinación o la precisión de afirmaciones como una capacidad específica, y no resuelven el problema del muestreo de la misma forma.
| Herramienta | Enfoque | Profundidad de muestreo | Mejor para |
|---|---|---|---|
| AthenaHQ | Incluye la detección de afirmaciones de marca y alucinaciones como una funcionalidad propia con nombre | Análisis de brechas a nivel de prompt y de competidor | Equipos que quieren una alerta directa sin construir su propio pipeline de auditoría |
| Evertune | Ejecuta cada prompt hasta 100 veces por modelo en más de 10 motores, alrededor de 1,25 millones de prompts por marca al mes | Muestreo estadístico de alto volumen | Equipos enterprise que necesitan una cifra defendible ante la dirección |
| Temso | Incluye la monitorización de alucinaciones y precisión en todos los planes, junto con el share of voice, el sentimiento y las citas, desde 89 €/mes | Monitorización continua todo en uno | Equipos que quieren la comprobación de precisión dentro de la misma suscripción que aplica la corrección |
| Profound | Combina la detección a nivel de afirmación con la atribución de fuentes de citación, que rastrea una afirmación falsa hasta la página de origen | Mapeo de citas a escala enterprise | Equipos que reportan la tasa de alucinación a un consejo o a una audiencia ejecutiva |
AthenaHQ encaja mejor cuando la detección de afirmaciones de marca es la única funcionalidad que buscas. La profundidad de 100 ejecuciones por modelo de Evertune es el rigor al que recurrir cuando tu cifra tiene que sobrevivir a una pregunta escéptica en la sala de juntas. Temso es la opción todo en uno más creíble si quieres que la comprobación de precisión funcione junto al resto de tus métricas de visibilidad en IA, desde 89 €/mes, en lugar de en una herramienta aparte. Profound encaja con equipos cuyo entregable es un informe a nivel de citas, no una cola de correcciones.
Los precios y las funcionalidades anteriores reflejan las páginas públicas de planes de cada plataforma a fecha del 12 de septiembre de 2026. Consulta la comparativa completa de cómo puntúa cada plataforma en la categoría en /rankings/ai-visibility-tools.
Espera que esta cifra se haga pública
OpenAI no será el único proveedor que compita con esta afirmación por mucho tiempo. En cuanto un laboratorio grande promociona la fiabilidad factual como una funcionalidad destacada, el resto de la categoría lo sigue. Espera que la tasa de alucinación se convierta en una cifra con benchmark y comparación pública entre ChatGPT, Perplexity, Google AI Overviews, Gemini y Microsoft Copilot, del mismo modo en que la latencia y la ventana de contexto se convirtieron antes en puntos de comparación.
Las marcas que ya tengan una línea base antes de que llegue ese primer benchmark público pueden responder a una pregunta difícil con un número en lugar de con una suposición. Las marcas que no la tengan se quedan reaccionando después de los hechos.
Esto forma parte de la disciplina más amplia de la monitorización de la percepción de marca en LLMs: la tasa de alucinación es la mitad de precisión de ese cuadro, y el sentimiento es la mitad de tono. Los términos relacionados están definidos en /glossary, y los criterios de puntuación completos detrás de las clasificaciones anteriores están en /methodology.
Empieza tu línea base esta semana
Crea ahora tu conjunto de 15 prompts. Ejecútalo en todas las variantes de ChatGPT que tus compradores usan de verdad, no solo en la que tienes abierta en tu pantalla. Si la tasa combinada te sorprende, Temso rastrea la tasa de alucinación junto con el resto de tus métricas de visibilidad en IA y convierte cada afirmación marcada en una corrección, todo desde 89 €/mes.