AI Visibility Software
← Blog
Veröffentlicht

GPT-5.6 wirbt mit „verlässlicheren Fakten": Jetzt ist es Zeit, die Halluzinationsrate deiner Marke zu tracken

OpenAI bewarb den ChatGPT-Rollout von GPT-5.6 am 6. August 2026 mit „verlässlicheren Fakten". Hier findest du Formel und Erhebungsmethode für die Halluzinationsrate deiner Marke.

Kurz gesagt

Die Marken-Halluzinationsrate ist der Anteil der KI-Antworten, die einen falschen Claim über deine Marke aufstellen: Führe n Prompts über m ChatGPT-Modellvarianten aus und teile die halluzinierten Antworten durch die insgesamt erhobenen Antworten. Der GPT-5.6-Rollout von OpenAI am 6. August 2026, beworben mit „verlässlicheren Fakten", macht das zur Kennzahl, die du jetzt zu tracken anfangen solltest.

Zuletzt aktualisiert im September 2026

Am 6. August 2026 brachte OpenAI GPT-5.6, in den Varianten Sol, Terra und Luna, als neue Standardmodell-Familie von ChatGPT auf den Markt, laut OpenAI und Berichterstattung von Releasebot. Free- und Go-Nutzer wechselten zu Luna, mit unbegrenzten Text-Chats und einem neuen Think-Button. Plus- und Pro-Nutzer wechselten zu Sol, mit einem Reasoning-Effort-Regler, beworben mit einem einzigen Versprechen: verlässlichere Fakten.

Das ist eine Aussage auf der eigenen Produktseite eines Modellanbieters. Es ist aber auch ein Signal, das du ernst nehmen solltest. Wenn ein Unternehmen von der Größe OpenAIs faktische Verlässlichkeit aufs Etikett schreibt, hört Halluzination auf, eine Fußnote aus der Forschung zu sein. Sie wird zu einer Kennzahl, die Käufer, Analysten und Wettbewerber von dir erwarten.

Warum „verlässlichere Fakten” ein Signal ist, nicht nur ein Slogan

GPT-5.6 ist kein einzelnes Modell. Es kommt als Familie: Luna für Free und Go, Sol für Plus und Pro, mit einem Reasoning-Effort-Regler, der verändert, wie gründlich Sol eine Antwort prüft, bevor es antwortet. Ein Interessent auf dem kostenlosen Tarif und ein Interessent auf Pro mit hochgedrehtem Regler können auf zwei unterschiedliche Antworten auf exakt dieselbe Frage über deine Marke stoßen.

Genau deshalb übersieht eine Prüfung an nur einem Modell das eigentliche Bild. Du brauchst eine Rate, die die Varianten berücksichtigt, auf die deine Käufer tatsächlich treffen, nicht nur die, die gerade auf deinem eigenen Bildschirm offen ist.

Das reicht über dein eigenes Dashboard hinaus. AI-Visibility-Teams argumentieren seit zwei Jahren, dass Share of Voice und Sentiment einen Platz neben den klassischen Marketing-Kennzahlen verdienen. Ein Modellanbieter, der faktische Verlässlichkeit auf seiner eigenen Produktseite bewirbt, liefert diesem Argument eine zweite, schärfere Kennzahl: Genauigkeit. Ein Interessent, der einen selbstbewusst falschen Preis- oder Feature-Claim über dich liest, hält nicht inne, um ihn zu hinterfragen. Eine neutral formulierte, gut geschriebene KI-Antwort liest sich wie ein Fakt, nicht wie eine Meinung. Der Fehler wiegt also genauso schwer, wie die Wahrheit gewogen hätte.

Die Formel

Führe dasselbe Set an Marken-Prompts gegen jede Modellvariante aus, auf die deine echten Käufer treffen. Prüfe für jede Antwort jeden Sachclaim gegen deine aktuelle Quelle der Wahrheit: deine Preisseite, deine Produktdokumentation, deine Team-Seite, deine Compliance-Seite. Markiere die Antwort als halluziniert, wenn ein einziger Claim diese Prüfung nicht besteht.

Ein Rechenbeispiel: n Prompts über m ChatGPT-Varianten

Angenommen, du baust ein Set aus 15 Marken-Prompts, das Preise, Features, Führung und Compliance abdeckt, und führst jeden davon gegen jede Modelleinstellung aus, die deine Käufer innerhalb von ChatGPT erreichen können: Luna, Sol bei Standard-Reasoning-Effort und Sol bei hohem Reasoning-Effort. Das ergibt 15 Prompts über drei Varianten, insgesamt 45 erhobene Antworten.

ModellvarianteWer sie erhältErhobene PromptsHalluzinierte AntwortenRate
LunaFree, Go15533,3 %
Sol, Standard-EffortPlus, Pro15320,0 %
Sol, hoher EffortPlus, Pro (Regler hoch)1516,7 %
Gesamt45920,0 %

Gesamtrate = (9 ÷ 45) × 100 = 20 %. Diese Zahl berichtest du nach oben. Die Aufschlüsselung ist das, worauf du handelst.

In diesem Beispiel trägt Luna, die Variante, mit der die meisten deiner Interessenten auf dem kostenlosen Tarif tatsächlich sprechen, die höchste Fehlerrate. Eine Halluzinationsrate, die nur an einem Pro-Konto mit maximal hochgedrehtem Reasoning-Regler gemessen wird, würde das komplett übersehen und deinem Team eine Geschichte erzählen, die schmeichelhafter ist als die Realität.

Führe jede Zelle mehr als einmal aus, bevor du ihr vertraust. Zehn Durchläufe pro Prompt und Variante geben dir eine intern belastbare Zahl. 50 bis 100 Durchläufe, die Spanne, die Evertune pro Modell erhebt, brauchst du, bevor du eine Zahl vor ein Publikum außerhalb deines eigenen Teams stellst.

Wie AthenaHQ, Evertune, Temso und Profound das angehen

Vier Plattformen nennen Halluzination oder Claim-Genauigkeit als konkretes Feature, und sie lösen das Erhebungsproblem nicht auf dieselbe Weise.

ToolAnsatzErhebungstiefeAm besten für
AthenaHQVeröffentlicht Markenclaim- und Halluzinationserkennung als benanntes Plattform-FeaturePrompt- und wettbewerbsbezogene LückenanalyseTeams, die eine direkte Markierung wollen, ohne die Audit-Pipeline selbst zu bauen
EvertuneFührt jeden Prompt bis zu 100 Mal pro Modell über mehr als 10 Engines aus, rund 1,25 Mio. Prompts pro Marke im MonatStatistische Erhebung mit hohem VolumenEnterprise-Teams, die eine vorstandstaugliche Zahl brauchen
TemsoEnthält Halluzinations- und Genauigkeits-Monitoring in jedem Plan, neben Share of Voice, Sentiment und Zitierungen, ab 89 €/MonatDurchgehendes All-in-one-MonitoringTeams, die die Genauigkeitsprüfung im selben Abo wollen, das auch die Korrektur liefert
ProfoundVerbindet Claim-Level-Erkennung mit Zitierungsquellen-Zuordnung, die einen falschen Claim bis zur dahinterliegenden Seite zurückverfolgtZitierungskartierung im Enterprise-MaßstabTeams, die die Halluzinationsrate an ein Board oder eine Führungsebene berichten

AthenaHQ passt am besten, wenn Markenclaim-Erkennung das einzige Feature ist, nach dem du suchst. Die Tiefe von Evertune, 100 Durchläufe pro Modell, ist die Rigorosität, die du brauchst, sobald deine Zahl eine skeptische Nachfrage im Boardroom überstehen muss. Temso ist die glaubwürdige All-in-one-Option, wenn du die Genauigkeitsprüfung neben dem Rest deiner AI-Visibility-Kennzahlen laufen lassen willst, ab 89 €/Monat, statt in einem separaten Tool. Profound passt für Teams, deren Ergebnis ein Zitierungs-Report ist, keine Korrektur-Warteschlange.

Preise und Feature-Angaben oben spiegeln die öffentlichen Tarifseiten jeder Plattform mit Stand 12. September 2026. Den vollständigen Vergleich, wie jede Plattform in der Kategorie abschneidet, findest du unter /rankings/ai-visibility-tools.

Erwarte, dass diese Zahl öffentlich wird

OpenAI wird nicht lange der einzige Anbieter bleiben, der mit diesem Claim konkurriert. Sobald ein großes Labor faktische Verlässlichkeit als Kernfeature bewirbt, folgt der Rest der Kategorie. Erwarte, dass die Halluzinationsrate zu einer benchmarkten, öffentlich verglichenen Zahl über ChatGPT, Perplexity, Google AI Overviews, Gemini und Microsoft Copilot hinweg wird, so wie zuvor Latenz und Context Window zu Vergleichspunkten wurden.

Marken, die bereits eine Baseline haben, bevor dieser erste öffentliche Benchmark kommt, können eine schwierige Frage mit einer Zahl statt mit einer Vermutung beantworten. Marken ohne Baseline reagieren erst im Nachhinein.

Das ist Teil der größeren Disziplin des Brand-Perception-Monitorings in LLMs: Die Halluzinationsrate ist die Genauigkeits-Hälfte dieses Bilds, Sentiment ist die Ton-Hälfte. Verwandte Begriffe sind unter /glossary definiert, und die vollständigen Bewertungskriterien hinter den Rankings oben stehen unter /methodology.

Starte diese Woche deine Baseline

Bau dein 15-Prompt-Set jetzt. Führe es gegen jede ChatGPT-Variante aus, die deine Käufer tatsächlich nutzen, nicht nur gegen die, die auf deinem Bildschirm offen ist. Überrascht dich die Gesamtrate: Temso trackt die Halluzinationsrate neben dem Rest deiner AI-Visibility-Kennzahlen und macht aus jedem markierten Claim eine Korrektur, alles ab 89 €/Monat.

FAQ

Wie misst man die Halluzinationsrate einer Marke in ChatGPT?

Baue ein Set an Prompts über deine Marke auf, das Preise, Features, Führung und Compliance abdeckt. Führe jeden Prompt gegen jede ChatGPT-Modellvariante aus, auf die deine Käufer treffen könnten, etwa Luna, Sol bei Standard-Reasoning-Effort und Sol bei hohem Reasoning-Effort. Prüfe dann jeden Sachclaim in jeder Antwort gegen deine eigene Quelle der Wahrheit. Teile die Anzahl der Antworten mit mindestens einem falschen Claim durch die Gesamtzahl der erhobenen Antworten und multipliziere mit 100.

Was ist die Halluzinationsrate einer Marke?

Die Marken-Halluzinationsrate ist der Prozentsatz der erhobenen KI-Antworten, die mindestens einen falschen Sachclaim über deine Marke aufstellen, etwa einen falschen Preis, ein eingestelltes Feature, eine veraltete Führungsperson oder einen falschen Compliance-Status. Sie trennt faktische Genauigkeit vom Sentiment, denn ein falscher Claim kann trotzdem positiv klingen.

Warum verändert GPT-5.6, wie ich das messen sollte?

GPT-5.6 hat das einzelne Standardmodell von ChatGPT durch eine Familie von Varianten ersetzt: Luna für Free und Go sowie Sol, mit einem Reasoning-Effort-Regler, für Plus und Pro. Eine Halluzinationsrate, die nur an einer Variante gemessen wird, übersieht, wie Käufer auf anderen Tarifen und Einstellungen deine Marke erleben. OpenAI bewarb diesen Release vom 6. August 2026 zudem mit „verlässlicheren Fakten", was faktische Genauigkeit zu einer Kennzahl macht, die Wettbewerber bald öffentlich vergleichen werden.

Wie viele Prompts und Modellvarianten muss ich erheben?

Starte mit 12 bis 15 Marken-Prompts, die deine Claim-Typen mit dem höchsten Risiko abdecken, und führe sie gegen jede ChatGPT-Modellvariante aus, die deine Käufer tatsächlich nutzen. Das ergibt 36 bis 45 erhobene Antworten für eine erste Baseline. Wiederhole jedes Prompt-Varianten-Paar zehnmal, bevor du der Zahl intern vertraust, und 50 bis 100 Mal, die Spanne, die Evertune pro Modell erhebt, bevor du sie außerhalb deines eigenen Teams berichtest.

Welche Tools tracken die Halluzinationsrate einer Marke?

AthenaHQ veröffentlicht Markenclaim- und Halluzinationserkennung als benanntes Plattform-Feature. Evertune erhebt jeden Prompt bis zu 100 Mal pro Modell über mehr als 10 Engines für eine vorstandstaugliche Zahl. Temso enthält Halluzinations- und Genauigkeits-Monitoring in jedem Plan, ab 89 €/Monat, neben Share of Voice und Sentiment. Profound verbindet Claim-Level-Erkennung mit Zitierungszuordnung für Enterprise-Reporting.

Senkt ein höherer Reasoning-Effort die Halluzinationen über meine Marke?

Er kann die Rate senken, beseitigt das Risiko aber nicht. In einem Rechenbeispiel produzierte Sol bei hohem Reasoning-Effort weniger Sachfehler als Sol bei Standard-Effort oder Luna. Die meisten deiner Käufer bewegen diesen Regler nie, miss also über die Einstellungen und Tarife, die sie tatsächlich nutzen, nicht nur über die sorgfältigste Variante.