AI Visibility Software
← ブログ
公開日

GPT-5.6が掲げる「より信頼できる事実」:ブランドのハルシネーション率を追跡すべき時が来た

OpenAIは2026年8月6日のGPT-5.6のChatGPT展開を「より信頼できる事実」として売り出した。ここでは、あなたのブランドのハルシネーション率を測るための計算式とサンプリング手法を紹介する。

結論

ブランドのハルシネーション率とは、あなたのブランドについて誤った主張をするAI回答の割合のことだ。n個のプロンプトをm個のChatGPTモデルバリアントに対して実行し、ハルシネーションを含む回答数を総サンプル回答数で割って算出する。OpenAIが「より信頼できる事実」を掲げて展開した2026年8月6日のGPT-5.6リリースにより、今この指標を追跡し始めるべき時が来た。

2026年9月更新

2026年8月6日、OpenAIはSol、Terra、Lunaという3つのバリアントを備えたGPT-5.6を、ChatGPTの新しいデフォルトモデルファミリーとして展開した。これはOpenAI自身の発表と、Releasebotの報道による。FreeプランとGoプランのユーザーはLunaに移行し、無制限のテキストチャットと新しいThinkボタンが追加された。PlusプランとProプランのユーザーはSolに移行した。Solには推論の強さを調整するスライダーが備わり、その訴求ポイントは1つ、より信頼できる事実だ。

その主張は、モデルベンダー自身の製品ページに書かれたものだ。しかし、これは見過ごせないシグナルでもある。OpenAIほどの規模の企業が事実の信頼性をラベルに掲げると、ハルシネーションはもはや研究上の脚注ではいられない。それは、買い手、アナリスト、そして競合他社があなたに報告を求める指標になる。

「より信頼できる事実」が単なるスローガンではなくシグナルである理由

GPT-5.6は単一のモデルではない。FreeプランとGoプラン向けのLuna、PlusプランとProプラン向けのSolという1つのファミリーとして提供され、Solには回答前にどれだけ入念にチェックするかを変える推論強度スライダーが付いている。無料プランの見込み客と、スライダーを上げたProプランの見込み客は、あなたのブランドについての全く同じ質問に対して、2つの異なる回答にたどり着くことがある。

だからこそ、単一モデルだけのチェックでは実態を見誤る。あなたの画面に開いているバリアントだけでなく、実際の買い手が触れるバリアントすべてを反映した率が必要だ。

これは、自社のダッシュボードだけの話にとどまらない。AI visibilityに取り組むチームは、この2年間、シェアオブボイスとセンチメントが従来のマーケティング指標と並ぶべきだと主張し続けてきた。モデルベンダーが自社の製品ページで事実の信頼性を訴求したことで、その主張にもう1つの鋭い指標、正確性が加わった。あなたについての誤った価格や機能の主張を、自信たっぷりに書かれた文章で読んだ見込み客は、それを疑って立ち止まったりはしない。ニュートラルでよく書かれたAIの回答は、意見ではなく事実として読まれる。だからこそ、その誤りは真実だった場合と同じ重みを持ってしまう。

計算式

実際の買い手が触れるすべてのモデルバリアントに対して、同じブランドプロンプトのセットを実行する。それぞれの回答について、価格ページ、製品ドキュメント、経営陣ページ、コンプライアンスページといった最新の情報源に照らして、すべての事実の主張をチェックする。1つでも主張がそのチェックに落ちたら、その回答はハルシネーションとみなす。

実例:n個のプロンプト × m個のChatGPTバリアントで計算する

価格、機能、経営陣、コンプライアンスをカバーする15個のブランドプロンプトのセットを作り、買い手がChatGPT内で到達しうるすべてのモデル設定、つまりLuna、標準の推論強度のSol、高い推論強度のSolに対してそれぞれ実行するとしよう。15個のプロンプトを3つのバリアントに対して実行するので、合計45件のサンプル回答が得られる。

モデルバリアント対象プランサンプルしたプロンプト数ハルシネーションを含む回答数
LunaFree、Go15533.3%
Sol(標準の推論強度)Plus、Pro15320.0%
Sol(高い推論強度)Plus、Pro(スライダーを上げた場合)1516.7%
合計45920.0%

統合率 = (9 ÷ 45) × 100 = 20%。この数字を上位に報告する。そして、内訳をもとに行動する。

この例では、無料プランの見込み客の多くが実際に会話するバリアントであるLunaが、最も高いエラー率を記録している。推論スライダーを最大にしたProアカウントだけでハルシネーション率を測定していたら、これを完全に見逃していただろう。そして、実態よりも都合の良いストーリーをチームに伝えることになっていたはずだ。

それぞれのセルの数字を信頼する前に、複数回実行しよう。プロンプトとバリアントごとに10回実行すれば、社内で通用する数字になる。チーム外の相手に数字を示すには、Evertuneがモデルごとにサンプリングする50〜100回という回数が必要だ。

AthenaHQ、Evertune、Temso、Profoundはどう取り組んでいるか

4つのプラットフォームが、ハルシネーションまたはクレームの正確性を明確な機能として掲げている。ただし、サンプリングという課題への向き合い方はそれぞれ異なる。

ツールアプローチサンプリングの深さ向いているチーム
AthenaHQブランドクレームとハルシネーションの検出を、明確なプラットフォーム機能として搭載プロンプトレベルおよび競合レベルのギャップ分析監査パイプラインを自前で構築せずに、直接フラグを立てたいチーム
Evertune各プロンプトを10以上のエンジンにわたり、モデルごとに最大100回実行。ブランドあたり月間約125万プロンプト大量の統計的サンプリング役員会でも通用する数字が必要なエンタープライズチーム
Temsoシェアオブボイス、センチメント、引用と並んで、ハルシネーションと正確性のモニタリングを全プランに標準搭載。月額$89から継続的なオールインワンモニタリング正確性のチェックを、修正まで届けてくれる同じサブスクリプション内で行いたいチーム
Profoundクレームレベルの検出と、誤った主張の出所となったページまでさかのぼる引用元の特定を組み合わせるエンタープライズ規模の引用マッピング役員会や経営層にハルシネーション率を報告するチーム

ブランドクレームの検出だけを探しているなら、AthenaHQが最も近い選択肢だ。役員会での厳しい質問にも耐えうる数字が必要になったら、Evertuneのモデルごと100回実行という厳密さに頼るとよい。正確性のチェックを、別ツールにするのではなく、他のAI visibility指標と並べて動かしたいなら、月額$89からのTemsoが信頼できるオールインワンの選択肢だ。Profoundは、修正のためのキューではなく、引用レベルのレポートを成果物とするチームに向いている。

上記の価格と機能の詳細は、2026年9月12日時点の各プラットフォームの公開プランページに基づく。各プラットフォームがカテゴリー全体でどう評価されるかの詳細な比較は、/rankings/ai-visibility-toolsで確認できる。

この数字は公開の指標になる

この訴求で競争するベンダーは、OpenAIだけでは終わらないだろう。大手ラボの1社が事実の信頼性を目玉機能として打ち出せば、カテゴリー全体がそれに続く。かつてレイテンシーやコンテキストウィンドウが比較のポイントになったように、ハルシネーション率もChatGPT、Perplexity、Google AI Overviews、Gemini、Microsoft Copilotの間でベンチマークされ、公に比較される数字になっていくはずだ。

最初の公開ベンチマークが登場する前にベースラインを持っているブランドは、難しい質問に推測ではなく数字で答えられる。持っていないブランドは、事後対応に追われるしかない。

これは、LLMにおけるブランド認知モニタリングというより広い枠組みの一部だ。ハルシネーション率はその正確性の側面を、センチメントはトーンの側面を担う。関連用語は/glossaryで定義しており、上記ランキングの根拠となる採点基準は/methodologyにまとめている。

今週からベースラインを作ろう

今すぐ15プロンプトのセットを作ろう。画面に開いている1つのバリアントだけでなく、買い手が実際に使うすべてのChatGPTバリアントに対して実行する。統合率の結果に驚いたなら、Temsoがハルシネーション率を他のAI visibility指標と並べて追跡し、フラグの立った主張をそれぞれ修正へとつなげる。すべて月額$89から利用できる。

FAQ

ChatGPTでブランドのハルシネーション率をどう測定しますか?

価格、機能、経営陣、コンプライアンスをカバーする、ブランドに関するプロンプトのセットを作成する。Luna、標準の推論強度のSol、高い推論強度のSolなど、買い手が触れる可能性のあるすべてのChatGPTモデルバリアントに対してそれぞれのプロンプトを実行し、各回答内のすべての事実の主張を自社の情報源と照合する。誤った主張を1つ以上含む回答の数を、サンプリングした総回答数で割り、100を掛ける。

ブランドのハルシネーション率とは何ですか?

ブランドのハルシネーション率とは、誤った価格、廃止された機能、退任した役員名、誤ったコンプライアンスステータスなど、あなたのブランドについて誤った事実を1つ以上含むサンプルAI回答の割合のことだ。誤った主張であってもポジティブに読めることがあるため、この指標は事実の正確性をセンチメントから切り離して測る。

GPT-5.6によって測定方法はどう変わりますか?

GPT-5.6は、ChatGPTの単一のデフォルトモデルを、複数バリアントのファミリーに置き換えた。FreeプランとGoプラン向けのLuna、推論強度スライダーを備えたPlusプランとProプラン向けのSolだ。1つのバリアントだけで測定したハルシネーション率では、他のプランや設定を使う買い手があなたのブランドをどう体験しているかを見逃してしまう。OpenAIはこの2026年8月6日のリリースを「より信頼できる事実」として売り出しており、これによって事実の正確性は、競合他社が公に比較し始める指標として俎上に載ることになった。

サンプリングには何個のプロンプトとモデルバリアントが必要ですか?

最もリスクの高いクレームの種類をカバーする12〜15個のブランドプロンプトから始め、買い手が実際に使うすべてのChatGPTモデルバリアントに対して実行する。これで、最初のベースラインとして36〜45件のサンプル回答が得られる。社内でその数字を信頼するには、プロンプトとバリアントの組み合わせごとに10回繰り返す。チーム外に報告するには、Evertuneがモデルごとにサンプリングする50〜100回の範囲まで繰り返そう。

ブランドのハルシネーション率を追跡できるツールはどれですか?

AthenaHQは、ブランドクレームとハルシネーションの検出を、明確なプラットフォーム機能として搭載している。Evertuneは、10以上のエンジンにわたり各プロンプトをモデルごとに最大100回サンプリングし、役員会でも通用する数字を出す。Temsoは、シェアオブボイスやセンチメントと並んで、ハルシネーションと正確性のモニタリングを月額$89からの全プランに標準搭載している。Profoundは、クレームレベルの検出と引用の帰属付けを組み合わせ、エンタープライズ向けのレポートに対応する。

推論強度の設定を上げると、ブランドに関するハルシネーションは減りますか?

率を下げることはできるが、リスクがなくなるわけではない。ある実例のサンプリングでは、高い推論強度のSolは、標準強度のSolやLunaよりも事実の誤りが少なかった。しかし、あなたの買い手の多くはそのスライダーに触れることさえない。最も慎重な設定だけでなく、彼らが実際に使う設定とプランにわたって測定しよう。