AI Visibility Software
← ブログ
公開日

ブランドハルシネーション率とは:AIがブランド情報を誤って伝える頻度を測る指標

ブランドハルシネーション率は、AIの回答があなたのブランドについて誤った事実を述べる頻度を測る指標です。計算式と具体例、監査用チェックリストを紹介します。

結論

ブランドハルシネーション率とは、サンプリングしたAIの回答のうち、価格や機能、経営陣、コンプライアンス状況などについて誤った事実を述べている回答の割合です。計算式は、ハルシネーションを含む回答数をサンプリングした回答数で割り、100を掛けたものです。主張の種類ごとに追跡し、デフォルトモデルが変わるたびにベースラインを取り直しましょう。

最終更新:2026年9月

OpenAIおよびReleasebotの報道によると、OpenAIは2026年8月6日、GPT-5.6(Sol、Terra、Lunaの3バリアント)をChatGPTの新しいデフォルトモデルファミリーとして展開しました。FreeプランとGoプランのユーザーには、無制限のテキストチャットと新しいThinkボタンを備えたLunaが提供されました。PlusプランとProプランのユーザーには、推論の強度を調整できるスライダーを備えたSolが提供され、「より信頼できる事実」という一点を軸に打ち出されました。

これはモデルベンダーのマーケティング文句です。しかし同時に、1つのシグナルでもあります。OpenAIが事実としての信頼性をラベルに掲げるとき、ハルシネーションはもはや研究上の脚注ではなく、購入者がベンダーに報告を求める指標になります。ブランドハルシネーション率は、その指標を自社ブランドに当てはめたものです。

この指標が必要な理由

あなたのブランドについてのAIの回答の多くは、意見をまったく含みません。2026年2月に行われた、ブランドに言及する180万件のAI回答を対象とした分析では、80.6%が中立的・記述的な内容で、18.4%が肯定的、否定的は約1%にとどまりました。

この分布は、見た目以上に重要な意味を持ちます。5件のうち4件が淡々とした、事実を述べるだけの内容だとすれば、その回答内の事実そのものが、本来センチメントが担うはずの役割を果たすことになります。誤った価格を淡々と述べる一文は、あからさまに否定的な一文よりも大きなダメージを与えます。客観的に見えるため、読み手が疑う理由を持たないからです。

自信満々に語られた1つの誤った「事実」も、十分な数の回答で繰り返されれば、その後何か月もの間、AIがあなたのブランドをどう説明するかを決定づけてしまいます。ハルシネーション率は、それを購入者より先に見つけるための手段です。

計算式

対象のエンジンすべてに対して、ブランドに関連する固定のプロンプトセットを実行します。各回答について、ブランドに関するすべての事実主張を、価格ページ、製品ドキュメント、経営陣ページ、コンプライアンスページといった自社の最新の一次情報と照合します。いずれかの主張がこの照合に通らなければ、その回答をハルシネーションとしてマークします。

具体例

たとえば、あなたのブランドに関する12個のプロンプトを、それぞれChatGPTで10回ずつ実行するとします。これで合計120件のサンプリング回答が得られます。

プロンプト実行回数ハルシネーション回答数誤った主張の例
「[ブランド名]の料金はいくらですか?」104廃止された料金プランを提示
「[ブランド名]にはどんな機能がありますか?」102実装されたことのない機能を主張
「[ブランド名]の創業者は誰ですか?」101元役員を現CEOとして紹介
「[ブランド名]はSOC 2に準拠していますか?」103実際には取得済みの認証を「未取得」と回答
「[ブランド名]は[競合他社]と比べてどうですか?」100事実の誤りは見つからず
残りの7プロンプト(各10回実行)705価格と機能に関する誤りが混在
合計12015

ハルシネーション率 = (15 ÷ 120) × 100 = 12.5%

この1つの数値だけでは、ほとんど何もわかりません。プロンプトと主張の種類ごとの内訳を見て初めて、どこから一次情報を修正すべきかが見えてきます。この例では、価格とコンプライアンス状況が最も悪い2つのカテゴリーであり、そこはまさに購入者の意思決定を左右する部分です。

チェックリスト:監査すべき主張の種類

サンプリングしたすべての回答を、最低でも次の5つの主張カテゴリーに照らして確認しましょう。それぞれが、購入者があなたのサイトを訪れることなく下す判断に直結しています。

  • 価格。 現行のプラン名、金額、請求条件。価格は変わりやすく、古い回答は最も多いハルシネーションのタイプです。
  • 機能。 製品ができることとできないこと。存在しない機能をでっち上げるケースと、すでに廃止した機能を挙げるケースの両方を含みます。
  • 経営陣。 現在の創業者と役員。AIエンジンは、元CEOや買収された創業者を、あたかも今も会社を率いているかのように表示することがよくあります。
  • コンプライアンスと認証状況。 SOC 2、HIPAA、GDPRなどに関する主張。ここでの誤りは、担当者が案件を検討する前に、調達候補リストから外される原因になり得ます。
  • 連携と提携。 製品がどのツールと連携しているか。誤った連携情報は、導入時に満たせない期待を購入者に抱かせてしまいます。

検出したすべての誤りについて、プロンプト、エンジン、日付、そして正確な誤った主張の内容を記録しましょう。この記録があって初めて、単なるハルシネーション率の数値が、実行可能な情報修正計画に変わります。

モデルが切り替わるたびにベースラインを取り直す

ハルシネーション率は、同じモデルで測定された数値同士でしか比較できません。

2026年8月6日にGPT-5.6がChatGPTのデフォルトになったことで、ChatGPTの回答を追跡しているすべてのブランドのベースラインがリセットされました。旧デフォルトモデルで測定した12%という数値と、SolやLunaのもとで測定した8%という数値を比較しても、コンテンツが改善した証拠にはなりません。それはモデルが変わった証拠にすぎません。

これは一度きりのメモではなく、継続的なログとして扱いましょう。ChatGPT、Perplexity、Google AI Overviews、Gemini、Microsoft Copilotのいずれかがデフォルトモデルを切り替えるたびに、行を追加し、プロンプトセットを再実行して、トレンドラインの起点をリセットします。モデルの影響と実際のコンテンツ改善を切り分けるための、段階的なチェックリストを含む完全なベースライン再取得の手順は、ChatGPTがブランドを意図通りに描写しているかを監査する方法で紹介しています。

今後の見通し

この点で競争しようとしているのはOpenAIだけではありません。大手ラボの1社が事実としての信頼性を目玉機能として打ち出せば、レイテンシーやコンテキストウィンドウがかつてそうなったように、ハルシネーション率もエンジン間で公開比較されるベンチマーク数値になっていくはずです。この比較が一般化する前からハルシネーション率のベースラインを持っているブランドこそが、自らの主張を数値で裏付けられるブランドになります。

最初の公開ベンチマークに背中を押されてからではなく、今から追跡を始めましょう。

この指標を追跡できるツール

AthenaHQは、ブランドに関する主張の検証とハルシネーション検出を名前付き機能として公開しており、監査用のパイプラインを自前で構築せずに「AIが自社について誤った情報を述べていないか」の答えを直接得たいチーム向けです。

Evertuneは、数値を報告する前に各プロンプトをモデルごとに最大100回実行します。これは、ハルシネーション率が単なる推測ではなく意味のある数値になるために必要なレベルのサンプリングの厳密さです。この実行量があるからこそ、その精度ダッシュボードは方向性を示すだけでなく、統計的に裏付けられたものになります。

Temsoは、月額89ドルからの全プランにハルシネーションと精度の監視を含んでおり、シェアオブボイスやセンチメント、引用も同時に追跡できるオールインワンのプラットフォームです。精度チェックとコンテンツ修正を、同じサブスクリプションの中で完結させたいチームに向いています。

Profoundは、エンタープライズ規模での主張レベルの検出を提供しており、ハルシネーションを含む主張を、それを生み出した可能性が高い元の情報源までさかのぼれるほど詳細な引用元の特定を行います。取締役会にハルシネーション率を報告するチームに適しています。

各プラットフォームが精度と主張レベルの監視をどう扱っているかの詳しい比較は、/rankings/ai-visibility-toolsで確認できます。グラウンディングやシェアオブボイスなど、関連用語の定義は/glossaryにまとめています。


今週、この計算式を自社ブランドに当てはめてみましょう。10から12個のプロンプトを、それぞれ10回実行し、現行の価格、機能、経営陣、コンプライアンス状況と照合します。もし数値が想定より高ければ、Temsoがハルシネーション率を他のAI visibility指標と合わせて追跡し、検出した主張1つひとつを情報修正タスクへと変換します。月額89ドルから利用できます。

FAQ

ブランドハルシネーション率とは何ですか?

ブランドハルシネーション率とは、サンプリングしたAIの回答のうち、誤った価格情報や廃止された機能、古い経営陣の名前、誤ったコンプライアンス状況など、ブランドに関する誤った事実を1つ以上含む回答の割合です。ハルシネーションを含む回答数を、サンプリングした回答の総数で割り、100を掛けて算出します。

ハルシネーション率はセンチメントとどう違いますか?

センチメントはトーンを測る指標で、AIの回答があなたのブランドを好意的、中立的、否定的のどれで描写しているかを示します。一方、ハルシネーション率は事実としての正確さを測ります。誤った主張が好意的なセンチメントを帯びることもあります(たとえば「Acmeは無制限の無料ストレージを提供している」は魅力的に聞こえますが誤りで、これもハルシネーションとしてカウントされます)。この2つの指標は異なる種類の失敗を追跡するため、別々に監視する必要があります。

信頼できるハルシネーション率を算出するには、プロンプトを何回実行すればよいですか?

算出した数値を信頼する前に、各エンジンでプロンプトを最低10回は実行しましょう。社外に報告する数値であれば、50回から100回の実行が必要です。AIの回答は確率的なものです。1回の実行だけでは、5回に1回しか現れないハルシネーションを見逃したり、たまたま起きた例外を誤って検出したりすることがあります。実行回数を増やすほど、その誤差は小さくなります。

モデルの更新後にハルシネーション率のベースラインを取り直す必要があるのはなぜですか?

ChatGPTがGPT-5.6に切り替わったときのようなデフォルトモデルの変更は、基盤となるシステムが回答を生成する方法そのものを変え、あなたのブランドについて述べる事実の内容にも影響します。切り替え前に測定したハルシネーション率は、切り替え後の数値と単純比較できません。デフォルトモデルの変更が確認されたら48時間以内にプロンプトセット全体を再実行し、追跡チャートにその日付を記録しましょう。そうしないと、モデルの影響がコンテンツの問題であるかのように見えてしまいます。

ブランドハルシネーションを監査すべき主張の種類はどれですか?

最低でも次の5つのカテゴリーを監査しましょう。価格(現行プラン名と金額)、機能(製品ができることとできないこと)、経営陣(現在の役員と創業者)、コンプライアンスと認証状況(SOC 2、HIPAA、GDPRに関する主張)、そして連携・提携に関する主張(製品がどのツールと連携しているか)です。これらは、誤った回答が購買判断に最も大きなダメージを与えるカテゴリーです。

ブランドハルシネーション率を追跡できるツールはどれですか?

AthenaHQは、ブランドに関する主張の検証とハルシネーション検出を名前付き機能として公開しています。Evertuneは各プロンプトをモデルごとに最大100回実行するため、1回きりのチェックよりも統計的な裏付けのある精度データが得られます。Temsoは月額89ドルからの全プランにハルシネーションと精度の監視を含めており、オールインワンの追跡機能の一部として提供しています。Profoundは、より深い引用元の特定を必要とするチームに向けて、エンタープライズ規模の主張レベル検出を提供しています。