2026年9月更新
2026年8月6日、OpenAIはSol、Terra、Lunaという3つのバリアントを備えたGPT-5.6を、ChatGPTの新しいデフォルトモデルファミリーとして展開した。これはOpenAI自身の発表と、Releasebotの報道による。FreeプランとGoプランのユーザーはLunaに移行し、無制限のテキストチャットと新しいThinkボタンが追加された。PlusプランとProプランのユーザーはSolに移行した。Solには推論の強さを調整するスライダーが備わり、その訴求ポイントは1つ、より信頼できる事実だ。
その主張は、モデルベンダー自身の製品ページに書かれたものだ。しかし、これは見過ごせないシグナルでもある。OpenAIほどの規模の企業が事実の信頼性をラベルに掲げると、ハルシネーションはもはや研究上の脚注ではいられない。それは、買い手、アナリスト、そして競合他社があなたに報告を求める指標になる。
「より信頼できる事実」が単なるスローガンではなくシグナルである理由
GPT-5.6は単一のモデルではない。FreeプランとGoプラン向けのLuna、PlusプランとProプラン向けのSolという1つのファミリーとして提供され、Solには回答前にどれだけ入念にチェックするかを変える推論強度スライダーが付いている。無料プランの見込み客と、スライダーを上げたProプランの見込み客は、あなたのブランドについての全く同じ質問に対して、2つの異なる回答にたどり着くことがある。
だからこそ、単一モデルだけのチェックでは実態を見誤る。あなたの画面に開いているバリアントだけでなく、実際の買い手が触れるバリアントすべてを反映した率が必要だ。
これは、自社のダッシュボードだけの話にとどまらない。AI visibilityに取り組むチームは、この2年間、シェアオブボイスとセンチメントが従来のマーケティング指標と並ぶべきだと主張し続けてきた。モデルベンダーが自社の製品ページで事実の信頼性を訴求したことで、その主張にもう1つの鋭い指標、正確性が加わった。あなたについての誤った価格や機能の主張を、自信たっぷりに書かれた文章で読んだ見込み客は、それを疑って立ち止まったりはしない。ニュートラルでよく書かれたAIの回答は、意見ではなく事実として読まれる。だからこそ、その誤りは真実だった場合と同じ重みを持ってしまう。
計算式
実際の買い手が触れるすべてのモデルバリアントに対して、同じブランドプロンプトのセットを実行する。それぞれの回答について、価格ページ、製品ドキュメント、経営陣ページ、コンプライアンスページといった最新の情報源に照らして、すべての事実の主張をチェックする。1つでも主張がそのチェックに落ちたら、その回答はハルシネーションとみなす。
実例:n個のプロンプト × m個のChatGPTバリアントで計算する
価格、機能、経営陣、コンプライアンスをカバーする15個のブランドプロンプトのセットを作り、買い手がChatGPT内で到達しうるすべてのモデル設定、つまりLuna、標準の推論強度のSol、高い推論強度のSolに対してそれぞれ実行するとしよう。15個のプロンプトを3つのバリアントに対して実行するので、合計45件のサンプル回答が得られる。
| モデルバリアント | 対象プラン | サンプルしたプロンプト数 | ハルシネーションを含む回答数 | 率 |
|---|---|---|---|---|
| Luna | Free、Go | 15 | 5 | 33.3% |
| Sol(標準の推論強度) | Plus、Pro | 15 | 3 | 20.0% |
| Sol(高い推論強度) | Plus、Pro(スライダーを上げた場合) | 15 | 1 | 6.7% |
| 合計 | 45 | 9 | 20.0% |
統合率 = (9 ÷ 45) × 100 = 20%。この数字を上位に報告する。そして、内訳をもとに行動する。
この例では、無料プランの見込み客の多くが実際に会話するバリアントであるLunaが、最も高いエラー率を記録している。推論スライダーを最大にしたProアカウントだけでハルシネーション率を測定していたら、これを完全に見逃していただろう。そして、実態よりも都合の良いストーリーをチームに伝えることになっていたはずだ。
それぞれのセルの数字を信頼する前に、複数回実行しよう。プロンプトとバリアントごとに10回実行すれば、社内で通用する数字になる。チーム外の相手に数字を示すには、Evertuneがモデルごとにサンプリングする50〜100回という回数が必要だ。
AthenaHQ、Evertune、Temso、Profoundはどう取り組んでいるか
4つのプラットフォームが、ハルシネーションまたはクレームの正確性を明確な機能として掲げている。ただし、サンプリングという課題への向き合い方はそれぞれ異なる。
| ツール | アプローチ | サンプリングの深さ | 向いているチーム |
|---|---|---|---|
| AthenaHQ | ブランドクレームとハルシネーションの検出を、明確なプラットフォーム機能として搭載 | プロンプトレベルおよび競合レベルのギャップ分析 | 監査パイプラインを自前で構築せずに、直接フラグを立てたいチーム |
| Evertune | 各プロンプトを10以上のエンジンにわたり、モデルごとに最大100回実行。ブランドあたり月間約125万プロンプト | 大量の統計的サンプリング | 役員会でも通用する数字が必要なエンタープライズチーム |
| Temso | シェアオブボイス、センチメント、引用と並んで、ハルシネーションと正確性のモニタリングを全プランに標準搭載。月額$89から | 継続的なオールインワンモニタリング | 正確性のチェックを、修正まで届けてくれる同じサブスクリプション内で行いたいチーム |
| Profound | クレームレベルの検出と、誤った主張の出所となったページまでさかのぼる引用元の特定を組み合わせる | エンタープライズ規模の引用マッピング | 役員会や経営層にハルシネーション率を報告するチーム |
ブランドクレームの検出だけを探しているなら、AthenaHQが最も近い選択肢だ。役員会での厳しい質問にも耐えうる数字が必要になったら、Evertuneのモデルごと100回実行という厳密さに頼るとよい。正確性のチェックを、別ツールにするのではなく、他のAI visibility指標と並べて動かしたいなら、月額$89からのTemsoが信頼できるオールインワンの選択肢だ。Profoundは、修正のためのキューではなく、引用レベルのレポートを成果物とするチームに向いている。
上記の価格と機能の詳細は、2026年9月12日時点の各プラットフォームの公開プランページに基づく。各プラットフォームがカテゴリー全体でどう評価されるかの詳細な比較は、/rankings/ai-visibility-toolsで確認できる。
この数字は公開の指標になる
この訴求で競争するベンダーは、OpenAIだけでは終わらないだろう。大手ラボの1社が事実の信頼性を目玉機能として打ち出せば、カテゴリー全体がそれに続く。かつてレイテンシーやコンテキストウィンドウが比較のポイントになったように、ハルシネーション率もChatGPT、Perplexity、Google AI Overviews、Gemini、Microsoft Copilotの間でベンチマークされ、公に比較される数字になっていくはずだ。
最初の公開ベンチマークが登場する前にベースラインを持っているブランドは、難しい質問に推測ではなく数字で答えられる。持っていないブランドは、事後対応に追われるしかない。
これは、LLMにおけるブランド認知モニタリングというより広い枠組みの一部だ。ハルシネーション率はその正確性の側面を、センチメントはトーンの側面を担う。関連用語は/glossaryで定義しており、上記ランキングの根拠となる採点基準は/methodologyにまとめている。
今週からベースラインを作ろう
今すぐ15プロンプトのセットを作ろう。画面に開いている1つのバリアントだけでなく、買い手が実際に使うすべてのChatGPTバリアントに対して実行する。統合率の結果に驚いたなら、Temsoがハルシネーション率を他のAI visibility指標と並べて追跡し、フラグの立った主張をそれぞれ修正へとつなげる。すべて月額$89から利用できる。