AI検索の可視性は「ひとつのスコア」では測れない|プロンプト起点で組むGEO測定設計

この記事のタイトルとURLをコピーする

「うちはAI検索でどのくらい見えているのか」。AIO/GEO(生成エンジン最適化)の話題が増えるなかで、この問いから検討を始める企業が増えています。しかし、この問いの立て方そのものが、実務を止めてしまう原因になっているケースが少なくありません。

ギャプライズでは、自社が取り扱うツールを対象にAI検索での見え方を3回にわたって計測しました。結果はV字でした。2回目にすべての指標が下がり、3回目で回復しています。この過程で分かったのは、単一のスコアを追いかけても打ち手にはつながらないということでした。

本記事では、その実測データを交えながら、プロンプトを分析単位に置くGEO測定設計の考え方を解説します。

AI検索の可視性を「ひとつのスコア」で測ると何が見えなくなるのか

可視性をひとつの数値に集約すると、製品別・顧客層別・市場別・ファネル段階別の差がすべて平均化され、打ち手につながる情報が失われます。AI検索の可視性は文脈ごとに大きく変動するため、単一スコアは「見えている/見えていない」以上のことを教えてくれません。

GEOプラットフォームを提供するAthenaHQは、この問題を次のような例で説明しています。

あるセキュリティ企業が「エンタープライズ向けセキュリティ」という広い問いに対しては頻繁にAIの回答へ登場する。しかし、買い手が特定の製品カテゴリについて具体的に尋ねると、まったく姿を消してしまう。あるいは、米国向けの質問では目立つのに、ドイツ語の同等の質問ではほとんど言及されない。

これらはすべて別々の問題であり、必要な対策も異なります。にもかかわらず、ひとつの可視性スコアはこの差を平らに均してしまいます。スコアが60点だったとして、何をすればよいかは分かりません。

この構造的な課題は、AI検索そのものの性質に由来します。同社が8つの主要AIモデルから約800万件の回答を収集・分析した調査「State of AI Search 2026」によると、AIモデルが1つの回答を生成する際に参照するドメイン数は平均で約12。ChatGPTでは約15、Grokでは約16に達します。回答ごとに参照元の組み合わせが変わる環境では、集計値の平均は実態から離れやすくなります。

プロンプトを分析単位にすると、何が診断できるようになるのか

「自社はAIで見えているか」ではなく「この問いに対して自社は登場するか」を単位にすると、可視性は診断可能になります。買い手が実際に投げる問いを定義し、その集合に対する登場率・言及のされ方・参照元を観測する。これがプロンプト起点のGEOです。

プロンプトセットは、次の5つの軸で分解すると設計しやすくなります。

1. 製品・ソリューション別

買い手は製品ごとに異なる問いを投げます。製品Aでは引用されているのに製品Bではまったく登場しない、という状態は珍しくありません。これは製品単位で見なければ発見できない差です。

2. 顧客層別

経営層、実務担当者、開発者、調達部門では、同じ課題でも問いの立て方が変わります。経営層は「課題の全体像」を、実務者は「運用方法」を、調達は「他社との違いと価格妥当性」を尋ねます。

3. 市場・言語別

国・言語・業界が変われば、AIが参照するソースも回答の内容も変わります。日本企業にとってはとくに重要な軸です。

4. ファネル段階別

課題を認識する段階の問いと、解決策を比較検討する段階の問いは別物です。ここで分かりやすいパターンが現れます。情報収集型のプロンプトでは頻繁に登場するのに、比較検討型のプロンプトになると消える。これは「認知はあるが選択肢に入っていない」というシグナルです。

AthenaHQの調査では、AIが引用するコンテンツの意図(コンテンツインテント)の内訳は、情報提供型が32.45%、比較・選択型が25.03%で、この2つで全引用の半数以上を占めています。とくにテクノロジー・ソフトウェア業界では比較・選択型が27.74%と最上位に立ち、情報提供型(24.34%)を上回ります。BtoB領域では、比較検討の問いに答えるコンテンツの有無が可視性を左右します。

5. 競合比較シナリオ別

「◯◯の代替ツールは」「AとBはどちらが適しているか」といった問いで、どのブランドが並ぶのか。ここに自社が入っていなければ、AIが構築している業界地図の中に自社が位置づけられていないということです。

プロンプトを単位にすると、症状の切り分けができます。情報提供型で登場して比較型で消えるならコンテンツの問題。どの類型でも登場しないなら技術基盤か権威性の問題。登場するものの説明が古いポジショニングのままなら、参照元になっている情報の鮮度の問題です。

プロンプトセットの具体例:サイト表示速度改善ツールの場合

抽象的な説明だけでは設計に落ちないため、具体例を示します。以下は、サイト表示速度改善ツールを提供する企業が5軸に沿って組んだ日本語プロンプトの例です。実際の運用では、各軸につき5〜10問程度まで広げます。

軸 日本語プロンプト例 このプロンプトで分かること
製品・ソリューション別 「ECサイトの表示速度を改善する方法は」/「Core Web Vitalsのスコアを上げるには」 製品が解く課題の文脈で名前が挙がるか
顧客層別 (経営層)「サイト表示速度が売上に与える影響は」/(実務者)「LCPを2.5秒以内にする具体的な手法は」 意思決定者と実務者のどちらの問いで見えているか
市場・言語別 「サイト高速化ツール おすすめ 日本」/同義の英語プロンプトとの比較 日本語環境と英語環境での見え方の差
ファネル段階別 (認知)「サイトが重い原因は何か」/(比較)「サイト高速化ツールの比較 導入コスト」 認知段階から比較段階へ進んだときに消えないか
競合比較シナリオ別 「◯◯(自社ツール)の代替ツールは」/「CDNとサイト高速化ツールの違いは」 AIが描く業界地図の中での自社の位置

※プロンプトは事業構造によって変わります。上記は設計の型を示すための例です。

プロンプトセットはなぜ部門横断のGEOを成立させるのか

AI検索の可視性はコンテンツ部門だけでは解決できません。AIは自社サイト、技術ドキュメント、構造化データ、第三者メディア、レビューサイトなど複数のソースから回答を組み立てるため、改善には複数部門の関与が必要です。プロンプトセットは、その部門横断の取り組みに共通の地図を与えます。

部門 プロンプトセットから読み取ること 打ち手
コンテンツ 回答が弱い、または存在しない重要な問い 該当する問いに正面から答えるコンテンツの制作
SEO・技術 価値あるページがクロール・解釈されているか クローラー許可、サーバーサイドレンダリング、構造化データ
広報・PR 第三者からの言及・検証が薄い領域 業界メディア、レビュー、第三者コンテンツの獲得
プロダクトマーケ AIの説明が現在のポジショニングとずれている箇所 製品情報・メッセージの更新と一次情報の整備
アナリティクス 施策の前後で何が変わったか 定点観測と効果検証

「AI検索での見え方を良くする」という曖昧な目標を各部門が個別に追いかける状態から、同じ問いの集合に向かって役割分担する状態へ。この違いが、エンタープライズ規模でGEOを回せるかどうかを決めます。

実測:3回の計測で分かった「1回の数字では判断できない」

ここからは自社での実測データをお示しします。ギャプライズが取り扱うA/Bテスト・サイト最適化ツールを対象に、期間を区切って3回計測した結果は以下の通りです。指標はSOV(競合と比べた言及頻度の割合)、言及率(当該カテゴリの質問で名前が挙がる割合)、引用率(回答のソースとして自社ページが参照される割合)の3つです。

計測回 SOV 言及率 引用率
1回目 24.1% 73.2% 12.8%
2回目 23.1% 70.0% 9.1%
3回目 26.6% 76.1% 14.6%

※自社計測に基づく数値。計測条件によって変動します。

注目すべきは2回目です。3指標すべてが下がっています。とくに引用率は12.8%から9.1%へ低下し、カテゴリ内の引用元順位も一時TOP4付近から11位程度まで落ちました。

原因を調べたところ、国産のA/Bテスト・サイト改善系ツールが、この時期に生成AIの回答内で存在感を増していました。自社側で何かを失敗したわけではありません。こちらが止まっている間に、周囲が動いていたということです。

ここに、SOVという指標の性質が表れています。SOVは相対値であるため、自社が何もしなくても競合の動きだけで下がります。絶対的な改善度を測る指標ではありません。

この経験から得た教訓:1回の計測で上がった下がったと判断するのは危険です。AIの回答はモデル、プラットフォーム、質問の言い回し、地域、文脈、時期によって変動します。同じプロンプトセットを継続的に観測し、傾向で判断する体制がなければ、施策の効果検証は成立しません。なお3回目の計測にも、一部期間のソースデータが正常に取得できなかったという注釈が残っており、データの完全性には留保が必要です。

カテゴリは「点」ではなく「面」で見る

測定を始めて最も視点が変わったのは、競合の見え方についてでした。生成AIに「このカテゴリのおすすめツールは」と尋ねると、当然ながら競合の名前が並びます。ところがその上位に挙がった顔ぶれを一つずつ確認したところ、いくつかは自社が取り扱っているツールでした。

ギャプライズはサイト最適化・パーソナライズの領域で複数のツールをラインナップしています。そのため、AIの目線では「競合同士」に見える並びの中に、自社陣営が複数混ざっている状態が生まれていました。

この気づきは、評価軸そのものを変えました。見るべきは「どのツールが1位か」ではありません。

この問いに対してAIが参照するソースのうち、いくつを自社陣営で埋められているか。

AthenaHQの調査によれば、AIが1回答を生成する際に参照するドメイン数は平均で約12です。つまり「席」は12ある。1位を取ることではなく、その12席のうち何席を確保できるかが実質的な勝負になります。複数の製品・複数のメディア・複数の第三者コンテンツを持つ企業ほど、この考え方の効果は大きくなります。

単一の可視性スコアを追いかけていると、この視点には到達できません。プロンプト単位で参照元まで分解して初めて見えてくる構造です。

日本語環境で実際に引用されていたのは何だったのか

公開されているAI検索の調査データは、その大半が英語圏を中心としたものです。AthenaHQの調査では、AIが引用する外部ソースの上位はReddit(22.99%)、YouTube(13.43%)、Wikipedia(6.41%)でした。テクノロジー・ソフトウェア業界ではRedditが26.45%とさらに高くなります。

しかし、自社で日本語環境を計測した結果は異なる姿を示しました。引用の流入元は、ツールベンダーの本国サイトだけではありません。比較記事、レビュー、MarTech系メディアがかなりの比重を占めていました。

そこで打った手はシンプルでした。派手な設定変更ではなく、AI関連テーマの記事コンテンツを地道に増やしています。結果として、自社オウンドメディア「MarTechLab」の引用率は一時7%台まで落ちていたものが13%台まで回復し、引用元のTOP6に戻りました。これが全体の引用率を14.6%まで押し上げた主因です。

この結果から言えることは2つあります。

  1. 日本語環境では、英語圏のベンチマークとは異なる参照元の構造がある。公開データをそのまま前提にすると打ち手を誤る
  2. GEOは仕込み型の施策である。即効性のある設定変更よりも、AIが参照したくなるコンテンツを積み上げることが結果に表れる

このデータが主張できないこと:上記は自社1社・1カテゴリでの計測結果であり、業界全体の傾向を示すものではありません。計測条件によって数値は変動します。日本語環境における参照元分布の全体像は、現時点で公開された調査が存在しません。だからこそ、各社が自社の市場について自ら測る価値があります。

単一スコア型の測定とプロンプト起点の測定は何が違うのか

2つの測定アプローチの違いを整理します。単一スコア型は現状把握に向き、プロンプト起点型は改善の意思決定に向きます。どちらが優れているという話ではなく、目的が異なります。

観点 単一スコア型の測定 プロンプト起点の測定
分析単位 ブランド全体 個別のプロンプト
分かること 市場平均と比べた大まかな位置 どの問いで登場し、どこで消えるか
原因の特定 困難(数値が動いた理由が分からない) 可能(プロンプトの類型から症状を切り分け)
部門連携 共通目標が曖昧になりやすい 同じプロンプトセットを各部門が分担
効果検証 外部要因との切り分けが難しい 同一プロンプトの定点観測で比較可能
向く場面 経営報告、初期の現状把握 改善施策の設計と検証

なお、ベンチマーク値の扱いにも注意が必要です。AthenaHQの調査では、ブランドが回答内で言及される平均率は17.2%、カテゴリのトップブランドは56.7%と報告されています。約3倍の開きです。こうした数値は自社の位置を知る目安にはなりますが、「平均を上回っているから問題なし」という判断につなげると、個別の問いで消えている領域を見落とします。

その前提として、AIクローラーに到達されているか

プロンプトセットの設計に入る前に、確認しておくべき技術的な前提があります。そもそもAIクローラーが自社サイトに到達できていなければ、どれだけ良いコンテンツを作っても引用の対象になりません。そして、ここで躓いている企業は想像以上に多いのが実情です。

LightSite AIが2025年8月からの1年間で6,382ドメインをスキャンした調査「The State of AI Search Readiness」によると、AI対応準備度スコアの平均は100点満点中39.5点。B評価以上はわずか13.5%で、中央値はC帯に位置しています。

さらに同調査の詳細スキャン(73件)では、28.8%のサイトがWAFまたはエッジネットワークの設定によって、正規のAIクローラーをブロックしていました。意図的な遮断ではなく、セキュリティ設定の副作用として発生しているケースがほとんどです。

確認すべき主要な制御対象は次の5つです。

    •   GPTBot(ChatGPTの学習用クローラー)
    •   OAI-SearchBot(ChatGPT Searchの検索用クローラー)
    •   ClaudeBot(Anthropic)
    •   PerplexityBot(Perplexity)
    •   Google-Extended(Geminiの学習・グラウンディングへの利用可否を制御するトークン)

Google-Extendedについての注意:これはクローラーではなく、Googlebotが取得済みのコンテンツをGeminiの学習およびグラウンディングに使ってよいかを指定するrobots.txtのトークンです。Google AI OverviewsやAI ModeはGoogle検索内の機能であり、クロールはGooglebotが担っています。したがってGoogle-Extendedを拒否してもAI Overviewsへの掲載可否は変わりません。逆に、AI Overviewsへの露出を狙ってGooglebotをブロックしてしまうと通常の検索結果からも消えるため、混同は避けてください。

同調査では、技術的準備度がD帯からA帯に上がると、AI可視性スコアが25.9から40.2へ(約55%増)、ブランド言及数が2.2から3.8へ(約72%増)変化するという相関も報告されています。ただし相関を取れているのは66ドメインのみで、A帯はわずか5件です。スキャン対象は「誰かがURLを入力したサイト」であるため自己選択バイアスもかかっており、相関であって因果の証明ではありません。

あわせて押さえておきたいのが、AIがサイトに入ってくる経路です。AthenaHQの調査では、44.5%が/blog、19.0%がトップページ、13.3%が/productsでした。ブログが最大の入口である以上、そこがJavaScript依存だったり、同意バナーがボットに白紙を返す設定になっていたりすると、記事の質は評価の土俵にすら上がりません。

まとめ:抽象的な可視性から、具体的な問いの集合へ

エンタープライズのGEOは「自社はAIでどのくらい見えているか」から始めるべきではありません。その問いは広すぎて、具体的な行動につながらないためです。始点に置くべきは、買い手が実際に投げている問いです。

    1. 単一の可視性スコアは、製品別・顧客層別・市場別・ファネル段階別の差を平均化し、打ち手を見えなくする
    2. プロンプトを分析単位にすると、症状の切り分けと部門横断の役割分担が可能になる
    3. SOVは相対指標であり、自社が何もしなくても競合の動きで下がる。1回の計測では判断できない
    4. カテゴリは「点」ではなく「面」で見る。1位を取ることではなく、参照される約12席のうち何席を確保するかが勝負になる
    5. 日本語環境の参照元構造は英語圏のベンチマークと異なる。自社で測ったデータが一次情報になる
    6. 前提として、AIクローラーが到達できているかを先に確認する

生成AI検索が本当に「検索の入り口」になるのか、現時点で確実な答えを持っている人はいません。しかし答えが出てから動くのでは遅い。分からないなりに測り、仕込み、また測る。この繰り返しが現実的な進め方だと考えています。

プロンプトセットの設計から伴走します

ギャプライズでは、GEOプラットフォームAthenaHQの提供に加えて、プロンプトセットの設計を伴走支援するプランをご用意しています。

ツールは、定義されたプロンプトに対する言及率・引用・シェアオブボイスを継続的に観測します。一方で、その出発点となる「どの問いを観測対象にするか」は、事業構造と買い手の理解がなければ設計できません。製品構成、ターゲット、市場、競合関係を踏まえて、自社にとって意味のあるプロンプトセットを一緒に組み立てるところからご支援します。

本記事でお伝えした通り、私たち自身も同じプロセスを自社で回し、途中で数値が下がる経験もしています。その過程で得た知見を含めてご提供します。まずは現状を把握したいという段階でも構いません。お気軽にご相談ください。

参照データ:
・ギャプライズ自社計測(A/Bテスト・サイト最適化カテゴリ/3回計測)
・AthenaHQ「State of AI Search 2026」(8つのAIモデル・約800万件の回答を分析/2026年1月公開)
・AthenaHQ「Why Enterprise GEO Requires a Prompt-Led Strategy」(2026年9月26日公開)
・LightSite AI「The State of AI Search Readiness」(6,382ドメインをスキャン/2026 

この記事のタイトルとURLをコピーする

今本 たかひろ/MarTechLab編集長

料理人→旅人→店舗ビジネスオーナー→BPO企業にてBtoBマーケティング支援チームのPLを4年半経験し、2023年2月よりギャプライズへジョイン。フグを捌くのもBtoBマーケティングを整えるのも根本は同じだという思考回路のため、根っこは料理人のままです。家では猫2匹の下僕。虎党でビール党。

関連記事一覧

タグから探す
GDPR/TTDSG 準拠支援
個人情報保護
データキャプチャプラットフォーム
DCP
cookieレス
AIO/GEO/B2A
AI活用
デジタル屋外広告
パフォーマンス
バックオフィス
Web接客
DX(デジタルトランスフォーメーション)
SMSマーケティング
マーケティング全般
市場・競合分析
AR(拡張現実)
画像認識AI
VOC(voice of customer)
BI(ビジネスインテリジェンス)
D2C
EC
ロイヤリティマーケティング
リードジェネレーション
インサイドセールス
インフルエンサーマーケティング
UGCマーケティング
SNSマーケティング
コンテンツマーケティング
メールマーケティング
ソーシャルリスニング
サイト改善
レコメンド
パーソナライズ
ABテスト
UI/UX
ヒートマップ
LPO
アクセス解析
EFO
サイト集客
SEO
Googleショッピング
アドフラウド(不正広告)
広告最適化
リスティング広告
SNS広告
Amazon広告
営業・顧客管理
プロジェクト管理
SFA(営業支援)