Orkas Orkas
ホーム ブログ リサーチ
リサーチ

ChatGPT に引用される方法:引用されるかどうかを実際に決めているもの

引用されることはランキングとは別物です。まず検索(リトリーバル)を通り抜け、そのうえで引用に値する一節であること。その仕組みと、実際に効く確認方法、効かない確認方法を解説します。

「どうすれば ChatGPT に引用されるのか」という問いには、たいていリスト形式の答えが返ってきます。良いコンテンツを書く、スキーマを足す、llms.txt を置く。この助言は間違っているというより、狙う層がずれています。ページがどう見えるべきかを語り、結果を実際に決める二つの問いを飛ばしているのです。検索システムはそもそもあなたのページに到達できるのか、そして文脈から引きちぎられても成立する一節がそこにあるのか

この記事は、その仕組みを実際に動く順番で説明します。これらの確認は自社サイトで実行しており、そのうちいくつかは、どれだけコンテンツを磨いても直らなかった問題を見つけてくれました。

要点 言及されることと、引用されることは別です SeoGeoAgent は、どの回答が実際にあなたのドメインを引用しているかを調べ、記憶から出たブランド名の言及と区別します。検索と AI 回答での可視性を参照してください。
Orkas をダウンロード — 無料

引用はランキングではなく、リトリーバルの問題

ChatGPT がリンク付きで答えるとき、質問ごとにウェブをその場で読んでいるわけではありません。リトリーバルの段階がインデックスから候補となる一節を引き出し、モデルは返ってきたものから答えを組み立て、寄りかかった部分に出典を付けます。ここから二つの帰結が出てきます。どちらも従来の SEO の感覚では直感に反します。

  • 単位はページではなく一節です。ページの順位が良くても貢献ゼロということがあります。引用に値する事実が画像の中、テキスト等価物のない図表の中、あるいは JavaScript の実行後にしか存在しない段落の中にあるからです。
  • 取得できることと引用できることは別の水準です。インデックスにあるのは前提条件にすぎません。その問いについて「今ある中で最も明快な一文」であることが、出典を勝ち取ります。多くの GEO チェックリストは前者しか扱わず、そのあとで流入が動かないことに首をかしげます。

ランキングと引用は実際に乖離します。あるキーワードで 3 位にいながら一度も引用されないことはあり得ます。上の 2 ページがたまたま答えを自己完結した一文で述べていて、あなたは「私たちの理念」という見出しの 4 段落目に答えを埋めているからです。

三つのボット、三つの異なる仕事

最も高くつく間違いはここで起きます。「OpenAI のクローラー」を一つのものとして考えてしまうからです。OpenAI は三つの別々のエージェントを文書化しており、それらは同じ仕事をしていません

  • GPTBot — モデル学習のための大規模クロール。ブロックすると、将来のモデルがあなたのサイトから何を吸収するかが変わります。ChatGPT のライブな引用からあなたを外すことはありません。
  • OAI-SearchBot — リトリーバルが読む検索インデックスを構築します。そもそも引用され得るかを決めているのはこれです。
  • ChatGPT-User — ユーザーの質問がライブ閲覧を引き起こしたときに、特定の URL を取得します。これをブロックすると、誰かがあなたについて尋ねたまさにその瞬間に取得が失敗します。

よくある失敗はこうです。あるチームが自社コンテンツをモデル学習に使われたくないと判断し、GPTBot をブロックし、熟慮した決定をしたと信じます。確かにしました — 学習について。リトリーバルについては何も言っていません。さらに悪い版はこうです。誰かがワイルドカード一行で OpenAI のエージェントを全部ブロックし、会社を AI の回答から静かに消し去り、そのあと一四半期かけて、なぜ競合ばかり引用されるのかと悩みます。

これらは分離できる選択なので、分けて決めてください。私たちの robots.txt は三つとも許可し、/api/ と共有リンクをブロックしています。共有リンクはユーザーのコンテンツで、インデックスに載る筋合いがないからです。あなたの判断は違ってよいのです。学習とリトリーバルは本当に別の取引です。ただしベンダー単位ではなくボット単位で決め、ベンダーのドキュメントをときどき読み直してください。これらの方針は動きます。

実際にあなたを止めている門は robots.txt ではない

robots はお願いであり、誰もが確認する層です。実際に噛みついてくるのは CDN や WAF です。エッジのプラットフォームは、多くの既定設定で見慣れない user agent にチャレンジをかけたりブロックしたりします。しかもその結果は静かです。robots.txt には Allow と書いてあり、エッジは 403 を返し、リポジトリの全ファイルが「うちは開いています」と言い張る一方で、あなたはクロール不能になっています。

この確認は十秒で終わりますが、ほとんど誰もやりません。

curl -s -o /dev/null -w "%{http_code}\n" -A "OAI-SearchBot" https://your-site/
curl -s -o /dev/null -w "%{http_code}\n" -A "ChatGPT-User"  https://your-site/
curl -s -o /dev/null -w "%{http_code}\n" -A "PerplexityBot" https://your-site/

200 なら到達可能です。403503、あるいはチャレンジページが返るなら、どれだけコンテンツを直しても解決しない可視性の問題を抱えています。本番に対して、自社ネットワークの外から、運用するドメインごとに実行してください。ドメインごとにエッジ設定は別々で、時間とともにずれていきます。

この記事から一つだけ実行するなら、これにしてください。費やす秒あたりの利回りが最も高い確認であり、どんなコンテンツ監査からも見えません。

事実に JavaScript が必要なら、その事実は存在しない

リトリーバルのクローラーは通常、JavaScript を実行せず生の HTML を解析します。したがって、ある主張が引用可能かどうかの判定はブラウザの表示ではなく、これです。

curl -s https://your-site/page/ | grep -i "引用してほしい主張"

出力に無ければ、引用するものは無いということです。ここには実際の設計上の帰結があります。引用に不可欠なテキスト — 定義、主要な事実、FAQ の回答、価格とセキュリティの主張 — は配信される HTML の中になければなりません。ハイドレーション後にテキストを差し替えるランタイムの辞書は、拡張としては結構です。ただし、その事実が存在する唯一の場所であってはいけません。

これは多言語サイトで最も強く噛みつきます。私たちが意図的に回避した罠でもあります。中国語のコピーが JavaScript の i18n 辞書にしか存在しないなら、生の HTML を読むクローラーにとって、あなたの中国語コンテンツは無いのと同じです。私たちの解法は、各言語を実際のマークアップとして埋め込み、人間がどれを見るかは CSS に決めさせることです。クローラーは四言語すべてを受け取り、読者は一つを受け取ります。ページ重量を払う価値はあります。

文脈から引きちぎられても生き残る一節を書く

ここが配管ではなく実際の「執筆」であり、配管が通ったあとのレバレッジはここにあります。

取得された断片は、あなたのページを伴わずにモデルへ届きます。見出しの階層も、前の段落も、ナビゲーションもありません。それを前提に書いてください。

  • まず答える。見出しの下の最初の一文は、助走ではなく答えであるべきです。「X は Y です」は「今日の急速に変化する状況において……」に勝ちます。後者は何も答えず、決して引用されません。
  • 主語を明示する。「それは OAuth に対応しています」は抜き出された瞬間に使えません。「Orkas は OAuth に対応しています」は生き残ります。代名詞はチャンク化で死にます。
  • 各主張を自己完結させる。実体、限定、境界を一文に。「自分のプロバイダーを使う場合、モデル通信はそのプロバイダーへ直接送られ、Orkas を経由しません。」この一文は単独で引用されても嘘になりません。だからこそ引用に耐えます。
  • 見栄えより検証可能性。曖昧な最上級は決して引用されません。誰も尋ねていない問いにしか答えていないからです。

問いこそがリトリーバルの鍵

ユーザーは問いを立て、リトリーバルは問いの形をしたテキストに一致します。文字どおりその問いである見出し — 「Orkas はモデル通信をプロキシしますか?」 — は、「モデルアーキテクチャ」のような名詞句より良く一致します。FAQ ブロックが AI 可視性において体格以上の働きをするのは、スキーマの魔法ではなくこれが理由です。FAQ は文字どおり問いと答えの対であり、それこそが取得される対象の形だからです。

構造化データは解析可能にするが、優遇はしない

JSON-LD は引用を買えません。買えるのは曖昧さのない分類です。このページが何で、誰が公開し、どのテキストが問いでどれがその答えか。他より重要な規則が二つあります。

  • FAQ スキーマは可視テキストと一対一で一致すること。ページが言っていないことをスキーマが主張するのは信頼の問題であり、検索エンジンはその不一致を書式の不手際ではなくスパムの兆候として扱います。
  • 評価、受賞、件数を捏造しないこと。捏造された集計評価を一つ見つけたエンジンは、あなたの他の主張すべてを割り引く理由を手に入れます。

この一対一の規則は静かに腐る類のものです。誰かが可視 FAQ を編集し、スキーマを忘れ、半年後に両者が食い違います。私たちはテストで強制しています。サイトマップ上の全ページを巡回し、JSON-LD から FAQ を取り出し、各問いと各答えの文字列がそのページの可視テキストにそのまま現れることを検証します。ずれればビルドが落ちます。構造化データは自分のページに関する主張です。主張として検証されるべきです。

llms.txt:安価で、有用で、そして過大評価されている

このファイルについては正直でいましょう。llms.txt提案段階の慣習です。主要なエンジンで読むと約束しているものはなく、これが取り込み経路だと言う人は推測で話しています。

実際の用途はもっと狭く、それでも一時間の価値はあります。正規の事実を飾らずに述べた、安定した一箇所 — 製品が何であるか、モデルとデータの扱い、価格、重要な URL。クローラーや人間の調査者がそこに辿り着いたとき、マーケティングページから再構成する代わりに、粉飾のない版を得られます。良い強制関数でもあります。製品の事実を形容詞なしの四十行で述べられないなら、ページでも述べられません。それは元から抱えていたコンテンツの問題です。

そうでないもの:保証ではなく、事実がページ自体に載っていることの代替でもありません。

矛盾していると外される

回答エンジンは相互検証します。価格ページが一つのことを言い、ドキュメントが別のことを言い、トップページの FAQ が三つ目のことを言えば、エンジンは裁定しません。曖昧にするか、一貫していた誰かを引用します。

ですから面をまたいだ事実の一貫性が実作業の大半であり、どれも華やかではありません。モデル、価格、セキュリティの事実が変わったら、同じ変更の中ですべての場所 — ページ、ドキュメント、トップの FAQ、llms.txt — を変えなければ、その編集より長生きする矛盾を製造したことになります。私たちはこれを習慣ではなく硬い規則として扱います。習慣は締切に負けるからです。

裏付けは自己申告に勝る

最も受け入れがたい点がこれです。あなた自身について、あなたのサイトは最も弱い情報源です。エンジンは裏付けに重みを置きます。それは正しい判断です。自分のドメインにしかない主張はマーケティングの主張です。同じ主張が GitHub に、第三者の比較記事に、フォーラムのスレッドに、誰かが書いたドキュメントにあれば、それは事実です。

だからこそ、サイト内の基礎が本当にできあがったあとは、サイト外の仕事がもう一枚のランディングページより効きます。リポジトリ、ディレクトリ、まとめ記事、本物の議論。身も蓋もなく言えば、サイト内の仕事はあなたを引用可能にし、サイト外の仕事はあなたを引用される状態にします。チームは前者に過剰投資しがちです。自分で制御できる半分だからです。

自分を欺かずに測る方法

GEO の文章はたいていここで緩むので、はっきり言います。ChatGPT の引用はきれいには測れません。ダッシュボードは存在しません。手元にあるのは三つの不完全な信号です。

  • サーバーログ。OAI-SearchBotChatGPT-User を grep してください。クロール頻度とどの URL が取得されたかが、インデックスに入っているか、何がライブで引かれているかを教えます。あなたが所有する最も正直な信号です。
  • アシスタントからの参照トラフィック。本物ですが部分的です。多くの引用は読まれてもクリックされません。それこそが回答エンジンの本質です。
  • 手動の抜き取り確認。取りたい十個の問いを尋ね、誰が引用されるか記録します。地味で、方向性しか分かりませんが、回答面そのものを観察できる唯一の方法です。

三つとも方向性として扱ってください。精密な「GEO スコア」を売る人は、自分で作った数字を売っています。

私たちなら最初に何をするか

スライド映えではなく、利回り順です。

  • 1. リトリーバルのボットで本番に curl -A をかける。エッジがブロックしているなら、このリストの他は無意味です。
  • 2. 主要な主張を curl | grep する。JavaScript 依存のものは配信 HTML に移す。
  • 3. 各見出しの下の最初の一文を、主語を明示した答えに書き直す。
  • 4. FAQ のテキストと FAQ スキーマを一致させ、可視テキストで裏付けられないスキーマは削除する。
  • 5. ページ、ドキュメント、llms.txt の間で矛盾する事実を揃える。
  • 6. そのあとで — そのあとでのみ — サイト外の裏付けを取りに行く。

失われた引用はたいてい 1 と 2 に隠れています。そしてこの二つは誰も記事にしません。コンテンツマーケティングではないからです。

まとめ

ChatGPT に引用されることは、まわりの略語が思わせるほど神秘的ではありません。リトリーバルのボットから到達可能であること。JavaScript なしで読めること。自己完結した一文で引用できること。自分の面どうしで矛盾しないこと。マーケティングサイト以外のどこかで裏付けられていること。ツールは移り変わりますが、この五つは変わりません。

これらの確認は自社サイトで実行し、Orkas のワークフローにも組み込みました。サイトの検索と AI 回答の可視性を監査し、優先順位付きの修正リストを返します。その下の層 — リードエージェントがどう作業を計画し、専門エージェントを派遣するか — を知りたければ、マルチ Agent 編成の実践をお読みください。