AI 可見性檢查器:當引用數與回答不一致時

重點摘要

同樣的 20 個提示詞、三個 AI 介面、一天。Gemini 每條回答引用中位數 47 條來源,Perplexity 為 20 條,而 ChatGPT 在 20 個提示詞中有 12 個完全沒有回傳引用,卻仍點名了廠商。以下是可見性檢查器必須分開處理的兩個訊號。

兩個 AI 可見性檢查器可以在同一天讀同一批回答,卻給出完全相反的結論。一個回傳引用數量,另一個什麼都不回傳,因為那段回答點名推薦了你的品牌,卻從未連結到它。

我們在 2026 年 9 月跨三個 AI 介面跑了 20 個提示詞,並在每一條回答上記錄了兩個訊號:回答在正文中點名的品牌,以及回答作為來源呈現的網域。這兩個訊號不是同一次測量的兩個視角。它們會在可預測的地方分開,而分開的那些地方正是報告裡最有用的部分。

簡短的版本:Perplexity 在每一個提示詞上都引用了來源,Gemini 平均每條回答回傳 47 條來源標註,而 ChatGPT 在 20 個提示詞中有 12 個完全沒有回傳引用,卻仍在那其中 13 個裡點名了廠商。單一介面上的重複執行波動是另一個問題,我們此前在 AI 可見性追蹤器的執行波動 中測量過。

我們跑了什麼

項目

設定

提示詞

買家會問的 20 個關於 AI 可見性工具的問題

介面

ChatGPT(gpt-5-2025-08-07)、Gemini(gemini-2.5-flash)、Perplexity(sonar)

網路搜尋

三個介面全部開啟

地區與語言

美國,英語

日期

2026 年 9 月 12 日

收集到的回答

60 條

整輪執行成本

$1.444,即每條回答 $0.024

重複執行

把同樣的 5 個提示詞再跑一遍,看行為是否穩定

每條回答的成本從 Perplexity 的 $0.006 到 Gemini 的 $0.037 不等。最便宜的介面產出了最一致的來源清單,而最貴的介面並不是回傳來源最多的那一個。

分別測量這兩個訊號

每條回答都被捕獲了兩次:一次作為文字,一次作為該介面附加到這段文字上的來源清單。

介面

來源標註

每條回答

零引用的回答

每條回答的不同網域數

ChatGPT(gpt-5)

90

0 到 18,中位數 0

20 條中 12 條

0 到 10

Gemini 2.5 Flash

989

14 到 122,中位數 47

20 條中 0 條

3 到 23

Perplexity

399

19 到 20

20 條中 0 條

16 到 20

這三份清單不是同一類物件,而這正是檢查器最先搞錯的地方。

柱狀圖,顯示單條回答所附來源數量的中位數:在各自的 20 個提示詞上,ChatGPT 為 0、Gemini 為 47、Perplexity 為 20

Gemini 幾乎給每一條主張都附上來源。同一個頁面可以在一條回答裡佔據許多個位置,這也是數量之所以這麼高的原因:在 20 條 Gemini 回答中,semrush.com 佔了 44 個位置,maxaeo.ai 佔 26 個,google.com 佔 22 個,adobe.com 佔 21 個,medium.com 佔 20 個。這個介面上的高標註數說的是模型拆解得有多細,而不是你的品牌有多廣為人知。

Perplexity 發布的是一個有上限的面板。它在 20 個提示詞中的 19 個上恰好回傳 20 條來源,在第 20 個上回傳 19 條。這就固定了分母:你在一條 Perplexity 回答中的份額永遠是 20 的份額,所以一個位置被拿到,就代表某個別處丟了一個位置。

ChatGPT 只在它搜尋過的時候才回傳來源清單。它在 20 個提示詞中的 8 個上發出了搜尋查詢,在另外 12 個上一無所引。在那 12 個上它仍然回答了問題,仍然點名了工具。舉一個未加編輯的例子:當被問到追蹤 AI 搜尋結果中品牌提及的最佳工具時,它列出了 Brand24、Mention、BuzzSumo、Talkwalker 和 Google Alerts,而這些都沒有附任何來源。我們用來稽核 ChatGPT 回答是否落入這種失敗模式的清單在 ChatGPT 可見性清單

被點名卻未被引用

接著我們針對 27 個品牌與媒體,統計了 60 條回答中有多少條在正文裡點名了該品牌,有多少條把它的網域作為來源引用。這兩欄在兩個方向上都不一致。

品牌

點名它的回答

引用其網域的回答

Semrush

18

15

Reddit

16

14

Otterly

14

6

Ahrefs

13

16

Profound

11

6

Peec AI

11

2

Frase

5

9

HubSpot

5

8

ZipTie

5

0

Siftly

4

5

Keyword.com

4

5

Nightwatch

3

4

LLM Pulse

2

6

Cognizo

1

6

MaxAEO

1

7

Searchable

1

5

AirOps

0

5

Menra

0

4

這張表裡有兩個模式。Peec AI、Otterly、Profound 和 ZipTie 在回答中被推薦的頻率遠高於它們的頁面被連結的頻率。MaxAEO、Cognizo、LLM Pulse、Searchable、AirOps 和 Menra 正好相反:它們的頁面作為來源被拉進來,而回答從未點出公司名。只看連結的檢查器會把第二組判為可見,把第一組判為不可見。只看提及的檢查器則相反。

分組柱狀圖,比較五個品牌在 AI 回答中被點名的頻率與其網域被作為來源引用的頻率,基數為 60 條回答

在全部 60 條回答中,三個介面合計引用了 432 個不同網域。ChatGPT 佔其中 47 個,即 11 個百分點;Gemini 佔 184 個(43 個百分點);Perplexity 佔 285 個(66 個百分點)。無論你檢查哪個介面,你看到的都是一個大得多的來源宇宙中的一份樣本。這裡不包含 Google 自己的介面,那裡的存在感用另一種方式測量,我們的 AI Overview 追蹤器 對此有說明。

檢查器必須記錄什麼

一個只回傳單一數字的可見性檢查器,正在丟掉它四個欄位中的三個。值得留下的是這四個。

欄位

記錄形式

它為什麼改變結論

該介面是否搜尋過

是或否

未搜尋的回答不可能產生引用,所以它的零不是可見性訊號

回答正文中是否點名品牌

回答條數

這是無依據回答上唯一還活著的訊號

來源清單中是否有該網域

回答條數

這是大多數工具單獨報告的那個訊號

分母

回答條數,以及每條回答的來源位置數

固定 20 位的面板和 47 條標註的清單不能作為百分比相互比較

實際後果就是一個假的零。在我們的資料裡,ChatGPT 的 20 條回答中有 13 條至少點名了一個廠商,而只有 8 條引用了任何東西,所以這個介面大約四分之一的回答,會為同一條回答點名推薦的品牌報告零引用。

如何做這件事而不騙自己

如果你把這件事交給代理,失敗模式不是一個錯誤的數字,而是一個從從未被收集的欄位裡算出來的自信的數字。

  • 在計算任何東西之前先捕獲原始酬載。保留回答文字、來源清單、模型識別碼,以及一個表示是否發出了搜尋查詢的布林值。衍生指標屬於第二步的程式碼裡,不屬於蒐集提示詞裡。
  • 讓代理去引用,而不是去摘要。寫「報告品牌出現了多少次」的評分標準產出的是散文。寫「逐字回傳回答文字和來源清單」的評分標準產出的才是你能複核的資料。
  • 在相信任何變化之前重跑同一個提示詞。我們重複了 5 個提示詞,搜尋與否的決定在 5 個中 5 個上一致,這意味著引用數的突然跳升更可能是模型版本或提示詞改動,而不是雜訊。
  • 把模型識別碼留在每一行裡。同樣的 20 個提示詞在同一端點用 gpt-4o 跑,只有 20 條中的 2 條回傳了來源標註,而 gpt-5 是 20 條中的 8 條。
  • 為它留預算。整整 60 條回答的執行花了 $1.444,所以按這些價格,同樣檢查的每週版本一個月約 $6。

限制

  • 一天、一個地區、英語、三個介面。不同地區的回答會不一樣。
  • 每個介面一個模型版本。在我們自己的執行中,行為在模型版本之間就動過。
  • 品牌辨識是按名稱做的字串比對,所以只靠產品名被推薦的品牌可能被漏掉。
  • 網路搜尋是透過 API 開啟的。消費級應用搜尋的頻率可能比這些執行多,也可能更少。
  • 成本只涵蓋回答生成,不含儲存或複核時間。

常見問題

為什麼 ChatGPT 在 20 個提示詞中有 12 個報告零引用?

因為它在那些提示詞上沒有搜尋就作答了。一個從不檢索頁面的模型不可能引用頁面,所以那個零描述的是這次執行,不是你的品牌。在從任何聊天介面讀取引用數字之前,先確認該介面到底有沒有用網路。

如果沒有任何連結,在回答裡被點名還有價值嗎?

在一條無依據的回答上,它就是訊號的全部,而且它也是先於連結出現的那個訊號。在我們的資料裡,提及與連結來自不同的來源:提及跟隨比較類與評測類內容,引用跟隨被結構化得便於被引用的頁面。

我應該把提及和引用合併成一個可見性分數嗎?

不應該。正如品牌表所示,它們在兩個方向上都系統性地不一致,合併後的分數會掩蓋到底是哪一個動了。把它們作為兩條線報告,讓讀者看見那道差距。

我應該先檢查哪個介面?

如果你想要一個穩定、便宜、寬度固定的面板,就選 Perplexity,因為它的清單長度不變。如果你想要廣度,就選 Gemini,它觸達了我們看到的 432 個網域中的 184 個。ChatGPT 只在附帶有效性檢查時才用,否則它五分之一的回答會把一個品牌讀成不可見。

Auspia 觀點:把提及和引用作為兩條獨立的線來報告,並在記錄任何其他東西之前先記錄該介面是否搜尋過。單一的可見性分數恰好掩蓋了那道告訴你下一步該修什麼的差距,而在我們的資料裡,最便宜的修法不是增加內容,而是去檢查一個真正看過網路的介面。

作者:阿德裡安·科爾

探索此主題

繼續閱讀相同的成長脈絡