AI 品牌監測:你的觀察清單究竟需要多少個提示詞

重點摘要

我們在三個 AI 介面上執行同樣的 20 個提示詞,追蹤來源從何而來。5 個提示詞找到來源全集的 31%,10 個找到 54%,而第 20 個仍然新增了 14 個網域。沒有出現平台期。

每一份 AI 品牌監測計畫都從一份提示詞清單開始,而幾乎每一份清單都是照著團隊已經相信的事情寫出來的。二十個提示詞感覺夠周全,五十個感覺已經窮盡。沒有人去檢查這份清單是否還在發現新東西。

我們在 2026 年 9 月把二十個提示詞跑在三個 AI 介面上,只追蹤一件事:來源出自哪裡。不是我們的品牌有沒有被提到,而是答案拉進來的全部網域集合。如果提示詞清單已經完整,那麼再加提示詞就應該找不到新來源了。事實並非如此。

我們測了什麼

項目

設定

提示詞

20 個關於 AI 可見性工具的購買者問題

介面

ChatGPT(gpt-5)、Gemini 2.5 Flash、Perplexity(sonar),均開啟聯網檢索

收集到的答案

60 條

發現的不同來源

432 個網域

單輪完整執行的成本

1,444 美元

重複覆蓋

同一天把 5 個提示詞各跑兩遍

我們把 60 條答案各自當作對來源宇宙的一次觀測,統計的是不同網域,而不是引用位次。Gemini 在 20 條答案裡回傳了 989 條來源標註,但其中很多指向同一個頁面,所以網域數才是這裡誠實的單位。標註層面的資料在AI 可見性檢查器分析裡。

結論 1:清單永遠不會收口

決定一套監測方案該怎麼搭的正是這一部分。每跑完一個提示詞,我們就把它的新網域併入此前找到的全部結果。

已跑提示詞數

發現的不同來源

占 20 個提示詞總數的比例

1

34

8%

3

91

21%

5

134

31%

10

235

54%

15

336

78%

20

432

100%

最後一個提示詞仍然帶來了 14 個此前任何提示詞都沒翻出來過的網域。二十個提示詞中,最小的邊際增量是 14,最大是 34。在這個區間裡沒有任何一個點,能讓多加一個提示詞變得不划算。也就是說,提示詞清單不是你收集完成的樣本,而是你要一直往下抽的樣本。

說成實務版本:一份憑記憶寫出的五個提示詞清單,大約覆蓋二十個提示詞所覆蓋範圍的三分之一。會察覺到品類變化的那套監測方案,和每個月重複回報同樣五個答案的那套方案,差距就在這裡。

柱狀圖:20 個提示詞各自新增的來源,從 34 起步、到 14 結束,全程沒有出現平原期

結論 2:每個介面看到的,是同一空間裡不同的三分之一

432 個網域分布得並不均勻。每個介面觸及的是同一批問題裡不同的切片。

介面

不同來源

占 432 的比例

每條答案的來源中位數

ChatGPT

47

11%

0

Gemini 2.5 Flash

184

43%

12

Perplexity

285

66%

19

Gemini 和 Perplexity 兩者就找到了 432 個網域中的 400 個,也就是說 ChatGPT 補上了 32 個別的介面都沒翻出來的網域。在 ChatGPT 沒有檢索的那 12 個提示詞上,這個介面貢獻為零,它的中位數之所以是 0 就是這個原因。

對監測來說,這個結論並不舒服。如果你的追蹤工具只盯一個介面,你跑的不是三介面方案的縮小版,你回報的是另一個來源群體,而「我們這個月被引用得更多了嗎」的答案,可能只是「我們什麼都沒改,是介面變了」。我們在答案層面測過同一個效應,見 AI 可見性追蹤器的執行變異

結論 3:兩個介面很少在同一個提示詞上達成一致

我們比較了 Gemini 和 Perplexity 在同一天、同一語言下、針對同一提示詞給出的來源清單。

  • 兩份清單平均只共享 2.5 個網域,而各自大約有 20 個。
  • 平均 Jaccard 重合度為 0.089。
  • 在 ChatGPT 也回傳了來源的那 8 個提示詞裡,只有 3 個能讓三個介面共享哪怕一個網域,三方最大重合為 2 個網域。
  • 三個介面在單一提示詞上完全一致的情況從未發生過。

同一個問題的兩條答案,是用幾乎不相交的頁面集合拼出來的。這是我們找到的、反對單介面回報最有力的論據,同時也是個好消息:一個新頁面被撿起來的機會,遠比單份來源清單所暗示的要多。

結論 4:大多數來源只出現一次

432 個網域的分布極其不均。

  • 432 個網域中有 324 個,也就是 75%,在 60 條答案裡恰好只出現一次。
  • 只在 5 條及以上答案裡出現過的網域只有 17 個。
  • 反覆出現的核心部分既小又可預測:ahrefs.com 出現在 16 條答案裡,semrush.com 15 條,reddit.com 14 條,接著是 frase.io 的 9 條,再往下是一簇各 6 個的集合,包括 otterly.ai、tryprofound.com、llmpulse.ai、cognizo.ai 和 searchenginejournal.com。

這把監測工作劈成兩半,而這兩半想要不同的節奏。反覆出現的核心是需要勤複查的那一層,因為那裡的變化意味著共享來源真的變了。只出現一次的尾部是需要抽樣的那一層,因為在整個宇宙裡,有 75% 的東西在重複出現之前都是雜訊。

柱狀圖:432 個不同來源中,324 個只出現一次,91 個出現 2 到 4 次,17 個在 60 條答案裡出現 5 次以上

不用完整清單,該監測什麼

放進什麼

節奏

每月資料成本

第 1 層:反覆出現的核心

反覆出現的 17 個網域,加上你自己的網域和最接近的三個競品

每週在一個介面上跑

Perplexity 上 0.48 美元,Gemini 上 3.23 美元

第 2 層:提示詞面板

15 到 20 個提示詞,涵蓋品類、對比、定價與問題陳述

每月在三個介面上跑

每輪 1.44 美元

第 3 層:提示詞發現

每月新增 5 個提示詞,寫自業務通話與支援工單

每季複核一次,然後提拔或丟棄

已包含在月度執行裡

這套東西跑下來,有三條規則浮出來。

  1. 記錄提示詞的類別,而不只是提示詞。我們最寬的一條答案來自一個關於「到底怎樣才能被引用」的提示詞,而不是工具對比;最窄的一條反而來自對比。不同類別的行為不一樣,而你要回報的是類別。
  2. 每條記錄裡都保留介面名。沒有介面名的引用數無法比較,因為清單長度能差三倍。
  3. 輪換發現用的提示詞。二十個提示詞找到了 432 個網域,而這條曲線說明換另外二十個會找到另外幾百個。提拔與退役是唯一能讓面板保持誠實的機制。

在這裡成本不是限制。二十個提示詞跑滿三個介面花了 1,444 美元,所以一套月度方案的資料成本一年大約 17 美元,複核時間另計。限制在於複核時間才是更貴的那一半,這也是為什麼分層結構比清單長度更重要。Google 自家的 AI 介面完全不在這份面板裡,它需要另一種量具,我們在 AI Overview 追蹤器裡做過說明。

限制

  • 一天、一個地區、英語、三個介面、每個介面一個模型版本。
  • 網域計數會剔除同一條答案內部的重複,所以一個被引用五次的頁面只算一次。
  • 提示詞類別是我們自己劃分的,不是任何外部分類法。
  • 成本數字只涵蓋答案生成。
  • ChatGPT 的貢獻被它沒有檢索的那 12 個提示詞壓低了,這是那個介面的性質,不是提示詞集合的性質。

常見問題

AI 品牌監測需要多少個提示詞?

我們的資料裡沒有完成點。二十個提示詞找到了 432 個來源,而第二十個仍然新增了 14 個。選一個你每月複核得來的面板規模,然後把精力花在提示詞品質與輪換上,而不是清單長度上。

我應該監測一個 AI 介面還是多個?

多個,而且要分開回報。最重的兩個介面每個提示詞平均只共享 2.5 個來源,三方完全一致從未發生。單介面方案測的是那個介面,不是你的品類。

只出現一次的網域值得追蹤嗎?

只值得當作一次觀察。432 個網域裡有 324 個只出現過一次,所以單次出現更接近雜訊而不是訊號。等它在第二條答案裡出現,最好還是在第二個介面上出現,再把它提拔到反覆出現的層。

面板應該多久跑一次?

完整面板每月一次,反覆出現的核心每週一次。反覆清單夠短,在一個便宜的介面上跑一次週更,每月花不到五十美分,而新來源是在月度那一輪裡進來的。

Auspia 觀點:別再按「感覺夠不夠周全」來決定提示詞清單的規模,開始測量它什麼時候不再發現新東西。在我們的資料裡這個點始終沒有到來,這意味著正確的規劃單位是提示詞類別與輪換,而不是一份更長的名單。把反覆出現的來源分層,對尾部做抽樣,並給你回報的每一個數字都帶上介面名。

作者:艾蓮娜·蕭

探索此主題

繼續閱讀相同的成長脈絡