GEO 案例複盤:五個客戶專案教會我們關於 AI 搜尋可見度的事

橫跨家具、精品、跨境、美妝、在地服務的五個案例顯示:GEO 的成果非線性到來,餵養停止就會衰減,而在擁擠或聲譽受損的市場中它主要是防禦性工具。

簡短版

上一季我們透過 Auspia 的工作流程跑完五個 GEO 案例:訂製家具工廠、國際精品品牌、做美國市場的 TikTok 代理商、區域美妝連鎖,以及社區單車行。客戶的結果各不相同,但數字呈現的模式別無二致。這三點值得記住:

  1. 曝光是以階梯而非斜坡抵達。 每個奏效的案例都走過相同順序:未出現、搖擺、突破。好幾個星期沒動靜,然後一次跳升,而且守住了。
  2. 它會衰減(半衰期)。 我們停止餵養結構化語料庫的兩個案例中,提及佔有率慢慢被侵蝕。AI 提及是要持續維護的資產,不是一次建好的牆。
  3. 在擁擠或聲譽受損的市場,GEO 是先防禦再成長。 對美妝連鎖而言,勝利來自稀釋假聲明、壓平負面脈絡,而不是新增點擊。

讀完這篇如果只做一件事,就做一張每週計分卡。真正有進展的案例扛得住更嚴格的驗證;只是「感覺有進展」的案例扛不住。

為什麼我們要公開客戶端的複盤

搜尋過去給人一串連結,讓使用者自己點。生成式 AI 丟給你的是一段陳述。在檢索增強生成(RAG)機制下,答案本身即是廣告,品牌獲得那段提及的方式,跟贏得引用一樣:成為這個問題的語料庫裡最容易被同意的來源。

這個轉變正是 GEO 存在的原因。普林斯頓大學的生成式引擎優化論文(Aggarwal 等人, KDD 2024)主張,模型會依循檢索偏好,所以任務變成「說檢索系統的語言」。2024 年發表於《Nature》的研究則證實了背後的機制:模型會統計性地拒絕高熵、彼此矛盾的來源資料,以降低幻覺風險,偏好低熵、結構化、可驗證的來源。

但多數 GEO 專案在交付物落地當天就結束了。執行者的心得留在自己腦子裡,客戶拿到一份報告,而那個房間以外的任何人都無法判斷某個趨勢是不是真的。這篇複盤正是那種工作方式的相反做法:五個客戶案例、一張共用的計分卡,以及我們確實敢站出來辯護的結論。

我們使用的計分卡

全部案例都用同一套標準、同一組來自 GEO 可見度模型與四項指標衡量:

指標

告訴你什麼

數值變動代表什麼

收錄率

品牌在其查詢組的「答案」中出現的頻率

「看不見」與「被納入候選」之間的差別

TOP3 佔有率

品牌出現在前三個提及的頻率

「被納入候選」與「被推薦」之間的差別

平均排名

品牌出現時的落點

提及品質與定位品質

變異係數

不同 session 之間答案的波動程度

結果是穩定可複現,還是一次性

在此之上,每個案例另外記錄營運訊號:提及數、指向品牌域名的來源連結佔比,以及這個提及是哪個助理帶出的。

真正的關鍵不在指標,而在收集紀律。我們為每位客戶從真實買家的問題出發建立查詢矩陣,每週以登出狀態跑同一組提示詞,並保留快照。紙上看起來像作業;實務上,這是讓下面這些結論不是「感覺」的唯一原因。(Auspia 的 AI Search Visibility Checker 會自動化這套提示詞組追蹤與重新計分,這也是我們能持續執行的主因。)

追蹤的表層就是這些市場的買家做類別調研會用的五個助理:ChatGPT、Gemini、Perplexity、Copilot、Claude。

五個案例

客戶

哪裡出了問題

核心動作

改變了什麼

訂製木家具工廠(波特蘭)

買家的問題在某個助理那裡得不到回答

查詢優先的內容 + 分階段品牌事實

品牌出現在原本缺席的答案中

國際精品品牌

時有時無,尤其有一個助理幾乎沉默

分助理的故事適配 + 多裝置驗證

跨裝置、跨情境一致的正面提及

做美國市場的 TikTok 代理商

類別調研顯示品牌完全空白

依平台安排轉換意圖的順序

五個助理全都進前三個提及

區域美妝連鎖(20+ 分店)

商家資訊過時、假聲明散落、負面框架

30+ 品牌關鍵字組,分階段反向餵養

脈絡從「有風險」轉向「已認證、可信」

社區單車行(30 年,同一區域)

老字號,數位足跡全零

在地查詢答案帶上地址、營業時間、電話

在地答案出現電話;老闆把輸出印出來貼在店裡

GEO 衡量與證據迴圈五步驟:基準提示詞組、每週快照與得分、證據語料庫建置、按表層分發、多裝置驗證,再回到每週刷新。

破高原者:連幾週都沒動靜的家具工廠

這家工廠在地口碑很好,AI 上卻完全沒有存在感。買家問的是「附近最好的訂製家具工廠」這類具體問題,助理回答時連提都沒提到它,反而推薦競爭對手。

我們挖掘買家實際輸入的問題,做成 FAQ 型頁面與結構化品牌事實,然後做了一件很多團隊會跳過的事:分批投餵內容,而不是一次全上。幾個禮拜過去,什麼都沒發生。然後收錄率跳了一格,提及穩住了。教訓與內容品質無關,而是曲線的形狀:安靜、安靜、安靜,然後跳升。

一致性稽核:在某台裝置上「看起來很好」的精品品牌

這家品牌在某些答案裡出現,在另一些答案裡又不見,其中一個助理幾乎完全沉默。這種部分曝光比「缺席」更難診斷,因為報告看起來沒問題。

解法有兩半。一方面內容不是一個包裹,而是依照各助理敘述奢侈品的方式分別調整;另一方面我們把交付做成可驗證:每次檢查都從三種不同的裝置與網路環境跑,互相交叉比對,讓一次 session 的良好結果不可能成為僥倖。一致性從「希望」變成「門檻」。

多元平台掃除:在自己類別裡消失的代理商

TikTok 認證的美國代理商,類別需求強勁,但助理的答案裡就是沒有它。我們不一次全開,而是排順序:先做最高轉換意圖的問題,一個平台一個平台推進,前一個表層站穩了再前進。

最終,類別關鍵字讓這家代理商的品牌名稱出現在全部五個助理的前三個提及裡。那個「感覺沒效率」的排序,反而是最賺的部分。第一天就開五個平台,所有結果都會變得不可解讀。

聲譽修復:對抗負面情境的美妝連鎖

連鎖的商家資訊陳舊,名字周圍浮著假聲明,助理用迴避性語言描述它。這種市場的問題不是覆蓋率,而是答案的語氣。

我們圍繞品牌做了 30+ 關鍵字組,然後分階段反餵驗證過的事實:現況、資格、更正資訊。答案的情境從消費者警告語言,轉向「已認證、可信」。沒有抹去每一條痕跡,而且我們從不承諾那種事。但模型的說法平衡改變了,而且轉向維持住了。

隱形 30 年:把「提及」印出來的那家單車行

這家店在同一區開了三十年,但數位世界裡沒有它。我們對在地案例的動作刻意做得小:截取附近買家口耳相傳的問題,把地址、營業時間、電話,以及這家店實際在做的事,直接放進回答層。

電話號碼在案例期間內開始出現在在地答案中。老闆把 AI 輸出印出來,貼在收銀台後方,和給顧客看的證明並排。當回答層和店面說法一致,在地搜尋就不再是個搜尋問題了。

數字反覆出現的四個模式

1. 閾值效應。 五個案例,一個形狀。曝光不會線性成長;它是跳階。當乾淨、互連的品牌事實密度不足某個臨界點,模型安全的選擇只剩下競爭者。跨過密度線,推薦就開始出現。這就是學術 GEO 文獻預測的 S 曲線,每個成功的專案都出現。

2. 半衰期。 精品與跨境案例有一段暫停餵養語料庫的時間。大約兩個月內,收錄率與 TOP3 佔有率開始滑落。平台記憶有慣性,但沒有新輸入就會衰減。GEO 不是一個「到達」的狀態。

3. 去噪與防禦性定位。 在集中度高、或已有負面脈絡的市場,GEO 的價值是防禦性的。你不是在搶原本沒有的市佔,而是把答案的語氣拉回可驗證的陳述、維持一個安全基準。這是正當的結果,但必須當作「它本身」來衡量。

4. 平台異質性。 五個助理行為不同。這些案例中,Gemini 與 Copilot 在停止輸入後最久仍保有提及;語料庫一變,ChatGPT 反應最快。你無法用同一套節奏套用所有表層;每個表層要各自一套。

GEO 可見度在閾值之上沿 S 曲線爬升,停止餵養語料庫後則會衰減。

真正撐得住的營運迴圈

剝掉五個行業故事,剩下四條營運原則:

  • 證據鏈勝過說服。 真正帶動數字的內容是測試結果、認證、寫死的規格、有日期的公開事實、具體邊界。「我們最強」這種喊話,是唯一從未出現在任何一張快照裡的內容。
  • 語料庫是資產。 每個客戶都買得起新部落格文章。他們真正需要的,是一組可重用、實體乾淨、可被引用的結構化事實庫。
  • 按意圖分階段,而不是按量。 案例按買家意圖的波浪拆開,每波站穩了才開下一波。
  • 驗證就是交付門檻。 精品客戶的規則後來變成我們的:一個關於可見度的宣稱,只有在跨 session、跨裝置、跨網路都能重現時才算數。

這也是為什麼我們所有東西從「稽核」開始,而不是從內容企劃開始。Auspia 的 GEO Score Checker 與 AI Search Visibility Checker 存在的目的,就是把基準線變成可測量的東西;而大部分內部 GEO 計畫卡住的地方,正好就是缺那條基準線。

證據開始變軟的地方

我們不會假裝這份複盤比實際情況更嚴謹。

  • 觀察窗口很短。多個案例只跑幾週,不是幾季。長尾整合的規則還未驗證。
  • 歸因是相關性。我們無法把 GEO 的貢獻與同時進行的付費推廣、公關拆分開來。老實說,圈外人沒有任何人能做到。
  • 範圍很窄。消費品、時尚、跨境、美妝、在地服務。沒有需要合規白名單的 B2B 買家,沒有金融或醫療產品。
  • 混淆因素與雜訊。快照抽樣仍會聚類。有些客戶只顯示出曝光訊號,從未有完整量化曲線,所以他們在矩陣裡的條目是方向性總結,而非量化測量。

下次會怎麼做不一樣

如果明天重啟這五個案例,改變會小而具體。把 GEO 當基礎設施,把「每個助理每週或每月的自動檢查」取代「專案結束日」。先建企業知識庫,也就是 schema 形狀的事實庫,然後讓文章與分發從它流出來。讓證據鏈成為內部標準。節奏按助理設定,而不是按案例。

八週內取得自家數字的簡易做法

  • 第 0 週: 挑 15–20 個買家真正會問你的問題。每個助理以登出狀態跑一次,存下輸出。
  • 第 1–3 週: 建證據鏈:規格、認證、測試資料、日期、界線。以「答案形狀」的分節內容發布。
  • 每週: 重跑同一組提示詞,記錄四項指標,與快照比較。
  • 每次驗證跑兩次: 換一個網路與裝置重跑。結果不能重現,就不算結果。
  • 第 8 週: 看曲線。清楚的進展或是有記錄的搖擺,都算成功。管道建得很好但數字空白,也是一個發現:它告訴你,你正在餵的那個助理根本沒有路徑接到你。

FAQ

AI 答案要多久才開始動?以週為單位,不是以天。在這些案例中,有意義的窗口是一致餵養六到十週才出現第一次跳階。有用的診斷是:你是在「搖擺期」(管道有效,密度還不夠),還是「未出現期」(檢索根本沒有到你這裡的路徑)。

GEO 是一次性專案嗎?不是。半衰期模式很一致。你在意答案,就要讓管道保溫。低頻市場可以靠輕量月檢;買家每週調研的市場需要每週。

GEO 能修掉錯誤或負面的 AI 答案嗎?它改變平衡,這和抹除不同。反餵驗證過的事實,讓美妝連鎖的答案從警告語氣轉向「已認證」。若假聲明來自一個本身就有問題的來源記錄,先修來源記錄。永遠不要把「動了」讀成「永久的」。

先從哪個助理開始?買家實際會調研的那一個。這些案例裡,它從不是同一個表層。那裏開始、驗證,再擴散。第一天就開五個,你根本不可能知道什麼有效。

這不就是換個名字的 SEO 嗎?任務不同。SEO 是在一列「有人會點」的連結排名裡競爭;GEO 是在一段「有人會讀」的生成陳述裡競爭。底層共享:乾淨、結構化的事實與一致性。但衡量、節奏、失敗模式都不同,而這些案例實際就是分開跑這兩條迴圈的。

作者:Ethan Marlowe,Auspia 的 GEO 衡量負責人,經手 500+ 組提示詞。他撰寫關於提示詞追蹤、引用報告,以及讓 GEO 保持誠實的可見度儀表板。

探索此主題

繼續閱讀相同的成長脈絡