詞序真的決定 AI Overview 推薦哪個品牌嗎?我們用 102 條查詢做了驗證

重點摘要

一個正在搜尋團隊之間流傳的說法是:在比較型查詢裡把某個品牌寫在前面,AI Overview 就有高達 80% 的機率推薦它。我們用 16 組品牌、102 條查詢做了驗證,詞序沒有改變答案。真正改變答案的是另外兩個變數。

這個月,一個帶著非常自信數字的說法在搜尋團隊之間流傳:在比較型查詢裡把品牌 A 寫在前面,Google 的 AI Overview 就有大約 80% 的機率推薦品牌 A;把順序反過來,推薦也跟著反過來,品牌 A 規模更大、歷史更久也沒用。

這是個讓人舒服的故事,因為它解釋了一個追蹤 AI 回答的人都親眼看過的現象:比較型回答長得完全不像結果列表,而 Google 之外沒有人能查看它是怎麼拼出來的。所以我們做了件很無聊的事——去驗證。2026 年 9 月 11 日,我們向線上運行的 Google AI Overview 投出 102 條比較查詢,涵蓋 16 組品牌、兩種詞序、每種詞序重複 2 到 3 次,並保存了每一條回答與每一個引用來源。

結果是:16 組裡有 0 組因為詞序改變推薦。查詢裡寫在前的品牌在回答裡被先提及的比例是 49%,正好是擲銅板的樣子。真正可靠地改變答案的,是查詢的措辭方式,以及由哪個 Google 介面來回答。

這個說法的流傳版本

這個月流傳的版本大致是這樣的:

  • 「品牌 A vs 品牌 B」的 AI Overview,大約 80% 的情況下會以品牌 A 開篇並推薦品牌 A。
  • 「品牌 B vs 品牌 A」得到鏡像結果。
  • 即使品牌 A 比品牌 B 大得多、久得多,這也成立。
  • 提出的機制是:AI Overview 會把查詢拆成多個子搜尋,而查詢裡第一個出現的品牌會錨定這些子搜尋。

最後一點正是這個說法可信的原因,也是它證據最紮實的部分。

機制是真的,所以這個說法才傳得開

Google 在 2026 年 5 月發布的生成式 AI 功能指南確認了查詢扇出:AI Overview 和 AI Mode 可以把一條查詢擴展成若干相關子查詢,平行地對索引執行,再把結果綜合成一條回答。子查詢具體是什麼,包括 Search Console 在內,任何地方都不會回報。所以當你在看一條 AI Overview 時,你看的是一個你無法觀察的過程的輸出。

語言模型中的順序效應同樣是真的,背後有同儕審查的研究。2026 年 8 月發表於 PNAS Nexus 的一項研究用履歷比較與顏色選擇測試了 9 個模型,發現位置效應並不只是平手裁決:在某些情況下,調換選項順序會翻轉模型本身的偏好,讓它選了更差的選項。Columbia Business School 的研究發現了方向相反的關聯模式:ChatGPT 在 5,447 條提示中約有 63% 選擇了列表裡的第一個選項,在更簡單設定的 64,800 次試驗中這個結果以 64.29% 重現。

把這兩項發現放在一起讀,那個流傳的說法看上去就是順理成章的下一步:扇出存在,LLM 有順序癖好,所以順序必然決定品牌推薦。

缺口在最後這一步。那些實驗要求模型評價一組選項並挑出一個。AI Overview 裡的比較查詢不是這個任務。它是由一個把答案紮在第三方頁面上的檢索系統來回答的綜合請求。這正是這個說法值得驗證而不是值得轉發的理由。

我們跑了什麼

查詢

102 條針對 Google AI Overview,另有 18 條針對 AI Mode

品牌組

16 組(10 組軟體,6 組消費品)

詞序

兩種,每種詞序重複 2 到 3 次

措辭

全部組用X vs Y;另有 3 組加測which is better, X or Y

介面

Google 搜尋,美國,英語,桌面端

日期

2026 年 9 月 11 日(單日)

擷取

SERP API 回應,每次請求一條查詢,保存全部 AI Overview 文字元素與完整引用列表

成本

約 0.43 美元的 API 額度

有兩個設計選擇很重要。第一,每條查詢我們跑兩到三次,因為在任何帶隨機性的系統裡,一次翻轉的答案什麼都證明不了。第二,我們記錄答案怎麼拼出來的,而不只是它說了什麼:哪個品牌先被提及、各自被提及多少次、被引頁面長什麼樣、有多少引用指向各品牌自有網域。

16 組品牌被選來涵蓋兩種情境:兩個品牌都是人們會去調查的實體的軟體比較(Notion vs Asana、Slack vs Microsoft Teams、Semrush vs Ahrefs、Figma vs Sketch),以及大品牌明顯更大的消費品比較(Nike vs Adidas、Coca-Cola vs Pepsi、iPhone vs Samsung Galaxy、Netflix vs Disney+、Toyota vs Honda、iRobot Roomba vs Roborock)。

結果一:答案沒有跟著詞序走

在 100 次產生了乾淨、可測量首次提及的運行中,查詢裡寫在前的品牌被先提及 49 次,即 49%。

「A vs B」中先提及

「B vs A」中先提及

詞序改變了它嗎

Notion vs Asana

Asana

Asana

Slack vs Microsoft Teams

Microsoft Teams

Microsoft Teams

Wix vs Squarespace

Wix

Wix

Canva vs Adobe Express

Canva

Canva

Mailchimp vs Klaviyo

Klaviyo

Klaviyo

Airtable vs Monday.com

Monday.com

Monday.com

Shopify vs WooCommerce

Shopify

Shopify

Semrush vs Ahrefs

Semrush

Semrush

Figma vs Sketch

Figma

Figma

Zoom vs Google Meet

Google Meet

Google Meet

Nike vs Adidas

Nike

Nike

Coca-Cola vs Pepsi

Coca-Cola

Coca-Cola

iPhone vs Samsung Galaxy

Samsung Galaxy

Samsung Galaxy

Netflix vs Disney+

Netflix

Netflix

Toyota vs Honda

Toyota

Toyota

iRobot Roomba vs Roborock

Roborock

Roborock

沒有一組的多數結果發生翻轉。當一條回答有偏好時,它在兩種詞序下都保住了這個偏好:AI Overview 在「Notion vs Asana」和「Asana vs Notion」下都以 Asana 開篇,兩次 Airtable 比較都以 Monday.com 開篇,兩次 Zoom 比較都以 Google Meet 開篇。Nike 在對陣 Adidas 的兩種詞序下都領先。Samsung Galaxy 在對陣 iPhone 的兩種詞序下都領先。

重複運行之間的一致率是 100 次中的 93 次。七次例外裡有六次來自同一組品牌換了措辭的那次運行,而這恰恰才是真正的故事。第七次是 Slack vs Microsoft Teams 的一次運行以 Slack 而非 Teams 開篇,隨後兩次又回到了 Teams。

有一件事這個測量無法定論:在一條回答裡先出現,和它被推薦,並不是同一回事。所以我們還統計了推薦性措辭。在全部 60 次軟體組運行中,使用勝出類詞彙(wins、better choice、recommend、stronger、go-to)的句子,在查詢首位品牌與次位品牌之間的分布是 40 比 39。完全打平。

顯示 16 組品牌比較在調換詞序後先被提及的品牌都沒有改變的圖

結果二:兩個答案通常是同一個答案

如果詞序真的在錨定子搜尋,那麼同一條查詢的兩個版本應該檢索到不同的頁面,答案也應該分岔。它們基本沒有分岔。

在 10 組軟體比較中,有 8 組的「A vs B」與「B vs A」AI Overview 逐字相同。並排看 Semrush vs Ahrefs 在兩種詞序下的首句:

Semrush 是一體化行銷平台,而 Ahrefs 是專注 SEO 與外鏈分析的工具。(引文原文為英文)

同一個句子,同樣的事實次序,同樣的「如果你選 Semrush……/如果你選 Ahrefs……」收尾,無論查詢以哪個品牌開頭。真正出現文字漂移的只有兩組:Slack vs Microsoft Teams 和 Shopify vs WooCommerce,而 Shopify 那組的漂移只限於開篇段落的措辭不同,結論並沒有變。

支撐證據指向同一方向。在軟體組運行產生的 806 條引用項目中,指向兩個品牌自有網域的引用是 36 比 36。同時包含兩個品牌名的被引頁面標題裡,查詢首位品牌排在前面的有 392 條,次位品牌排在前面的有 396 條,即 49.7%,又是一次擲銅板。品牌名總提及數 337 比 336,也就是 50.1% 對 49.9%。

一個檢索真的被查詢裡先出現的品牌帶偏的系統,不會產出 36 比 36 的引用分布,也不會產出逐字相同的正文。

真正改變了答案的東西

有兩樣,而且都比詞序更有用。

措辭。 我們為 3 組品牌在兩種詞序下都跑了「vs」查詢和which is better, X or Y查詢。AI Overview 表現得像是在回答不同的問題,而且在兩種詞序下的表現完全一致。

對 Shopify 和 WooCommerce 來說,Shopify vs WooCommerce以產品介紹開篇:Shopify 是一體化代管開店工具,回答順著差異往下走。Which is better, Shopify or WooCommerce以拒絕排序開篇:兩者沒有客觀優劣,取決於你的需求。同樣的四次運行、同一組品牌、同一天,第一印象完全相反,驅動它的是措辭而不是位置。

對 Semrush 和 Ahrefs 來說,which is better的回答裡含有明確的判定句,而每一句都歸給了 Ahrefs:5 次運行 5 次如此,無論查詢寫的是Semrush or Ahrefs還是Ahrefs or Semrush。在底層比較語料把 Ahrefs 當作更強外鏈工具這一事實面前,詞序無關緊要。

介面。 我們把其中 18 條同樣查詢投給了對話式介面 Google AI Mode。它的行為與 AI Overview 不同,看起來像順序敏感,其實不是。對 Semrush vs Ahrefs,AI Mode 會隨查詢詞序以Both Semrush and Ahrefs are…Both Ahrefs and Semrush are…開篇,直接照抄詞序。注意它落在哪個變體上:Both X and Y,一個完全不含排序含義的結構。領句的那個名字只是提示詞的文體回聲。

在這個回聲之下,AI Mode 的實質內容遠比 AI Overview 不穩定:同一種詞序內的運行間文字相似度只有 0.30 到 0.36,跨詞序是 0.38,而 AI Overview 在大多數組裡產出了完全相同的文字。3 組中有 2 組,AI Mode 的答案跨詞序逐字相同;在 Shopify 那組,AI Mode 兩次都固定在 WooCommerce 開篇,而 AI Overview 兩次都固定在 Shopify。每個介面都有自己固化的措辭習慣,而這些習慣並不相同。

顯示同一組品牌比較在不同措辭下 AI Overview 開篇完全相反的比較圖

詞序的故事並非純屬虛構

有一項測量確實跟著詞序動了,而且它正是大多數人在盯著的指標:傳統結果列表。

在 10 組軟體比較中,有 5 組的前三條傳統自然結果在「A vs B」和「B vs A」之間不同,其中還包括 AI Overview 在兩種詞序下完全相同的那一組。Reddit 在大多數軟體比較中排在前列,而具體是哪個討論串出現會隨措辭變化。所以 Google 搜尋在比較型查詢上確實存在順序敏感度。它位於 AI 回答下面那一層,而不在推薦本身裡。這個區別正是這次驗證值得做的全部理由,也不是我們預期會寫進文章的發現。

這一點對彙報很重要。如果你的排名追蹤器顯示品牌詞與非品牌比較查詢之間的排名在跳動,你看到的是真實效應。只是它不是那個流傳說法所描述的效應,針對它做最佳化也不會改變 AI Overview 怎麼談論你。

資料真正指向的槓桿

我們運行中最清晰的訊號跟查詢怎麼構造完全無關。它跟每條回答所依據的比較語料有關。

在 Airtable vs Monday.com 中,被引來源包含 18 個 Monday.com 自有頁面和 0 個 Airtable 自有頁面,兩種詞序都是如此。Mailchimp vs Klaviyo 是 6 個 Mailchimp 自有引用、0 個 Klaviyo。Shopify vs WooCommerce 產生了 3 個 WooCommerce 自有引用、0 個 Shopify 自有引用。與此同時,很多組裡兩個品牌的自有網域一個都沒出現:回答是由第三方比較文章、評測站點和論壇貼文拼起來的。

這個模式與檢索實際運作的方式一致。模型不在乎你先敲了哪個名字,它在乎哪些頁面存在、以及它們怎麼描述每個品牌。品牌自己掌握了比較內容,這些頁面就會被拉進來;沒掌握,它們就會從每個提問者的回答裡缺席。

怎麼自己跑一次詞序翻轉測試

十五分鐘,不需要 API 權限:

  1. 挑五條比較查詢,你的品牌是其中一方,且對手是真實競品。
  2. 每條都按兩種詞序各跑兩次。每組四個答案,一共十對答案。
  3. 在讀之前先把答案存下來。截圖或複製全文與被引來源。
  4. 分開比較兩件事:哪個品牌先被提及,以及回答對每個品牌分別說了什麼。我們發現有趣訊號的地方,正是詞序穩定而實質內容不穩定之處。
  5. 看引用列表,而不只是正文。如果競品自有網域反覆出現而你的不出現,你就找到了真正的瓶頸。

AI Overview Citation Checker 會顯示某條查詢下 AI Overview 引用了哪些頁面,這是最快確認你的網域是否在引用池裡的方法。

在下任何結論之前,至少分兩天各做一次。我們自己的運行間一致率是 93% 而不是 100%,而一次孤立的翻轉運行,正是那種會變成一篇自信部落格文章的雜訊。

拿這個結果怎麼辦

不要圍繞詞序去重構你的比較頁面。沒有任何證據表明它能改變 AI Overview 的推薦,就算 Google 將來真的給它加權,修正也不過是改一個詞,而這種修正對你的真實站位毫無說明。

要把措辭當成真實變數。X vs Ywhich is better, X or Y是不同的查詢,產出不同的答案。如果你的買家以問句形式做比較,你需要的是回答那個問題的內容,而不只是一張逐項規格對照表。

要檢查在你在意的比較裡,你的品牌自有頁面是否出現在引用中。我們看到的 18 比 0 是這份資料集中最具可操作性的數字,而它是關於發布內容的,不是關於提示詞措辭的。

如果你已經有首次提及指標,留著它,但把它當作對答案內容的描述,而不是一個你能拉動的槓桿。在我們的資料裡,它是一次跟隨語料而非跟隨查詢的擲銅板。

局限

這是來自單一地點、單一語言、桌面端、透過 SERP API 而非瀏覽器工作階段擷取的一天資料,涵蓋 16 組品牌。搜尋結果會隨個人化、時間和裝置變化,單日資料無法排除未來的改變。

我們測量的是哪個品牌先被提及、被提及多頻繁、哪些來源被引用。這些都不是對讀者而言答案有多大說服力的直接測量,而一條先提到你品牌的答案,仍然可能留下對手更勝一籌的印象。

AI Mode 樣本是 3 組共 18 條查詢,足夠看出介面行為不同,不足以量化它。請把那一節讀作方向,而不是比率。

最後,原始說法裡的機制主張從外部仍然無法驗證。Google 確認扇出會發生,卻不公開子查詢,所以沒人能展示你的查詢產出了哪些子查詢。我們的驗證能說明翻轉詞序沒有改變輸出。它不能說明原因。

FAQ

Google 查詢裡的詞序會影響 AI Overview 嗎?在我們的驗證裡不會。涵蓋 16 組品牌、兩種詞序的 102 條 AI Overview 查詢中,查詢首位品牌被先提及的比例是 49%,沒有任何一組的答案在我們調換查詢後改變方向。10 組軟體比較中有 8 組在兩種詞序下回傳了逐字相同的答案。

為什麼有人說順序會影響 AI 推薦?因為要求語言模型從列表裡挑一個時,順序效應是被記錄過的,公開研究裡第一個選項約有 63% 的機率被選中;也因為 Google 的查詢扇出讓檢索過程不可見。這兩件事都是真的。但兩者都不意味著 AI Overview 裡的比較查詢會因為你調換名字順序而翻轉品牌。

對一條比較查詢而言,真正改變 AI Overview 的是什麼?措辭和介面。Shopify vs WooCommerce在兩種詞序下都產出產品導向的回答,而which is better, Shopify or WooCommerce在兩種詞序下都產出「沒有客觀優劣」的回答。同樣的查詢放到 AI Mode 又以另一種框架回來,運行間波動也大得多。

值得為 AI Overview 的首次提及做最佳化嗎?盯著它,但不要為它做最佳化。在我們的資料裡,首次提及跟隨的是來源語料,而不是我們從查詢端控制的任何東西。可控變數是你自己的比較頁面是否在引用池裡:我們測過的一組拿到了 18 條競品自有引用和 0 條來自另一個品牌。

相關閱讀

作者:Ethan Marlowe,Auspia 的 GEO 測量負責人,涵蓋 500 多個提示詞。撰寫 AI 可見度測量、提示詞集設計,以及如何做出經得起第二次檢視的測試。

探索此主題

繼續閱讀相同的成長脈絡