词序真的决定 AI Overview 推荐哪个品牌吗?我们用 102 条查询做了验证

重点摘要

一个正在搜索团队间流传的说法是:在对比类查询里把某个品牌写在前面,AI Overview 就有高达 80% 的概率推荐它。我们用 16 组品牌、102 条查询做了验证,词序没有改变答案。真正改变答案的是另外两个变量。

这个月,一个带着非常自信数字的说法在搜索团队之间流传:在对比类查询里把品牌 A 写在前面,Google 的 AI Overview 就有大约 80% 的概率推荐品牌 A;把顺序反过来,推荐也跟着反过来,品牌 A 身量更大、历史更久也没用。

这是个让人舒服的故事,因为它解释了一个追踪 AI 回答的人都亲眼见过的现象:对比类回答长得完全不像结果列表,而 Google 之外没有人能查看它是怎么拼出来的。所以我们做了件很无聊的事——去验证。2026 年 9 月 11 日,我们向线上运行的 Google AI Overview 投出 102 条对比查询,覆盖 16 组品牌、两种词序、每种词序重复 2 到 3 次,并保存了每一条回答和每一个引用来源。

结果是:16 组里有 0 组因为词序改变推荐。查询里写在前的品牌在回答里被先提及的比例是 49%,正好是抛硬币的样子。真正可靠地改变答案的,是查询的措辞方式,以及由哪个 Google 界面来回答。

这个说法的传播版本

这个月流传的版本大致是这样的:

  • 「品牌 A vs 品牌 B」的 AI Overview,大约 80% 的情况下会以品牌 A 开篇并推荐品牌 A。
  • 「品牌 B vs 品牌 A」得到镜像结果。
  • 即使品牌 A 比品牌 B 大得多、久得多,这也成立。
  • 提出的机制是:AI Overview 会把查询拆成多个子搜索,而查询里第一个出现的品牌会锚定这些子搜索。

最后一点正是这个说法可信的原因,也是它证据最扎实的部分。

机制是真的,所以这个说法才传得开

Google 在 2026 年 5 月发布的生成式 AI 功能指南确认了查询扇出:AI Overview 和 AI Mode 可以把一条查询扩展成若干相关子查询,并行地对索引执行,再把结果综合成一条回答。子查询具体是什么,包括 Search Console 在内,任何地方都不会报告。所以当你在看一条 AI Overview 时,你看的是一个你无法观察的过程的输出。

语言模型中的顺序效应同样是真的,背后有同行评审的研究。2026 年 8 月发表于 PNAS Nexus 的一项研究用简历比较和颜色选择测试了 9 个模型,发现位置效应并不只是平局裁决:在某些情况下,调换选项顺序会翻转模型本身的偏好,让它选了更差的选项。Columbia Business School 的研究发现了方向相反的关联模式:ChatGPT 在 5,447 条提示中约有 63% 选择了列表里的第一个选项,在更简单设定的 64,800 次试验中这个结果以 64.29% 复现。

把这两项发现放在一起读,那个流传的说法看上去就是顺理成章的下一步:扇出存在,LLM 有顺序癖好,所以顺序必然决定品牌推荐。

缺口在最后这一步。那些实验要求模型评价一组选项并挑出一个。AI Overview 里的对比查询不是这个任务。它是由一个把答案扎在第三方页面上的检索系统来回答的综合请求。这正是这个说法值得验证而不是值得转发的理由。

我们跑了什么

查询

102 条针对 Google AI Overview,另有 18 条针对 AI Mode

品牌组

16 组(10 组软件,6 组消费品)

词序

两种,每种词序重复 2 到 3 次

措辞

全部组用X vs Y;另有 3 组加测which is better, X or Y

界面

Google 搜索,美国,英语,桌面端

日期

2026 年 9 月 11 日(单日)

采集

SERP API 响应,每次请求一条查询,保存全部 AI Overview 文本元素和完整引用列表

成本

约 0.43 美元的 API 额度

有两个设计选择很重要。第一,每条查询我们跑两到三次,因为在任何带随机性的系统里,一次翻转的答案什么都证明不了。第二,我们记录答案是怎么拼出来的,而不只是它说了什么:哪个品牌先被提及、各自被提及多少次、被引页面长什么样、有多少引用指向各品牌自有域名。

16 组品牌被选来覆盖两种情境:两个品牌都是人们会去调查的实体的软件对比(Notion vs Asana、Slack vs Microsoft Teams、Semrush vs Ahrefs、Figma vs Sketch),以及大品牌明显更大的消费品对比(Nike vs Adidas、Coca-Cola vs Pepsi、iPhone vs Samsung Galaxy、Netflix vs Disney+、Toyota vs Honda、iRobot Roomba vs Roborock)。

结果一:答案没有跟着词序走

在 100 次产生了干净、可测量首次提及的运行中,查询里写在前的品牌被先提及 49 次,即 49%。

「A vs B」中先提及

「B vs A」中先提及

词序改变了它吗

Notion vs Asana

Asana

Asana

Slack vs Microsoft Teams

Microsoft Teams

Microsoft Teams

Wix vs Squarespace

Wix

Wix

Canva vs Adobe Express

Canva

Canva

Mailchimp vs Klaviyo

Klaviyo

Klaviyo

Airtable vs Monday.com

Monday.com

Monday.com

Shopify vs WooCommerce

Shopify

Shopify

Semrush vs Ahrefs

Semrush

Semrush

Figma vs Sketch

Figma

Figma

Zoom vs Google Meet

Google Meet

Google Meet

Nike vs Adidas

Nike

Nike

Coca-Cola vs Pepsi

Coca-Cola

Coca-Cola

iPhone vs Samsung Galaxy

Samsung Galaxy

Samsung Galaxy

Netflix vs Disney+

Netflix

Netflix

Toyota vs Honda

Toyota

Toyota

iRobot Roomba vs Roborock

Roborock

Roborock

没有一组的多数结果发生翻转。当一条回答有偏好时,它在两种词序下都保住了这个偏好:AI Overview 在「Notion vs Asana」和「Asana vs Notion」下都以 Asana 开篇,两次 Airtable 对比都以 Monday.com 开篇,两次 Zoom 对比都以 Google Meet 开篇。Nike 在对阵 Adidas 的两种词序下都领先。Samsung Galaxy 在对阵 iPhone 的两种词序下都领先。

重复运行之间的一致率是 100 次中的 93 次。七次例外里有六次来自同一组品牌换了措辞的那次运行,而这恰恰才是真正的故事。第七次是 Slack vs Microsoft Teams 的一次运行以 Slack 而非 Teams 开篇,随后两次又回到了 Teams。

有一件事这个测量无法定论:一条回答里先出现,和它被推荐,并不是同一回事。所以我们还统计了推荐性措辞。在全部 60 次软件组运行中,使用胜出类词汇(wins、better choice、recommend、stronger、go-to)的句子,在查询首位品牌与次位品牌之间的分布是 40 比 39。完全打平。

显示 16 组品牌对比在调换词序后先被提及的品牌都没有改变的图

结果二:两个答案通常是同一个答案

如果词序真的在锚定子搜索,那么同一条查询的两个版本应该检索到不同的页面,答案也应该分叉。它们基本没有分叉。

在 10 组软件对比中,有 8 组的「A vs B」与「B vs A」AI Overview 逐字相同。并排看 Semrush vs Ahrefs 在两种词序下的首句:

Semrush 是一体化营销平台,而 Ahrefs 是专注 SEO 与外链分析的工具。(引文原文为英文)

同一个句子,同样的事实次序,同样的「如果你选 Semrush……/如果你选 Ahrefs……」收尾,无论查询以哪个品牌开头。真正出现文本漂移的只有两组:Slack vs Microsoft Teams 和 Shopify vs WooCommerce,而 Shopify 那组的漂移只限于开篇段落的措辞不同,结论并没有变。

支撑证据指向同一方向。在软件组运行产生的 806 条引用条目中,指向两个品牌自有域名的引用是 36 比 36。同时包含两个品牌名的被引页面标题里,查询首位品牌排在前面的有 392 条,次位品牌排在前面的有 396 条,即 49.7%,又是一次抛硬币。品牌名总提及数 337 比 336,也就是 50.1% 对 49.9%。

一个检索真的被查询里先出现的品牌带偏的系统,不会产出 36 比 36 的引用分布,也不会产出逐字相同的正文。

真正改变了答案的东西

有两样,而且都比词序更有用。

措辞。 我们为 3 组品牌在两种词序下都跑了「vs」查询和which is better, X or Y查询。AI Overview 表现得像是在回答不同的问题,而且在两种词序下的表现完全一致。

对 Shopify 和 WooCommerce 来说,Shopify vs WooCommerce以产品介绍开篇:Shopify 是一体化托管建站工具,回答顺着差异往下走。Which is better, Shopify or WooCommerce以拒绝排序开篇:两者没有客观优劣,取决于你的需求。同样的四次运行、同一组品牌、同一天,第一印象完全相反,驱动它的是措辞而不是位置。

对 Semrush 和 Ahrefs 来说,which is better的回答里含有明确的判定句,而每一句都归给了 Ahrefs:5 次运行 5 次如此,无论查询写的是Semrush or Ahrefs还是Ahrefs or Semrush。在底层对比语料把 Ahrefs 当作更强外链工具这一事实面前,词序无关紧要。

界面。 我们把其中 18 条同样查询投给了对话式界面 Google AI Mode。它的行为与 AI Overview 不同,看起来像顺序敏感,其实不是。对 Semrush vs Ahrefs,AI Mode 会随查询词序以Both Semrush and Ahrefs are…Both Ahrefs and Semrush are…开篇,直接照抄词序。注意它落在哪个变体上:Both X and Y,一个完全不含排序含义的结构。领句的那个名字只是提示词的文体回声。

在这个回声之下,AI Mode 的实质内容远比 AI Overview 不稳定:同一种词序内的运行间文本相似度只有 0.30 到 0.36,跨词序是 0.38,而 AI Overview 在大多数组里产出了完全相同的文本。3 组中有 2 组,AI Mode 的答案跨词序逐字相同;在 Shopify 那组,AI Mode 两次都固定在 WooCommerce 开篇,而 AI Overview 两次都固定在 Shopify。每个界面都有自己固化的措辞习惯,而这些习惯并不相同。

显示同一组品牌对比在不同措辞下 AI Overview 开篇完全相反的比较图

词序的故事并非纯属虚构

有一项测量确实跟着词序动了,而且它正是大多数人在盯着的指标:传统结果列表。

在 10 组软件对比中,有 5 组的前三条传统自然结果在「A vs B」和「B vs A」之间不同,其中还包括 AI Overview 在两种词序下完全相同的那一组。Reddit 在大多数软件对比中排在前列,而具体是哪个帖子出现会随措辞变化。所以 Google 搜索在对比类查询上确实存在顺序敏感度。它位于 AI 回答下面那一层,而不在推荐本身里。这个区别正是这次验证值得做的全部理由,也不是我们预期会写进文章的发现。

这一点对汇报很重要。如果你的排名追踪器显示品牌词与非品牌对比查询之间的排名在跳动,你看到的是真实效应。只是它不是那个流传说法所描述的效应,针对它做优化也不会改变 AI Overview 怎么谈论你。

数据真正指向的杠杆

我们运行中最清晰的信号跟查询怎么构造完全无关。它跟每条回答所依据的对比语料有关。

在 Airtable vs Monday.com 中,被引来源包含 18 个 Monday.com 自有页面和 0 个 Airtable 自有页面,两种词序都是如此。Mailchimp vs Klaviyo 是 6 个 Mailchimp 自有引用、0 个 Klaviyo。Shopify vs WooCommerce 产生了 3 个 WooCommerce 自有引用、0 个 Shopify 自有引用。与此同时,很多组里两个品牌的自有域名一个都没出现:回答是由第三方对比文章、评测站点和论坛帖子拼起来的。

这个模式与检索实际工作的方式一致。模型不在乎你先敲了哪个名字,它在乎哪些页面存在、以及它们怎么描述每个品牌。品牌自己掌握了对比内容,这些页面就会被拉进来;没掌握,它们就会从每个提问者的回答里缺席。

怎么自己跑一次词序翻转测试

十五分钟,不需要 API 权限:

  1. 挑五条对比查询,你的品牌是其中一方,且对手是真实竞品。
  2. 每条都按两种词序各跑两次。每组四个答案,一共十对答案。
  3. 在读之前先把答案存下来。截图或复制全文与被引来源。
  4. 分开比较两件事:哪个品牌先被提及,以及回答对每个品牌分别说了什么。我们发现有趣信号的地方,正是词序稳定而实质内容不稳定之处。
  5. 看引用列表,而不只是正文。如果竞品自有域名反复出现而你的不出现,你就找到了真正的瓶颈。

AI Overview Citation Checker 会显示某个查询下 AI Overview 引用了哪些页面,这是最快确认你的域名是否在引用池里的方法。

在下任何结论之前,至少分两天各做一次。我们自己的运行间一致率是 93% 而不是 100%,而一次孤立的翻转运行,正是那种会变成一篇自信博客文章的噪声。

拿这个结果怎么办

不要围绕词序去重构你的对比页面。没有任何证据表明它能改变 AI Overview 的推荐,就算 Google 将来真的给它加权,修正也不过是改一个词,而这种修正对你的真实站位毫无说明。

要把措辞当成真实变量。X vs Ywhich is better, X or Y是不同的查询,产出不同的答案。如果你的买家以问句形式做比较,你需要的是回答那个问题的内容,而不只是一张逐项规格对照表。

要检查在你在意的对比里,你的品牌自有页面是否出现在引用中。我们看到的 18 比 0 是这份数据集中最具可操作性的数字,而它是关于发布内容的,不是关于提示词措辞的。

如果你已经有首次提及指标,留着它,但把它当作对答案内容的描述,而不是一个你能拉动的杠杆。在我们的数据里,它是一次跟随语料而非跟随查询的抛硬币。

局限

这是来自单一地点、单一语言、桌面端、通过 SERP API 而非浏览器会话采集的一天数据,覆盖 16 组品牌。搜索结果会随个性化、时间和设备变化,单日数据无法排除未来的改变。

我们测量的是哪个品牌先被提及、被提及多频繁、哪些来源被引用。这些都不是对读者而言答案有多大说服力的直接测量,而一条先提到你品牌的答案,仍然可能留下对手更胜一筹的印象。

AI Mode 样本是 3 组共 18 条查询,足够看出界面行为不同,不足以量化它。请把那一节读作方向,而不是比率。

最后,原始说法里的机制主张从外部仍然无法验证。Google 确认扇出会发生,却不公开子查询,所以没人能展示你的查询产出了哪些子查询。我们的验证能说明翻转词序没有改变输出。它不能说明原因。

FAQ

Google 查询里的词序会影响 AI Overview 吗?在我们的验证里不会。覆盖 16 组品牌、两种词序的 102 条 AI Overview 查询中,查询首位品牌被先提及的比例是 49%,没有任何一组的答案在我们调换查询后改变方向。10 组软件对比中有 8 组在两种词序下返回了逐字相同的答案。

为什么有人说顺序会影响 AI 推荐?因为要求语言模型从列表里挑一个时,顺序效应是被记录过的,公开研究里第一个选项约有 63% 的概率被选中;也因为 Google 的查询扇出让检索过程不可见。这两件事都是真的。但两者都不意味着 AI Overview 里的对比查询会因为你调换名字顺序而翻转品牌。

对一条对比查询而言,真正改变 AI Overview 的是什么?措辞和界面。Shopify vs WooCommerce在两种词序下都产出产品导向的回答,而which is better, Shopify or WooCommerce在两种词序下都产出「没有客观优劣」的回答。同样的查询放到 AI Mode 又会以另一种框架返回,运行间波动也大得多。

值得为 AI Overview 的首次提及做优化吗?盯着它,但不要为它做优化。在我们的数据里,首次提及跟随的是来源语料,而不是我们从查询端控制的任何东西。可控变量是你自己的对比页面是否在引用池里:我们测过的一组拿到了 18 条竞品自有引用和 0 条来自另一个品牌。

相关阅读

作者:Ethan Marlowe,Auspia 的 GEO 测量负责人,覆盖 500 多个提示词。撰写 AI 可见度测量、提示词集设计,以及如何做出经得起第二次审视的测试。

探索此主题

继续阅读同一增长脉络