GEO 研究综述解读:45 篇论文告诉你 AI 可见性到底靠什么

覆盖 45 篇论文的 GEO 批判性综述显示:被 AI 引用是真实效果,但前提是内容已经被检索到;可持续的“被发现”能力还没有被证明。本文用大白话解读证据,并给出从业者能用的测量方法。

简短答案

2026 年 7 月,研究者 Olivier Martinez 在 arXiv 上发表了一篇批判性综述,题为 Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)。他把 GEO 领域诞生以来发表的 45 篇研究,加上检索与评估方面的相关工作,全部过了一遍,并逐一检验这些结论是否站得住脚。

去掉学术语言,核心结论其实很短:

  • 那些著名的 "GEO 提升数字" 是真的,但有个前提。 2023 年原始 GEO 研究里广为流传的 30–40% 可见性提升,只在那个实验自己的设定下成立,而且只对“已经被引擎检索到”的内容成立。它从来没证明 GEO 能让你被“发现”,也没证明能带来持续流量。
  • 有两根杠杆经受住了证据检验:主题相关性和内容在 AI 答案上下文里的位置。
  • 那些通用的 "GEO 清单" 技巧换个网站、换个市场、换个引擎就不好使了。有些为了被引用而改写的做法,反而会损害检索。
  • 目前没有任何单一技术能证明对“有机可发现性”或下游点击有稳定、可跨平台复现的效果。 已经证明的是:一旦你的内容进入了答案的上下文,你确实能改变它是否被引用、以及被如何使用。

对从业者来说,这不是坏消息,反而是更清晰的地图。别再把它当成一场要打赢的“排名”,去定位你真正输掉的那一环,然后分别测量四个结果,而不是盯着一个模糊的“可见性分数”。

这篇论文是什么(以及为什么批判性综述重要)

你在网上读到的 GEO 建议,大部分都能追溯到少数几篇研究。2023 年那篇 GEO: Generative Engine Optimization 是最大的源头,此外还有大量小实验、博客“案例研究”和各种审计。大多数人只看宣传标题,不看研究方法。

批判性综述不一样。它把一整批研究收集起来,然后问一个问题:如果让别人把实验重做一遍,哪些结论还能活下来? 这篇论文对 GEO 做的正是这件事。

它综述了什么:

项目

详情

覆盖研究

45 篇 GEO 研究,2023 年 11 月至 2026 年 7 月

额外纳入

RAG、检索与评估方面的相关工作

来源

arXiv:2607.14035,2026 年 7 月 15 日发布

作者

Olivier Martinez

篇幅

18 页,8 张表,1 张图

综述还把自己的检索方案和研究清单做成文件一并公开,你可以直接看到哪些论文被纳入、按什么标准筛选。这种透明度很少见,也是它比你自己读那 45 篇更值得读的原因。

用大白话说 GEO

先把定义对齐,免得后面绕。

生成式引擎(generative engine) 是那些用整段话来回答问题的 AI 系统,而不是给你十个蓝色链接。我们日常接触最多的就是 ChatGPT、Gemini、Perplexity、Copilot,还有 Google 的 AI Overviews。

GEO(生成式引擎优化) 就是让你的内容更可能出现在这些引擎的答案里、被引用、并且真正影响答案内容。

论文说得更精确:GEO 的目标是提升你的内容在生成式引擎答案中的出现率、被引用概率、或影响力。注意“出现”和“影响力”是两回事。这个区分正是整篇综述的核心。

为什么 GEO 不是一次排名,而是一条九阶段管道

这是论文的核心论点,也是小白最该带走的一个概念:

GEO 不是一个单一的排序任务,而是一条随机的、部分不可见的管道(stochastic, partially observable pipeline)

这里有两个词很关键。

  • 随机(stochastic):结果里带着你预测不了的随机性。同一个问题问两遍,引擎检索到的来源可能不一样。这也是为什么一张“我的 GEO 结果”截图几乎没有意义。
  • 部分不可见(partially observable):你只能看到最后那个答案,看不到哪些候选被考虑过、怎么被重排、你的页面在第几步被淘汰。

综述把这条管道拆成九个阶段。用大白话讲,每个阶段和普通网站最常见的输法是这样的:

阶段

大白话

普通网站在哪输的

1. 搜索触发

用户的问题让引擎决定“要不要联网查一下”

你的领域靠模型记忆就答完了,根本没触发联网检索

2. 抓取与收录

引擎的爬虫发现并存储了你的页面

页面被屏蔽、太慢、或太冷门,爬虫从没见过它

3. 检索

引擎为答案挑选候选来源

你主题相关,但根本没进候选池

4. 重排与上下文分配

引擎决定哪些候选真正进入答案上下文

你进了上下文,但只分到一个很小的角色

5. 引用

答案里点名或链接你的来源

答案用了你的数据,却没署名给你

6. 凸显度

你在答案里出现得多早、多显眼

被引用了,但放在没人看的位置

7. 事实吸收

答案是否真的采用了你的事实

答案把你的观点改错了,或干脆删掉

8. 保真度

答案是否准确复述了你

答案把你的产品、价格、定位说错了

9. 用户行为

用户是否点进来或采取行动

被引用了,但零点击

大部分 "GEO 工具" 和大部分 GEO 建议只碰到第 4–6 阶段。 如果你的问题在第 2 步(爬虫根本没找到你)或第 3 步(你根本不被检索),再精心打磨引用格式也没用。这条管道告诉你要先看哪里。

GEO 九阶段管道示意图:从搜索触发到用户行为,每个阶段下方标注了普通网站最常见的失败点。

一个好用的类比:被 AI 答案收录,就像被邀请去参加晚宴。到坐上桌之前有很多步:主人得先知道有你这个人,觉得你值得请,还得给你安排位置。坐上桌之后,谈话(引用和吸收)确实很重要。但整个“GEO 技巧”的讨论,讲的都是上桌之后的事。综述让人不舒服的发现是:到目前为止,没人证明如何稳定地“坐到桌边”。

那些著名的 "GEO 提升数字" 怎么解读

2023 年的原始 GEO 研究是这门学科存在的原因。它报告说,给内容施加 GEO 处理(加引用、加数据、理顺结构)后,生成式答案中的平均可见性大幅提升。到处都还在用这个数字当“GEO 有效”的证据。

综述并没有说那项研究错了。它说的是适用范围很窄

原始论文的提升数字,只在它的实验设定内有效,前提是来源已经在固定的上下文里。它既没有证明有机可发现性,也没有证明持续流量效果。

翻译一下。2023 年的实验流程是:研究者先把一组建好的来源放进引擎的上下文,然后测试对这些来源做小改动会不会改变引用行为。这是对“已经被检索的内容做引用优化”的测试,不是对“如何被发现”的测试。

所以正确读法是:

  • “我已经进了答案候选池 → 优化内容可以显著改善我如何被引用、如何使用。” 有证据支持。
  • “做 GEO 就能让我进入候选池。” 现有综述覆盖的任何研究都还没证明。

综述还报告了商业 GEO 审计中反复出现的三个现象:

  • 来源重合度低。 同一个问题,不同引擎选出的来源几乎完全不一样。
  • 多次运行差异大。 同一个引擎、同一个问题,隔天再问,来源就变了。
  • 保真度缺口持续存在。 即便来源被引用,答案仍然会不准确地引用或转述品牌。

这也是为什么单个引擎、某一天的审计截图说明不了什么问题。它是一个数据点,不是一个结果。

证据支持什么、不支持什么

综述的证据回顾是它最实用的部分。以下是用大白话整理出来的杠杆对照:

杠杆

证据怎么说

你该怎么做

主题相关性

各研究中最可复现的杠杆

让页面真正、深入地回答那个问题,而不是沾边

上下文位置

各研究中最可复现的杠杆

把核心答案放在引擎阅读内容的前面、显眼处

通用套路("加数据、加 FAQ、加引用")

换网站换市场就不好使

把清单建议当成假设来测,别当成保证

为引用而改写内容

可能损害检索

别为了拿引用重构内容,你会连已有的可发现性都丢掉

竞争

会侵蚀个人收益

独享蓝海时有效的做法,在拥挤市场可能没用;收益是相对的

长期、跨平台效果

没有任何单一技术被证明

相应调整预期:这是内容和权威的复利玩法,不是一个开关

注意到没有:经得起检验的杠杆都很“无聊”,它们关于你聊什么答案放在哪。而翻车的恰恰是那些刺激的招数:各种“让 AI 引用你”的花活。

你应该分开追踪的四个结果

综述提出一个可见性向量(visibility vector),包含四个部分。这是整篇论文里对做 SEO 或内容运营的人最有用的一套框架:

结果

回答的问题

在这一环失败的例子

可发现性

引擎能不能找到并检索到你?

你的品牌从来不出现在任何候选来源里

引用

引擎用网页来源时,会不会点名你?

答案用了你的数据,链接却给了竞品

吸收

答案有没有真的采用你的事实?

你被引用了,但答案和你页面说的正相反

经济结果

曝光有没有变成点击、访问、线索?

你被显眼地引用,却没人点

可见性向量四象限图:可发现性、引用、吸收、经济结果,每个象限附一句检查方法。

大多数仪表盘把这四样压成一个“AI 可见性分数”。这就像把一家公司的营收和利润当成同一个数来报。四个结果失败的原因完全不同,需要的修复也完全不同:

  • 可发现性低 → 修抓取、收录、主题架构、实体清晰度。
  • 引用低 → 修证据质量、来源标记、页面是否读起来像个权威来源。
  • 吸收低 → 修你的主张是否说得清楚、靠前、准确。
  • 经济结果低 → 修页面本身。答案可能没问题,是落地体验坏了。

一旦分开看,诊断就一目了然。一个“被引用但说错了”的品牌,问题在吸收和保真度,不在可发现性。这个月要是把钱砸在买外链上,就白花了。

对 SEO 和 GEO 从业者意味着什么

下面是诚实、可执行的理解,和我们给品牌跑 AI 搜索可见性检查时看到的情况一致:

继续做这些。 认真建立主题相关性。把核心答案放在前面、讲清楚。让事实平实、有出处、准确,这样引擎用你的时候能准确吸收、保真。建立一致的实体事实(你是谁、卖什么、服务谁),引擎才可能在第一时间把信息归到你名下。这些都是综述证据真正支持的杠杆,也是本来就驱动 SEO 的那套朴素基本功。

别再这样。 指望一个快速、持久的“GEO 排名”。照抄一份通用优化清单就假设它到处有效。为了追引用去重写页面(综述指出这会损伤检索)。把一次引擎快照、一次单次审计当结论。

把 GEO 当管道工作,而不是页面工作。 在打磨第 5 步(引用)之前,先确认你有没有赢下第 3 步(检索)。我们审计的大多数品牌,输在可发现性而不是引用。检查方法很简单:拿买家的问题去多个引擎里问,看你的内容到底有没有进入对话。这个检查比任何改写技巧都重要。

内部预期要诚实。 证据支持的是:对已在候选池里的内容,优化能改善引用和使用。它还不支持“可预测的有机可发现性或流量增长”这种承诺。谁跟你打包票“保证 AI 排名”,谁就是在卖管道里研究还撑不住的那一段。

新手也能用的 5 步测量流程

你不需要付费工具就能按综述建议的方式测量。它的方法论由五个要素构成:重复测量、换一种说法、对照、人工判定、多引擎对比。下面是一个 5 步流程,每周花一小时左右就能跑。

第 1 步:攒一组提示词。 写 10–15 个你真实客户会问的问题,用他们自己的话。不是搜索关键词,是真人会敲进 AI 引擎的那种问句。

第 2 步:为每个提示词记录基线。 对每个问题记录:我的内容出现了吗?我的来源被引用了吗?我的事实被采用了吗?(就是上面那个四结果向量。)用个简单的表格就能记。

第 3 步:隔几天重复,并换种说法再问。 同一天别只问一次,隔几天再问,再试试改述的版本。这就是那个“随机性”检查:某一天的答案是样本,不是结果。免费起点可以用 Auspia 的 AI 搜索可见性检查器,它按提示词记录多个引擎的可见性,方便你对比多次运行,而不是相信一张截图。

第 4 步:跨引擎对比。 同一个问题在两三个引擎里各记一遍。既然审计显示来源重合度这么低,一个从不引用你的引擎可能只是“它本来就不一样”。动手改之前,先拿到跨引擎的全貌。

第 5 步:人工打分,再做决定。 几周后,看四个结果上的整体模式,而不是任何单条答案。如果是可发现性的缺口,就往那里投入;如果是吸收的缺口,就为清晰度改写。一次只改一件事,再重跑同样的提示词。这个“测量 → 改一个杠杆 → 再测量”的循环,就是综述整套方法论在实践中的版本。

常见问题

这是不是意味着 GEO 没用?不是。它意味着 GEO 被证明的部分比宣传的要窄。一旦你的内容被检索到,优化它确实能改变你如何被引用和使用。没有被证明的是“稳定地被检索到”。两者都值得做,只是预期不同。

“30–40% 可见性提升”的说法是假的吗?不是假,是被误用。那些数字来自一个来源已在引擎上下文里的实验,测的是“已检索内容”的引用行为,不是有机可发现性。把它当“有前提的引用提升”,别当排名或流量的保证。

被引用和被吸收有什么区别?被引用是引擎点名了你;被吸收是答案真的用了你的事实。你完全可能被引用、而答案却和你的内容相反,那就是保真度问题。分开测量才能发现这种差别。

那我还要不要为引用优化内容?继续争取引用,但别为了追引用重构内容。综述指出,为引用而改写的做法可能损害检索,而检索恰恰是你能被引用的前提。把目标定为做一个清晰、正确、主题相关的来源,引用是副产品。

我怎么知道自己有没有可发现性?拿客户的问题,跨两三个引擎、连着几天问。如果你的内容从来不出现在来源里,那就是可发现性问题:先修抓取、收录、主题相关性和实体清晰度,再操心引用格式。

审计工具给的 GEO 分数能信吗?当诊断可以信,当结论不能。因为结果逐次、逐引擎都在变,一个分数只是数据点。有用的信号是重复、改述、跨引擎测量下的趋势,这正是综述推荐的那套方法。

作者:Iris Campbell,Auspia 编辑团队证据分析,审阅过 2,500+ 份来源。Iris 主要写研究综述、证据质量,以及在 AI 搜索与 GEO 领域区分“被证明的”和“被吹出来的”。

探索此主题

继续阅读同一增长脉络