简短答案
2026 年 7 月,研究者 Olivier Martinez 在 arXiv 上发表了一篇批判性综述,题为 Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)。他把 GEO 领域诞生以来发表的 45 篇研究,加上检索与评估方面的相关工作,全部过了一遍,并逐一检验这些结论是否站得住脚。
去掉学术语言,核心结论其实很短:
- 那些著名的 "GEO 提升数字" 是真的,但有个前提。 2023 年原始 GEO 研究里广为流传的 30–40% 可见性提升,只在那个实验自己的设定下成立,而且只对“已经被引擎检索到”的内容成立。它从来没证明 GEO 能让你被“发现”,也没证明能带来持续流量。
- 有两根杠杆经受住了证据检验:主题相关性和内容在 AI 答案上下文里的位置。
- 那些通用的 "GEO 清单" 技巧换个网站、换个市场、换个引擎就不好使了。有些为了被引用而改写的做法,反而会损害检索。
- 目前没有任何单一技术能证明对“有机可发现性”或下游点击有稳定、可跨平台复现的效果。 已经证明的是:一旦你的内容进入了答案的上下文,你确实能改变它是否被引用、以及被如何使用。
对从业者来说,这不是坏消息,反而是更清晰的地图。别再把它当成一场要打赢的“排名”,去定位你真正输掉的那一环,然后分别测量四个结果,而不是盯着一个模糊的“可见性分数”。
这篇论文是什么(以及为什么批判性综述重要)
你在网上读到的 GEO 建议,大部分都能追溯到少数几篇研究。2023 年那篇 GEO: Generative Engine Optimization 是最大的源头,此外还有大量小实验、博客“案例研究”和各种审计。大多数人只看宣传标题,不看研究方法。
批判性综述不一样。它把一整批研究收集起来,然后问一个问题:如果让别人把实验重做一遍,哪些结论还能活下来? 这篇论文对 GEO 做的正是这件事。
它综述了什么:
项目 | 详情 |
|---|---|
覆盖研究 | 45 篇 GEO 研究,2023 年 11 月至 2026 年 7 月 |
额外纳入 | RAG、检索与评估方面的相关工作 |
来源 | arXiv:2607.14035,2026 年 7 月 15 日发布 |
作者 | Olivier Martinez |
篇幅 | 18 页,8 张表,1 张图 |
综述还把自己的检索方案和研究清单做成文件一并公开,你可以直接看到哪些论文被纳入、按什么标准筛选。这种透明度很少见,也是它比你自己读那 45 篇更值得读的原因。
用大白话说 GEO
先把定义对齐,免得后面绕。
生成式引擎(generative engine) 是那些用整段话来回答问题的 AI 系统,而不是给你十个蓝色链接。我们日常接触最多的就是 ChatGPT、Gemini、Perplexity、Copilot,还有 Google 的 AI Overviews。
GEO(生成式引擎优化) 就是让你的内容更可能出现在这些引擎的答案里、被引用、并且真正影响答案内容。
论文说得更精确:GEO 的目标是提升你的内容在生成式引擎答案中的出现率、被引用概率、或影响力。注意“出现”和“影响力”是两回事。这个区分正是整篇综述的核心。
为什么 GEO 不是一次排名,而是一条九阶段管道
这是论文的核心论点,也是小白最该带走的一个概念:
GEO 不是一个单一的排序任务,而是一条随机的、部分不可见的管道(stochastic, partially observable pipeline)。
这里有两个词很关键。
- 随机(stochastic):结果里带着你预测不了的随机性。同一个问题问两遍,引擎检索到的来源可能不一样。这也是为什么一张“我的 GEO 结果”截图几乎没有意义。
- 部分不可见(partially observable):你只能看到最后那个答案,看不到哪些候选被考虑过、怎么被重排、你的页面在第几步被淘汰。
综述把这条管道拆成九个阶段。用大白话讲,每个阶段和普通网站最常见的输法是这样的:
阶段 | 大白话 | 普通网站在哪输的 |
|---|---|---|
1. 搜索触发 | 用户的问题让引擎决定“要不要联网查一下” | 你的领域靠模型记忆就答完了,根本没触发联网检索 |
2. 抓取与收录 | 引擎的爬虫发现并存储了你的页面 | 页面被屏蔽、太慢、或太冷门,爬虫从没见过它 |
3. 检索 | 引擎为答案挑选候选来源 | 你主题相关,但根本没进候选池 |
4. 重排与上下文分配 | 引擎决定哪些候选真正进入答案上下文 | 你进了上下文,但只分到一个很小的角色 |
5. 引用 | 答案里点名或链接你的来源 | 答案用了你的数据,却没署名给你 |
6. 凸显度 | 你在答案里出现得多早、多显眼 | 被引用了,但放在没人看的位置 |
7. 事实吸收 | 答案是否真的采用了你的事实 | 答案把你的观点改错了,或干脆删掉 |
8. 保真度 | 答案是否准确复述了你 | 答案把你的产品、价格、定位说错了 |
9. 用户行为 | 用户是否点进来或采取行动 | 被引用了,但零点击 |
大部分 "GEO 工具" 和大部分 GEO 建议只碰到第 4–6 阶段。 如果你的问题在第 2 步(爬虫根本没找到你)或第 3 步(你根本不被检索),再精心打磨引用格式也没用。这条管道告诉你要先看哪里。

一个好用的类比:被 AI 答案收录,就像被邀请去参加晚宴。到坐上桌之前有很多步:主人得先知道有你这个人,觉得你值得请,还得给你安排位置。坐上桌之后,谈话(引用和吸收)确实很重要。但整个“GEO 技巧”的讨论,讲的都是上桌之后的事。综述让人不舒服的发现是:到目前为止,没人证明如何稳定地“坐到桌边”。
那些著名的 "GEO 提升数字" 怎么解读
2023 年的原始 GEO 研究是这门学科存在的原因。它报告说,给内容施加 GEO 处理(加引用、加数据、理顺结构)后,生成式答案中的平均可见性大幅提升。到处都还在用这个数字当“GEO 有效”的证据。
综述并没有说那项研究错了。它说的是适用范围很窄:
原始论文的提升数字,只在它的实验设定内有效,前提是来源已经在固定的上下文里。它既没有证明有机可发现性,也没有证明持续流量效果。
翻译一下。2023 年的实验流程是:研究者先把一组建好的来源放进引擎的上下文,然后测试对这些来源做小改动会不会改变引用行为。这是对“已经被检索的内容做引用优化”的测试,不是对“如何被发现”的测试。
所以正确读法是:
- “我已经进了答案候选池 → 优化内容可以显著改善我如何被引用、如何使用。” 有证据支持。
- “做 GEO 就能让我进入候选池。” 现有综述覆盖的任何研究都还没证明。
综述还报告了商业 GEO 审计中反复出现的三个现象:
- 来源重合度低。 同一个问题,不同引擎选出的来源几乎完全不一样。
- 多次运行差异大。 同一个引擎、同一个问题,隔天再问,来源就变了。
- 保真度缺口持续存在。 即便来源被引用,答案仍然会不准确地引用或转述品牌。
这也是为什么单个引擎、某一天的审计截图说明不了什么问题。它是一个数据点,不是一个结果。
证据支持什么、不支持什么
综述的证据回顾是它最实用的部分。以下是用大白话整理出来的杠杆对照:
杠杆 | 证据怎么说 | 你该怎么做 |
|---|---|---|
主题相关性 | 各研究中最可复现的杠杆 | 让页面真正、深入地回答那个问题,而不是沾边 |
上下文位置 | 各研究中最可复现的杠杆 | 把核心答案放在引擎阅读内容的前面、显眼处 |
通用套路("加数据、加 FAQ、加引用") | 换网站换市场就不好使 | 把清单建议当成假设来测,别当成保证 |
为引用而改写内容 | 可能损害检索 | 别为了拿引用重构内容,你会连已有的可发现性都丢掉 |
竞争 | 会侵蚀个人收益 | 独享蓝海时有效的做法,在拥挤市场可能没用;收益是相对的 |
长期、跨平台效果 | 没有任何单一技术被证明 | 相应调整预期:这是内容和权威的复利玩法,不是一个开关 |
注意到没有:经得起检验的杠杆都很“无聊”,它们关于你聊什么和答案放在哪。而翻车的恰恰是那些刺激的招数:各种“让 AI 引用你”的花活。
你应该分开追踪的四个结果
综述提出一个可见性向量(visibility vector),包含四个部分。这是整篇论文里对做 SEO 或内容运营的人最有用的一套框架:
结果 | 回答的问题 | 在这一环失败的例子 |
|---|---|---|
可发现性 | 引擎能不能找到并检索到你? | 你的品牌从来不出现在任何候选来源里 |
引用 | 引擎用网页来源时,会不会点名你? | 答案用了你的数据,链接却给了竞品 |
吸收 | 答案有没有真的采用你的事实? | 你被引用了,但答案和你页面说的正相反 |
经济结果 | 曝光有没有变成点击、访问、线索? | 你被显眼地引用,却没人点 |

大多数仪表盘把这四样压成一个“AI 可见性分数”。这就像把一家公司的营收和利润当成同一个数来报。四个结果失败的原因完全不同,需要的修复也完全不同:
- 可发现性低 → 修抓取、收录、主题架构、实体清晰度。
- 引用低 → 修证据质量、来源标记、页面是否读起来像个权威来源。
- 吸收低 → 修你的主张是否说得清楚、靠前、准确。
- 经济结果低 → 修页面本身。答案可能没问题,是落地体验坏了。
一旦分开看,诊断就一目了然。一个“被引用但说错了”的品牌,问题在吸收和保真度,不在可发现性。这个月要是把钱砸在买外链上,就白花了。
对 SEO 和 GEO 从业者意味着什么
下面是诚实、可执行的理解,和我们给品牌跑 AI 搜索可见性检查时看到的情况一致:
继续做这些。 认真建立主题相关性。把核心答案放在前面、讲清楚。让事实平实、有出处、准确,这样引擎用你的时候能准确吸收、保真。建立一致的实体事实(你是谁、卖什么、服务谁),引擎才可能在第一时间把信息归到你名下。这些都是综述证据真正支持的杠杆,也是本来就驱动 SEO 的那套朴素基本功。
别再这样。 指望一个快速、持久的“GEO 排名”。照抄一份通用优化清单就假设它到处有效。为了追引用去重写页面(综述指出这会损伤检索)。把一次引擎快照、一次单次审计当结论。
把 GEO 当管道工作,而不是页面工作。 在打磨第 5 步(引用)之前,先确认你有没有赢下第 3 步(检索)。我们审计的大多数品牌,输在可发现性而不是引用。检查方法很简单:拿买家的问题去多个引擎里问,看你的内容到底有没有进入对话。这个检查比任何改写技巧都重要。
内部预期要诚实。 证据支持的是:对已在候选池里的内容,优化能改善引用和使用。它还不支持“可预测的有机可发现性或流量增长”这种承诺。谁跟你打包票“保证 AI 排名”,谁就是在卖管道里研究还撑不住的那一段。
新手也能用的 5 步测量流程
你不需要付费工具就能按综述建议的方式测量。它的方法论由五个要素构成:重复测量、换一种说法、对照、人工判定、多引擎对比。下面是一个 5 步流程,每周花一小时左右就能跑。
第 1 步:攒一组提示词。 写 10–15 个你真实客户会问的问题,用他们自己的话。不是搜索关键词,是真人会敲进 AI 引擎的那种问句。
第 2 步:为每个提示词记录基线。 对每个问题记录:我的内容出现了吗?我的来源被引用了吗?我的事实被采用了吗?(就是上面那个四结果向量。)用个简单的表格就能记。
第 3 步:隔几天重复,并换种说法再问。 同一天别只问一次,隔几天再问,再试试改述的版本。这就是那个“随机性”检查:某一天的答案是样本,不是结果。免费起点可以用 Auspia 的 AI 搜索可见性检查器,它按提示词记录多个引擎的可见性,方便你对比多次运行,而不是相信一张截图。
第 4 步:跨引擎对比。 同一个问题在两三个引擎里各记一遍。既然审计显示来源重合度这么低,一个从不引用你的引擎可能只是“它本来就不一样”。动手改之前,先拿到跨引擎的全貌。
第 5 步:人工打分,再做决定。 几周后,看四个结果上的整体模式,而不是任何单条答案。如果是可发现性的缺口,就往那里投入;如果是吸收的缺口,就为清晰度改写。一次只改一件事,再重跑同样的提示词。这个“测量 → 改一个杠杆 → 再测量”的循环,就是综述整套方法论在实践中的版本。
常见问题
这是不是意味着 GEO 没用?不是。它意味着 GEO 被证明的部分比宣传的要窄。一旦你的内容被检索到,优化它确实能改变你如何被引用和使用。没有被证明的是“稳定地被检索到”。两者都值得做,只是预期不同。
“30–40% 可见性提升”的说法是假的吗?不是假,是被误用。那些数字来自一个来源已在引擎上下文里的实验,测的是“已检索内容”的引用行为,不是有机可发现性。把它当“有前提的引用提升”,别当排名或流量的保证。
被引用和被吸收有什么区别?被引用是引擎点名了你;被吸收是答案真的用了你的事实。你完全可能被引用、而答案却和你的内容相反,那就是保真度问题。分开测量才能发现这种差别。
那我还要不要为引用优化内容?继续争取引用,但别为了追引用重构内容。综述指出,为引用而改写的做法可能损害检索,而检索恰恰是你能被引用的前提。把目标定为做一个清晰、正确、主题相关的来源,引用是副产品。
我怎么知道自己有没有可发现性?拿客户的问题,跨两三个引擎、连着几天问。如果你的内容从来不出现在来源里,那就是可发现性问题:先修抓取、收录、主题相关性和实体清晰度,再操心引用格式。
审计工具给的 GEO 分数能信吗?当诊断可以信,当结论不能。因为结果逐次、逐引擎都在变,一个分数只是数据点。有用的信号是重复、改述、跨引擎测量下的趋势,这正是综述推荐的那套方法。
作者:Iris Campbell,Auspia 编辑团队证据分析,审阅过 2,500+ 份来源。Iris 主要写研究综述、证据质量,以及在 AI 搜索与 GEO 领域区分“被证明的”和“被吹出来的”。












