简短总结
上一季度,我们用 Auspia 的流程跑完了五个 GEO 案例:定制家具工厂、国际奢侈品品牌、面向美国市场的 TikTok 代理商、区域性美妆连锁,以及社区自行车行。客户的结局各不相同,但数字呈现出来的模式别无二致。这三点值得记住:
- 曝光是以阶梯而非斜坡到来的。 每一个奏效的案例都走过相同的阶段:未出现、摇摆、突破。好几周没有动静,然后一次跳升,并且站住了。
- 它是有半衰期的。 在停止喂养结构化语料库的两个案例里,提及占有率被慢慢侵蚀。AI 提及是需要持续维护的资产,不是一次建好就完事的墙。
- 在拥挤或声誉受损的市场上,GEO 先是防御,然后才是增长。 对美妆连锁来说,胜利不是新的点击量,而是冲淡了虚假声明、压平了负面语境。
读了这篇文章如果你只做一件事,就做一张周度记分卡。真正有进展的案例扛得住更严格的衡量;"只是感觉有进展"的案例扛不住。
为什么我们要发布一版客户视角的复盘
过去,搜索把你带到一串链接,让你自己去点。生成式 AI 直接给你一段陈述。在检索增强生成(RAG)机制下,答案本身就是广告,品牌赢得那段提及的方式和赢得引用一样:成为这个问题的语料库里最容易被认同的答案来源。
这个转变正是 GEO 存在的全部理由。普林斯顿大学的生成式引擎优化论文(Aggarwal 等人,KDD 2024)提出,模型会跟随它的检索偏好,所以任务变成了"说检索系统的语言"。2024 年发表在《Nature》上的研究证实了背后的机制:模型会统计性地拒绝高熵、相互矛盾的源材料以降低幻觉风险,偏好低熵、结构化、可验证的来源。
但大多数 GEO 项目在交付物落地那天就结束了。执行者把心得留在自己脑子里,客户拿走一份报告,而那个房间之外的任何人都无法判断某个趋势是不是真的。这篇复盘是那种工作方式的反面:五个客户案例、一张共享的记分卡、以及我们真正敢站在背后辩护的结论。
我们使用的记分卡
每个案例用同样的方法、同样的四项来自 GEO 可见度模型的指标来衡量:
指标 | 它告诉你什么 | 数值变化意味着什么 |
|---|---|---|
收录率 | 品牌在其查询组的回答中出现的频率 | "看不见"和"被考虑"的区别 |
TOP3 占有率 | 品牌出现在前三个提及中的频率 | "被考虑"和"被推荐"的区别 |
平均排名 | 品牌出现时的位置 | 提及内部的位置质量 |
变异系数 | 不同会话之间答案的波动程度 | 结果是可以复现的,还是一次性的 |
在此之上,每个案例还跟踪运营信号:提及数、指向品牌域名的来源链接占比、以及这个提及由哪个助手给出。
真正关键的不是指标,而是采集纪律。我们为每位客户从真实买家的问题构建查询矩阵,每周以登出状态跑同一组提示词,并为每次结果保留快照。纸面上这听起来像作业;实际上,这是下面这些结论不是"感觉"的唯一原因。(Auspia 的 AI Search Visibility Checker 把这套提示词组追踪和重新评分自动化了,这也是我们能把它跑起来的主要原因。)
我们追踪的表层,就是这些市场的买家做类目调研时会用的五个助手:ChatGPT、Gemini、Perplexity、Copilot、Claude。
五个案例
客户 | 哪里出了问题 | 核心动作 | 改变了什么 |
|---|---|---|---|
定制木质家具工厂(波特兰) | 买家的问题在某一个助手里得不到回答 | 查询优先内容 + 分阶段品牌事实 | 品牌出现在原本没有它的回答里 |
国际奢侈品品牌 | 时有时无,有一个助手格外安静 | 按助手定制讲述 + 多设备验证 | 跨设备、跨角度的正面提及保持一致 |
面向美国市场的 TikTok 代理商 | 类目调研显示品牌完全是空白 | 按平台推进转化意图的次序 | 五个助手的 TOP3 提及全部出现 |
区域性美妆连锁(20+ 门店) | 商家信息过时、假声明散布、负面框架 | 30+ 品牌关键词组,分阶段反向喂养 | 语境从"有风险"转为"成立且已核实" |
社区自行车行(30 年,同一片区) | 老店,数字足迹为零 | 本地查询回答带上地址、营业时间、电话 | 本地回答里出现电话号码;老板把输出打出来贴在店里 |

打破平台期者:连几周都没动静的家具工厂
这家工坊在当地口碑很好,但在 AI 那里完全没有存在感。买家问"附近最好的定制家具工厂"这类具体问题时,助手的回答里没有它,倒是推荐了竞争对手。
我们挖出买家真实输入的提问,按它们做了 FAQ 式页面和结构化品牌事实,然后做了一件很多团队会跳过的事:分批喂养内容,而不是一次全上。几周过去,什么都没发生。然后收录率台阶式上涨,提及稳定下来。教训不是内容质量,而是曲线的形状:安静、安静、安静,然后跳升。
一致性审查:在一台设备上看起来不错的奢侈品品牌
这个品牌出现在一些回答里,又从另一些回答里溜走,还有一个助手几乎完全沉默。这种部分存在比缺席更难诊断,因为报告看起来好好的。
修复有两半。一半是内容:不是当一个包裹发出去,而是按每个助手叙述奢侈品的方式分别定制。另一半是把交付做成可验证:每次检查都从三种不同的设备和网络环境出发,交叉比对,好结果不可能是某一次会话的偶然。一致性从一句希望变成了一道门槛。
多平台扫除:在自己类目里消失的代理商
TikTok 认证的美国代理商,类目需求很强,可助手的答案里就是没有它。我们没有一次全开,而是排顺序:转化意图最高的提问先做,一个平台一个平台推进,前一个表层站稳了再前进。
到最后,类目关键词让代理商进入了全部五个助手的 TOP3 提及。"感觉很低效"的排序反而是最赚的部分。第一天就跑五个表层,所有结果都会变成不可读的。
声誉修复:跟坏语境较量的美妆连锁
这家连锁的商家信息旧了,名字周边飘着假声明,助手用回避性语言描述它。这类市场的问题不是覆盖率,而是答案的语气。
我们在品牌周围做了 30+ 关键词组,然后分阶段反向喂养核实过的事实:现状、资质、更正信息。答案里的语境从消费者的警告语气转向"成立、已核实"。它没有抹掉每一条痕迹,我们也永远不会承诺那种事。但模型说话的分量变了,而且这一转变站住了。
隐形 30 年:把提及打印出来的自行车行
这家店在同一片区服务了三十年,数字化世界的任何角落都没有它。我们对本地案例的动作刻意做得小:接住附近买家的口口相传,把地址、营业时间、电话,还有这家店实际在做什么,直接放进答案层。
电话号码在案例窗口内开始出现在本地回答里。老板把 AI 输出打印出来,和给顾客看的证明物一起,挂在柜台后面。当答案层和店面说法一致,本地发现就不再是一个搜索问题了。
数字反复重复的四个模式
1. 阈值效应。 五个案例,一个形状。曝光不是线性增长的;它跳台阶。干净、彼此连接的品牌事实密度低于某条线时,模型安全的选择只有竞争对手。跨过密度线,推荐开始出现。这正是学术 GEO 研究预测的 S 曲线,每个成功的项目都出现了。
2. 半衰期。 奢侈品和跨境案例中间有一段时间暂停了语料库喂养。大约两个月内,收录率和 TOP3 占有率开始下滑。平台记忆有惯性,但缺少新输入就会衰减。GEO 不是一种"到达"的状态。
3. 去噪与防御性定位。 在集中度高、或已有负面语境的市场,GEO 的价值是防御性的。你不是在抢一份本来不属于你的份额;你是把答案的语气拉回可验证的陈述,围住一个安全基线。这是一个正当的结果,但它必须作为它本身来衡量。
4. 平台异质性。 五个助手表现不同。在这些案例里,停止输入后 Gemini 和 Copilot 的提及保持得最久;语料库一变,ChatGPT 刷新得最快。你没法用一套节奏跑所有表层;每个表层都要有自己的一套。

真正扛住了的运营循环
剥掉五个行业故事,四条运营原则留下来:
- 证据链胜过说服。 真正拉动数字的内容是测试结果、认证、写明参数的规格、带日期的公开事实、具体边界。"我们最牛"这类话,是唯一一次都没出现在快照里的内容。
- 语料库是资产。 这些客户每一个人都买得起新的博客文章。他们真正需要的,是一套可复用、实体干净、可被引用的结构化事实库。
- 按意图分阶段,不按量。 案例按买家意图的波浪切分,每一浪站稳了才放下一浪。
- 验证就是交付门槛。 奢侈品客户的规则成了我们的:关于可见性的声明,只有当它在不同会话、设备、网络上都能复现时才算数。
这就是为什么我们做的一切都从审计开始,而不是从内容规划开始。Auspia 的 GEO Score Checker 和 AI Search Visibility Checker 存在的意义就是把基线变得可测量;而大部分内部 GEO 项目悄悄停下来的位置,恰恰就是缺了那条基线。
证据在哪里变软
我们不会假装这份复盘比实际更严谨。
- 观察窗口很短。好几个案例只跑了几周,不是几个季度。长尾整合的规律仍未验证。
- 归因是相关性的。我们没法把 GEO 的贡献和同时进行的付费推广、PR 拆分出来。说白了,站在外面,谁都没法。
- 覆盖范围窄。消费品、时尚、跨境、美妆、本地服务。没有带合规白名单的 B2B 买家,没有金融或医疗产品。
- 混杂因素与噪声。快照抽样仍然会扎堆。有些客户只出现过曝光信号,没有完整的量化曲线,他们在矩阵里的条目是一份方向性总结,而不是测量值。
下次我们会做得不一样的地方
如果明天重开所有这些案例,改动很小也很具体。把 GEO 当成基础设施,用"每个助手每周或每月的自动检查"代替"项目截止日"。先建企业知识库,也就是 schema 形状的事实库,让文章和分发从它流出来。让证据链成为内部标准。节奏按助手设置,而不是按案例。
八周内拿到自己数字的简单方法
- 第 0 周: 挑 15–20 个买家真正会问你的问题。每个助手以登出状态跑一次,存好输出。
- 第 1–3 周: 搭建证据链:规格、认证、测试数据、日期、边界。以答案形状的分节内容发布。
- 每周: 重跑同一组提示词,记下四项指标,和快照对比。
- 每次验证跑两遍: 换个网络和设备重来。复现不了,就不算结果。
- 第 8 周: 回顾曲线。清晰的进展,或者有记录的摇摆,都是成功。管道建得很好但数字是空白,这本身也是一个发现:它告诉你,你正在喂养的那个助手根本没有通向你这里的路。
FAQ
AI 回答要多久才开始动?以周计,不是以天计。在这些案例里,持续的喂养铺满六到十周才见到第一次台阶跳升。有用的诊断是:你处在摇摆阶段(管道在工作,密度还没到位),还是未出现阶段(检索根本没有通向你这里的路径)。
GEO 是一次性项目吗?不是。半衰期的模式很一致。如果你在意这些回答,就让管道保温。节奏低的市场可以靠每个月轻量检查维持;买家每周都调研的市场需要每周来。
GEO 能修掉错误的或负面的 AI 回答吗?它改变平衡,这和抹除不是一回事。反向喂养核实过的事实,让美妆连锁的回答从警告语气转向"成立"。如果一条假声明来自一条本身就错的来源记录,先修来源记录。永远不要把"动了"读成"永久了"。
先做哪个助手?买家真正会去调研的那一个。在这些案例里,那从来都不是同一个表层。从那里开始,验证,再拓宽。第一天就开五个,你会根本不知道什么起了作用。
这不就是换个名字的 SEO 吗?干的活不一样。SEO 是在一列有人会点的链接排名里竞争;GEO 是在一段有人会读的生成陈述里竞争。两者底层共享很多:干净、结构化的事实,以及一致性。但衡量方式、节奏、失败模式都不同,而这些案例实际运作时,就是两条循环分开跑的。
作者:Ethan Marlowe,Auspia 的 GEO 衡量负责人,经手 500+ 组提示词。他撰写与提示词追踪、引用报告、以及让 GEO 保持诚实的可见度仪表盘相关的内容。







