GEO 案例复盘:五个客户项目教会我们的事(AI 搜索可见度)

横跨家具、奢侈品、跨境、美妆、本地服务的五个案例显示:GEO 的成果非线性到来,停止喂养就会衰减,而在拥挤或声誉受损的市场中它首先是防御工具。

简短总结

上一季度,我们用 Auspia 的流程跑完了五个 GEO 案例:定制家具工厂、国际奢侈品品牌、面向美国市场的 TikTok 代理商、区域性美妆连锁,以及社区自行车行。客户的结局各不相同,但数字呈现出来的模式别无二致。这三点值得记住:

  1. 曝光是以阶梯而非斜坡到来的。 每一个奏效的案例都走过相同的阶段:未出现、摇摆、突破。好几周没有动静,然后一次跳升,并且站住了。
  2. 它是有半衰期的。 在停止喂养结构化语料库的两个案例里,提及占有率被慢慢侵蚀。AI 提及是需要持续维护的资产,不是一次建好就完事的墙。
  3. 在拥挤或声誉受损的市场上,GEO 先是防御,然后才是增长。 对美妆连锁来说,胜利不是新的点击量,而是冲淡了虚假声明、压平了负面语境。

读了这篇文章如果你只做一件事,就做一张周度记分卡。真正有进展的案例扛得住更严格的衡量;"只是感觉有进展"的案例扛不住。

为什么我们要发布一版客户视角的复盘

过去,搜索把你带到一串链接,让你自己去点。生成式 AI 直接给你一段陈述。在检索增强生成(RAG)机制下,答案本身就是广告,品牌赢得那段提及的方式和赢得引用一样:成为这个问题的语料库里最容易被认同的答案来源。

这个转变正是 GEO 存在的全部理由。普林斯顿大学的生成式引擎优化论文(Aggarwal 等人,KDD 2024)提出,模型会跟随它的检索偏好,所以任务变成了"说检索系统的语言"。2024 年发表在《Nature》上的研究证实了背后的机制:模型会统计性地拒绝高熵、相互矛盾的源材料以降低幻觉风险,偏好低熵、结构化、可验证的来源。

但大多数 GEO 项目在交付物落地那天就结束了。执行者把心得留在自己脑子里,客户拿走一份报告,而那个房间之外的任何人都无法判断某个趋势是不是真的。这篇复盘是那种工作方式的反面:五个客户案例、一张共享的记分卡、以及我们真正敢站在背后辩护的结论。

我们使用的记分卡

每个案例用同样的方法、同样的四项来自 GEO 可见度模型的指标来衡量:

指标

它告诉你什么

数值变化意味着什么

收录率

品牌在其查询组的回答中出现的频率

"看不见"和"被考虑"的区别

TOP3 占有率

品牌出现在前三个提及中的频率

"被考虑"和"被推荐"的区别

平均排名

品牌出现时的位置

提及内部的位置质量

变异系数

不同会话之间答案的波动程度

结果是可以复现的,还是一次性的

在此之上,每个案例还跟踪运营信号:提及数、指向品牌域名的来源链接占比、以及这个提及由哪个助手给出。

真正关键的不是指标,而是采集纪律。我们为每位客户从真实买家的问题构建查询矩阵,每周以登出状态跑同一组提示词,并为每次结果保留快照。纸面上这听起来像作业;实际上,这是下面这些结论不是"感觉"的唯一原因。(Auspia 的 AI Search Visibility Checker 把这套提示词组追踪和重新评分自动化了,这也是我们能把它跑起来的主要原因。)

我们追踪的表层,就是这些市场的买家做类目调研时会用的五个助手:ChatGPT、Gemini、Perplexity、Copilot、Claude。

五个案例

客户

哪里出了问题

核心动作

改变了什么

定制木质家具工厂(波特兰)

买家的问题在某一个助手里得不到回答

查询优先内容 + 分阶段品牌事实

品牌出现在原本没有它的回答里

国际奢侈品品牌

时有时无,有一个助手格外安静

按助手定制讲述 + 多设备验证

跨设备、跨角度的正面提及保持一致

面向美国市场的 TikTok 代理商

类目调研显示品牌完全是空白

按平台推进转化意图的次序

五个助手的 TOP3 提及全部出现

区域性美妆连锁(20+ 门店)

商家信息过时、假声明散布、负面框架

30+ 品牌关键词组,分阶段反向喂养

语境从"有风险"转为"成立且已核实"

社区自行车行(30 年,同一片区)

老店,数字足迹为零

本地查询回答带上地址、营业时间、电话

本地回答里出现电话号码;老板把输出打出来贴在店里

GEO 衡量与证据的五步循环:基准提示词集、每周快照与得分、证据语料库建设、按表分层分发、多设备验证,再回到每周刷新。

打破平台期者:连几周都没动静的家具工厂

这家工坊在当地口碑很好,但在 AI 那里完全没有存在感。买家问"附近最好的定制家具工厂"这类具体问题时,助手的回答里没有它,倒是推荐了竞争对手。

我们挖出买家真实输入的提问,按它们做了 FAQ 式页面和结构化品牌事实,然后做了一件很多团队会跳过的事:分批喂养内容,而不是一次全上。几周过去,什么都没发生。然后收录率台阶式上涨,提及稳定下来。教训不是内容质量,而是曲线的形状:安静、安静、安静,然后跳升。

一致性审查:在一台设备上看起来不错的奢侈品品牌

这个品牌出现在一些回答里,又从另一些回答里溜走,还有一个助手几乎完全沉默。这种部分存在比缺席更难诊断,因为报告看起来好好的。

修复有两半。一半是内容:不是当一个包裹发出去,而是按每个助手叙述奢侈品的方式分别定制。另一半是把交付做成可验证:每次检查都从三种不同的设备和网络环境出发,交叉比对,好结果不可能是某一次会话的偶然。一致性从一句希望变成了一道门槛。

多平台扫除:在自己类目里消失的代理商

TikTok 认证的美国代理商,类目需求很强,可助手的答案里就是没有它。我们没有一次全开,而是排顺序:转化意图最高的提问先做,一个平台一个平台推进,前一个表层站稳了再前进。

到最后,类目关键词让代理商进入了全部五个助手的 TOP3 提及。"感觉很低效"的排序反而是最赚的部分。第一天就跑五个表层,所有结果都会变成不可读的。

声誉修复:跟坏语境较量的美妆连锁

这家连锁的商家信息旧了,名字周边飘着假声明,助手用回避性语言描述它。这类市场的问题不是覆盖率,而是答案的语气。

我们在品牌周围做了 30+ 关键词组,然后分阶段反向喂养核实过的事实:现状、资质、更正信息。答案里的语境从消费者的警告语气转向"成立、已核实"。它没有抹掉每一条痕迹,我们也永远不会承诺那种事。但模型说话的分量变了,而且这一转变站住了。

隐形 30 年:把提及打印出来的自行车行

这家店在同一片区服务了三十年,数字化世界的任何角落都没有它。我们对本地案例的动作刻意做得小:接住附近买家的口口相传,把地址、营业时间、电话,还有这家店实际在做什么,直接放进答案层。

电话号码在案例窗口内开始出现在本地回答里。老板把 AI 输出打印出来,和给顾客看的证明物一起,挂在柜台后面。当答案层和店面说法一致,本地发现就不再是一个搜索问题了。

数字反复重复的四个模式

1. 阈值效应。 五个案例,一个形状。曝光不是线性增长的;它跳台阶。干净、彼此连接的品牌事实密度低于某条线时,模型安全的选择只有竞争对手。跨过密度线,推荐开始出现。这正是学术 GEO 研究预测的 S 曲线,每个成功的项目都出现了。

2. 半衰期。 奢侈品和跨境案例中间有一段时间暂停了语料库喂养。大约两个月内,收录率和 TOP3 占有率开始下滑。平台记忆有惯性,但缺少新输入就会衰减。GEO 不是一种"到达"的状态。

3. 去噪与防御性定位。 在集中度高、或已有负面语境的市场,GEO 的价值是防御性的。你不是在抢一份本来不属于你的份额;你是把答案的语气拉回可验证的陈述,围住一个安全基线。这是一个正当的结果,但它必须作为它本身来衡量。

4. 平台异质性。 五个助手表现不同。在这些案例里,停止输入后 Gemini 和 Copilot 的提及保持得最久;语料库一变,ChatGPT 刷新得最快。你没法用一套节奏跑所有表层;每个表层都要有自己的一套。

GEO 可见度越过阈值后沿 S 曲线上升,语料库停止喂养后则开始衰减。

真正扛住了的运营循环

剥掉五个行业故事,四条运营原则留下来:

  • 证据链胜过说服。 真正拉动数字的内容是测试结果、认证、写明参数的规格、带日期的公开事实、具体边界。"我们最牛"这类话,是唯一一次都没出现在快照里的内容。
  • 语料库是资产。 这些客户每一个人都买得起新的博客文章。他们真正需要的,是一套可复用、实体干净、可被引用的结构化事实库。
  • 按意图分阶段,不按量。 案例按买家意图的波浪切分,每一浪站稳了才放下一浪。
  • 验证就是交付门槛。 奢侈品客户的规则成了我们的:关于可见性的声明,只有当它在不同会话、设备、网络上都能复现时才算数。

这就是为什么我们做的一切都从审计开始,而不是从内容规划开始。Auspia 的 GEO Score Checker 和 AI Search Visibility Checker 存在的意义就是把基线变得可测量;而大部分内部 GEO 项目悄悄停下来的位置,恰恰就是缺了那条基线。

证据在哪里变软

我们不会假装这份复盘比实际更严谨。

  • 观察窗口很短。好几个案例只跑了几周,不是几个季度。长尾整合的规律仍未验证。
  • 归因是相关性的。我们没法把 GEO 的贡献和同时进行的付费推广、PR 拆分出来。说白了,站在外面,谁都没法。
  • 覆盖范围窄。消费品、时尚、跨境、美妆、本地服务。没有带合规白名单的 B2B 买家,没有金融或医疗产品。
  • 混杂因素与噪声。快照抽样仍然会扎堆。有些客户只出现过曝光信号,没有完整的量化曲线,他们在矩阵里的条目是一份方向性总结,而不是测量值。

下次我们会做得不一样的地方

如果明天重开所有这些案例,改动很小也很具体。把 GEO 当成基础设施,用"每个助手每周或每月的自动检查"代替"项目截止日"。先建企业知识库,也就是 schema 形状的事实库,让文章和分发从它流出来。让证据链成为内部标准。节奏按助手设置,而不是按案例。

八周内拿到自己数字的简单方法

  • 第 0 周: 挑 15–20 个买家真正会问你的问题。每个助手以登出状态跑一次,存好输出。
  • 第 1–3 周: 搭建证据链:规格、认证、测试数据、日期、边界。以答案形状的分节内容发布。
  • 每周: 重跑同一组提示词,记下四项指标,和快照对比。
  • 每次验证跑两遍: 换个网络和设备重来。复现不了,就不算结果。
  • 第 8 周: 回顾曲线。清晰的进展,或者有记录的摇摆,都是成功。管道建得很好但数字是空白,这本身也是一个发现:它告诉你,你正在喂养的那个助手根本没有通向你这里的路。

FAQ

AI 回答要多久才开始动?以周计,不是以天计。在这些案例里,持续的喂养铺满六到十周才见到第一次台阶跳升。有用的诊断是:你处在摇摆阶段(管道在工作,密度还没到位),还是未出现阶段(检索根本没有通向你这里的路径)。

GEO 是一次性项目吗?不是。半衰期的模式很一致。如果你在意这些回答,就让管道保温。节奏低的市场可以靠每个月轻量检查维持;买家每周都调研的市场需要每周来。

GEO 能修掉错误的或负面的 AI 回答吗?它改变平衡,这和抹除不是一回事。反向喂养核实过的事实,让美妆连锁的回答从警告语气转向"成立"。如果一条假声明来自一条本身就错的来源记录,先修来源记录。永远不要把"动了"读成"永久了"。

先做哪个助手?买家真正会去调研的那一个。在这些案例里,那从来都不是同一个表层。从那里开始,验证,再拓宽。第一天就开五个,你会根本不知道什么起了作用。

这不就是换个名字的 SEO 吗?干的活不一样。SEO 是在一列有人会点的链接排名里竞争;GEO 是在一段有人会读的生成陈述里竞争。两者底层共享很多:干净、结构化的事实,以及一致性。但衡量方式、节奏、失败模式都不同,而这些案例实际运作时,就是两条循环分开跑的。

作者:Ethan Marlowe,Auspia 的 GEO 衡量负责人,经手 500+ 组提示词。他撰写与提示词追踪、引用报告、以及让 GEO 保持诚实的可见度仪表盘相关的内容。

探索此主题

继续阅读同一增长脉络