如果有人问过你的品牌在 ChatGPT 里出不出现,诚实的第一个回答是:在确认一件事之前,空白结果和真正的零看起来一模一样。这份指南写给那些没有监测平台、只能用聊天窗口、一张表格和大约三十分钟交出这个答案的人。
读完之后,你会拿到每个提示词的判定、一份能在会议上站得住的复现记录,以及一个让它保持最新的定时任务。完成条件很简单:对每个提示词,你都能说出这次回答是否已检索、是否点了品牌名、是否链接到网站。
完成之后你手里有什么
产出 | 存放位置 |
|---|---|
从真实对话写出的 8 到 12 个问题的提示词清单 | 表格的第一个标签页 |
每个提示词一行,含四个字段和模型版本 | 同一个标签页 |
每个提示词四种判定之一,并附上对应动作 | 判定列 |
至少两个提示词的复跑 | 同一张表的第 2 行和第 3 行 |
带固定评分标准的定期检查 | 智能体的项目文件夹 |
前提条件:能使用带网页搜索的 ChatGPT、一张表格,以及在自动化时愿意为一次十个提示词的跑批花大约 0.29 美元。
第 1 步:提示词要从对话里写,不要从关键词里写
把销售团队最近回答过的二十个问题翻出来,然后归类。在我们的二十个提示词研究里,最宽的来源清单来自一个关于怎样才能被引用的提问,最窄的清单来自工具之间的一对一比较,所以提问的形态决定了你能拿回多少数据。
跨四种形态写出 8 到 12 个提示词:品类(“适合 Y 的最佳 X”)、比较(“A 与 B”)、问题(“我怎么知道 AI 是否知道我们公司”)、佐证(“2026 年谁在推荐 X”)。再加上两个直接点名你品牌的提示词,因为它们的行为和品类型不一样。如果你想为同一份清单拿到跨平台的证据,AI 可见性检查器分析展示了同一个提示词送到三个平台时会发生什么变化。
产出:一份最终的 8 到 12 个提示词清单,每个都标上形态。质量检查:每个提示词都必须是客户真会敲进去的那种。如果某个提示词存在的唯一理由就是里面有个关键词,删掉它。
第 2 步:在读取任何其他东西之前先过有效性闸门
这是大多数检查都会跳过的一步,也正是空白被当成零上报的原因。在我们的跑批里,ChatGPT 在 20 个提示词中的 8 个上发出了搜索查询,另外 12 个凭记忆作答。
我们观察到的情况 | 已检索的回答(8 个提示词) | 未检索的回答(12 个提示词) |
|---|---|---|
发出的搜索查询 | 每个提示词 4 到 8 条 | 0 |
返回的来源标注 | 6 到 18 条,中位数 12 | 0 |
引用的不同域名 | 4 到 10 个,中位数 7 | 0 |
正文中仍然点名的品牌 | 有 | 有,全部 20 个提示词中 13 个 |
在你记录任何关于品牌的东西之前,先跑一遍每个提示词,回答一个问题:模型到底查过东西吗?在 ChatGPT 界面里,线索就是回答下方那份来源清单。如果没有来源清单,这次回答是凭记忆生成的,它对你品牌的沉默目前毫无意义。
产出:已检索列里每个提示词的是或否。质量检查:没有来源清单的回答绝不作为可见性信号记录,只作为记忆信号记录。我们那些未检索的回答也并不更短,输出 token 中位数是 1,730,而已检索的是 1,645,所以长度不是一个可用的线索。
第 3 步:记四个字段,不是一个
每个提示词只留一个数字,正是报告彼此打架的原因。把这四个留住。
字段 | 取值 | 为什么重要 |
|---|---|---|
已检索 | 是或否 | 决定这个提示词究竟能不能产生链接 |
品牌被点名 | 是或否 | 在未检索的回答里依然存活的信号 |
域名被链接 | 是或否 | 大多数工具单独报告的那个信号 |
模型版本 | 例如 gpt-5-2025-08-07 | 在我们的跑批中,行为在不同版本之间发生了变化 |
最后一个字段不是杂务。同样这 20 个提示词,在同一个端点上换用旧模型,只有 2 个提示词返回了来源,而当前模型是 8 个。没有模型版本的报告没法跟下个月的对比。
产出:每个提示词四个填满的字段。质量检查:任何一个格子是空的,这一行就不能上报。把原始回答文本和原始来源清单跟字段存在一起,好让复核的人不必重跑提示词就能复查判定。

第 4 步:把每个回答归入四种判定之一
判定 | 含义 | 下一步做什么 |
|---|---|---|
已检索且已链接 | ChatGPT 查了资料,并引用了你的域名 | 保护被引用的页面,并确认是哪种提问形态带来了它 |
已检索但未链接 | 它搜索了、读了网页,却推荐了别人 | 差距在内容与来源覆盖,不在模型知识 |
未检索但被点名 | 它凭记忆作答,仍然点了你的名 | 无需修复。之后用同一个提示词复跑,看它是否开始搜索 |
未检索且未被点名 | 它凭记忆作答,没有点你的名 | 还不是信号。修正提示词,或等一次已检索的跑批 |
第四行正是大多数误报的来源。在我们的数据里,20 条 ChatGPT 回答中有 13 条至少点名了一个厂商,而只有 8 条引用了任何东西,这意味着只看链接的检查会把相当一部分回答看成空的,而同一段文字其实正在点名品牌。

产出:每个提示词一个判定,外加对应动作。质量检查:任何“看不见”的判定都必须绑定在已检索的回答上。如果某个判定背后的理由经不起写成一句话,就重跑这个提示词。
第 5 步:在相信一次变化之前,先把两个提示词重复一遍
至少用两个提示词在新会话里跑第二遍,然后比较判定,而不是比较计数。
提示词 | 第一次跑 | 第二次跑 | 是否稳定 |
|---|---|---|---|
最好的 AI 可见性工具 | 已检索,13 条来源,6 个域名 | 已检索,14 条来源,4 个域名 | 判定稳定,计数不稳定 |
追踪品牌提及的最好工具 | 已检索,8 条来源,8 个域名 | 已检索,9 条来源,5 个域名 | 判定稳定,计数不稳定 |
审计我的品牌在 AI 回答中的表现 | 未检索,0 条来源 | 未检索,0 条来源 | 稳定 |
AI 回答多久变一次 | 未检索,0 条来源 | 未检索,0 条来源 | 稳定 |
在我们重复过的五个提示词里,是否搜索这个决定每次都自洽,而域名计数会浮动两三个。这就是正确的标定方式:把判定当作信号,把计数当作带范围的估计。
产出:至少两个提示词的复跑行。质量检查:如果提示词没变、判定却在两次跑批之间翻转,把这个提示词标为不稳定,并从环比报告里排除,直到它重新复现。
第 6 步:把检查放进定时任务
一次十个提示词的检查,在当前的 ChatGPT 模型上大约花 0.29 美元,每周跑一次大约每月 1.27 美元。在这个价位上,活儿不是 API 调用,而是评分标准,所以这项任务应该交给一个带明确采集规则的智能体,而不是交给一个“帮我总结一下”的请求。
把这些约束交给智能体:
- 逐字抓取回答文本,逐字抓取来源清单。两者都不做摘要。
- 每一行都记录已检索标记、模型版本和时间戳。
- 计数在采集之后用代码算,绝不在提示词里面算。
- 写入带日期的文件,让复跑无法覆盖上个月的证据。
如果你已经在跑一个做搜索报告的智能体,采集模式跟用 Codex 做每日 SEO 与 GEO 监测里用的是同一套,同一个循环的终端版本在 Claude Code 每日监测里。这里唯一新增的要求就是已检索标记,因为一个没有搜索过的聊天平台绝不能被读成引用结果。
产出:一个写出带日期行的定时任务。质量检查:打开上周的文件,确认仅凭存下来的证据就能把判定重建出来。
验证:一次合格的检查长这样
- 每一行都有已检索标记、模型版本和日期。
- 每一个“看不见”的判定都属于已检索的回答。
- 至少有两个提示词跑了两遍,并且比较了它们的判定。
- 原始回答文本和原始来源清单就存在计数旁边。
- 提示词清单按形态打了标签,报告按形态而不是按总数来分组结果。
局限
- 一个模型版本、一个地区、英文、一天的跑批。ChatGPT 的行为在不同版本之间有差异。
- 网页搜索是通过 API 开启的。消费端应用可能会在另一组提示词上搜索。
- 品牌点名是用字符串匹配测的,所以没有公司名的产品名可能被漏掉。
- 这项检查测的是回答,不是流量。引荐行为是另一项测量。
常见问题
为什么 ChatGPT 对我的品牌只字不提?
先确认它有没有搜索过。在我们的跑批里,20 个提示词中有 12 个是凭记忆、没有任何来源作答的,而那些回答可能从过时的训练数据里点出一个厂商,也可能谁都不点。一个未检索的回答不是你可见性的证据。
我应该在 ChatGPT 里检查多少个提示词?
每个周期 8 到 12 个就够看出规律,前提是它们覆盖品类、比较、问题和佐证四种形态。跑一百个提示词,得到的只是同样四种形态的更大样本,而不是新信息。
我不用 API 能检查这件事吗?
可以。已检索标记和品牌点名在界面上都看得见,回答下方那份来源清单补上引用那一半。只有当你想在不手动复制的情况下拿到带日期的行和复跑时,API 才重要。
我怎么知道一次变化是真的?
在报告变化之前先把提示词重复一遍。在我们的五组复跑里,是否搜索的决定从未翻转,而来源计数浮动了两三个。已检索的提示词上判定变了,值得查。计数变了,不值得。
Auspia 观点:在读任何数字之前先跑有效性闸门,并且报告判定而不是计数。我们发现的最常见错误不是漏掉一次引用,而是模型根本没查过任何东西,ChatGPT 的空白回答却被上报成“看不见”。先把标记修好,报告剩下的部分才能在月度之间可比。
作者:维克托·莱恩




