这个工作流能给你什么
你有一个页面曾经排在你关心的关键词前十名,现在掉到了第 34 名。你用同一个词搜索,结果里出现你自己网站的两个 URL。或者你的内容团队上个月发了 40 篇新文章,你怀疑其中有几篇正在悄悄互相打架。
这个工作流会把这种怀疑变成一份确认清单和修复计划。完成后你会得到:所有两个以上 URL 互相竞争的查询、每个群集的判定(合并、规范化、差异化、删除四选一),以及一份告诉你修复是否生效的四周验证计划。
- 适用人群: 网站超过几百页的 SEO 人员和内容团队,以及所有快速发布内容的人。
- 时间: 典型中型网站第一次审计约 90 分钟;流程熟练后只需一半。
- 前置条件: Google Search Console 读取权限、一份爬取导出(Screaming Frog、Sitebulb 或同类工具)、如果订阅了排名监控工具也准备好。
- 完成标准: 清单上每个竞争群集都恰好有上述四种判定之一、修复已应用,而且日历上已排定重新检查排名与展示次数的日期。
开始前先做一次现实检查,这会避免你去修没坏的东西:一个查询出现多个 URL 是正常的。分类页、博客文章和商品页可以同时为同一个词排名——如果它们服务不同的意图(正在研究的人 vs. 准备购买的人),那是健康的搜索结果页,不是蚕食。这个工作流只会标记在同一阶段争夺同一份工作的页面。
这件事在 2026 年比五年前更重要的原因只有一个:AI 内容简报和 AI 生成的草稿以人工审核追不上的速度制造出相似页面,所以蚕食现在是规模化发生的。它同时打击 Google 排名和 AI 搜索引用。
三分钟症状检查
在深入数据之前先过一遍。以下症状有两项以上符合,就执行完整审计。
症状 | 看起来像什么 | 最可能的原因 |
|---|---|---|
排名卡住 | 页面数月稳居前十,新页面上线后掉到 25–50 名 | 新页面在同一查询竞争 |
展示次数被瓜分 | 两个 URL 几乎 50/50 瓜分同一查询的展示次数 | 两个页面都没能建立明确的关联性 |
标题双胞胎 | 两个页面的 H1 与标题相同或几乎相同 | 作者做的是变体,不是互补 |
排名轮换 | 某个词的排名 URL 每周在你自己的页面之间交替 | 搜索引擎无法选出权威页面 |
AI 答案摇摆 | AI 助手针对同一问题在不同次回答中引用你不同的 URL | 同样的稀释发生在另一个界面上 |
开始之前:需要的数据
收集这三样东西:
- 至少有 6 个月历史的 Search Console。 90 天够做快速检查,但更长的区间能让你看到排名下滑是否与页面上线时间吻合。
- 一份含标题与 H1 的新爬取。 Screaming Frog 开箱即用;Sitebulb 和 Botify 也可以。如果这些都没有,
site:搜索加上 CMS 页面列表可以覆盖最明显的案例。 - 排名监控工具导出(Semrush、Ahrefs、Authority Labs)。这一步是可选的——光靠 Search Console 就能找出多数案例。
开始前先从 Search Console 导出两份东西:查询报告(查询、展示次数、点击、排名),以及加入页面维度的同一份报告(URL)。两者都在「效果」的完整报告里。
步骤 1:在 Search Console 里找出竞争 URL
这是免费、信号最强的一步。
- 打开 Search Console → 效果 → 完整报告。
- 使用查询过滤器,输入你的第一个优先关键词。
- 看图表下方的 URL 列表。记下任何你网站两个以上页面同时获得展示次数的查询。
你要找两种模式:同一时期展示次数几乎平均分摊的页面组合,以及原本在前十名、现在卡在 20–50 名的页面——尤其是下滑刚好从一个相似页面上线时开始的。
先从你最重视的 10–15 个关键词开始。如果其中一半都出现群集,问题是站级别的,值得把过去 6 个月展示次数超过(比方说)50 次的所有查询整个扫一遍。如果只在少数几个出现,问题就是局部的——修掉它们,继续往前走。
预期产出: 一份清单,每个查询附两个以上你自己的 URL 及其展示次数分摊。质量检查: 页面必须真的在同一个查询上共同排名。如果只是听起来相似,它们是邻居,不是竞争者——移除。恢复路径: 什么都没找到?把区间拉长到 3 个月,并纳入关键词的长尾变体。也检查品牌词与非品牌词的分布——多版本网站(语言对、批发对零售)的这个地方常藏着重复。
步骤 2:在爬取数据里找出重复标题与 H1
蚕食往往是内容生产的意外:作者被要求「写写 X」,没有确认已有的页面,于是做出一个标题跟已在排名的页面一样的页面。
打开你的爬取导出,先按标题排序、再按 H1 排序,标出重复与近似重复。「近似」也算——两个页面不需要标题完全相同才会竞争。「Best CRM software」和「Best CRM tools」瞄准同一批读者,就是候选;「Best CRM for real estate」是另一个页面,不该进清单。
看爬取数据的同时,检查技术嫌疑:指向页面自身以外的 canonical 标签、新增变体时被改掉的 meta robots noindex 规则、开始或停止的 robots.txt 屏蔽。正如 Search Engine Journal 在相关指南中所说:当你改变指示搜索引擎爬取、索引和忽略的方式时,你就制造了蚕食问题。继承了旧商品 canonical 的商品变体页就是典型例子。
预期产出: 标题与 H1 重复或竞争的页面对,加上技术标记。质量检查: 每一对回答一个问题——在另一个页面上线之前,这个页面是否已存在且已在排名?如果是,记下来;这是真问题最强的信号。恢复路径: 如果你的 CMS 让导出很麻烦,用本文末尾的 Codex 技能从爬取 CSV 生成清单。把它的输出当作候选清单,而不是判定。
步骤 3:用排名监控工具确认
Search Console 告诉你 Google 报告了什么;排名监控工具告诉你你的 URL 在时间轴上的位置,这才是真正暴露卡住页面的工具。
在监控工具里打开每个候选查询。确认蚕食的模式:关键词卡在 20 多名到 50 名之间,或者持有第 X 名的 URL 一直在你的页面之间换人。Semrush 会显示过去一年你的哪些页面为该词出现过;Authority Labs 会列出每个关键词的每个 URL。如果一年历史里出现两个以上你的 URL、且两者都没进过前十,你就确认了。
顺便读一下方向。如果你的原始页面在新页面发布前排名正常、现在两者都沉在首页之下,新来的并没有「偷走」排名——是两个页面互相稀释。这会改变修复方向:把新页面合并进原始页面,而不是反过来。
预期产出: 每个候选群集的确认状态——「已确认」或「未确认,需人工审核」。质量检查: 确认需要至少两个独立信号。Search Console+爬取算两个;单靠排名监控工具是薄弱信号。恢复路径: 如果你的监控工具每个关键词只显示一个 URL,跳过这一步。Search Console 与爬取两趟就足以跑完整套流程。

审计管线:三个检测关卡、一个判定矩阵、一个验证循环。
步骤 4:决定修复方式
对每个已确认的群集,从四种判定中恰好选一种。这张表就是全部决策:
判定 | 使用时机 | 做法 |
|---|---|---|
合并 | 页面服务同一意图,且其中一个明显更完整 | 把较弱页面的独特论点折进较强页面,然后移除或 301 较弱的 URL |
规范化 | 必须存在且近乎相同的变体(商品变体、参数、活动页) | 选出官方 URL,放上自引用 canonical,把变体 canonical 到它 |
差异化 | 同主题、但你想保留的不同意图(例如教程文 vs. 商品页) | 重写其中一页,让它明确服务不同查询或漏斗阶段;确保标题与 H1 不再重叠 |
删除 | 页面内容单薄、重复,或只是为了已有人覆盖的词而存在 | 把独特价值折进存活页面后删除 |
有两种情况不是蚕食,别动它们:教程文与转化页针对同一个关键词服务不同漏斗阶段——Google 理解哪个页面负责什么——以及同一页面配上 hreflang 的不同语言版本。
用一个问题检查你的判定:这个改变之后,搜索这个词的用户会不会落在一个页面上、就拿到另一页提供的所有东西?会,就合并或删除。不会,就规范化或差异化。
步骤 5:在不流失可见度的前提下应用修复
修复 A:整合内容(合并判定)。 以存活页面为工作基准。把输家页面的每个独特章节复制进去——FAQ 答案、例子、会被引用的章节、指向它的内部链接。需要的话重新排序,让最强的内容靠近顶部。当输家页面有外部反向链接或自己的真实排名时,用 301 把它导向存活页面,而不是让它 404;两者皆无时,直接移除即可。Search Engine Journal 的指南刻意避开 301——它偏好折叠内容后删除较新的页面——只有当被移除的 URL 带着自己的链接资产时,301 才成为必要。把使用输家页面锚文本的内部链接改指向存活页面。

把两个竞争页面合并成一个 URL,50/50 的展示次数瓜分会变成单一赢家。
修复 B:Canonical 化(规范化判定)。 在官方页面放自引用 canonical,并把变体 canonical 到它。这是为「必须存在但近乎重复」的页面准备的工具:商品变体、参数化 URL、活动页。它不是整合的替代品。如果两个页面都带有有意义的内容,光靠 canonical 会让两者都留在爬取范围内、也分裂你的编辑焦点——先做内容工作,再指 canonical。
修复 C:程序化屏蔽索引(删除的邻近判定)。 当重复是结构性的——参数页、筛选组合、不需要索引的区域变体——在文件夹或模板层级应用 noindex,而不是逐页处理。这就是一行代码胜过 200 次手动编辑的案例。
修复 D:按意图修正内部链接(差异化判定)。 当两个页面合法服务不同意图,让你的内部链接也这么说。来源指南的规则:如果「apples」一词周围的文字在讲买苹果,链接到转化页;如果讲苹果从哪里来,链接到信息页。每一条内部链接都是一张选票。当你的链接一致指向应该胜出的页面,你就消除了搜索引擎原本会自行解决(而且常常解错方向)的模糊性。
步骤 6:验证修复是否撑住
修复后等两到四周,再重跑检查。
- Search Console: 查询现在应该显示单一主导 URL 而非瓜分,且存活页面的展示次数应该上升。群集整体展示次数在重新排名期间可能下滑一两周——这是正常现象,不是失败。
- 排名监控工具: 关键词应该停止在 URL 之间震荡。
- AI 界面: 用你的关键词去问 AI 助手或 AI 搜索引擎,确认被引用的是存活 URL——不是被移除的那个。被瓜分的页面也会瓜分 AI 引用。整合是少数能同时帮助 Google 排名与 AI 搜索可见性 的修复方式。
四周后群集仍在分裂,说明你漏掉了一个页面(再检查你不知道的变体),或者这些页面确实服务不同意图、本来该差异化而不是合并。重新验证、重新决定。
防止它卷土重来
审计是简单的部分。保持干净是一条发布纪律。三个做法,按重要性排序:
- 维护一份内容团队下笔前会查的主题清单。 制造蚕食最快的途径,是一个不知道页面已经存在的作者。
- 让重叠成为对话,而不是围墙。 与其禁止某个主题,不如帮作者找到互补的角度——教程文、对比文、垂直行业版本。
- 特别盯紧 AI 生成管线。 AI 生成输出是最快的蚕食工厂:无论提示词质量如何,它都会产出互相竞争的重复、单薄页面。所有生成或经 AI 简报的页面,都该在排期前通过主题清单检查,且季度审计应优先处理它们。
完整审计每季度跑一次,并在每次为网站同一区块新增多个页面的发布后再跑一次。
自动化审计:一个 Codex 技能
上述步骤先手动跑,是为了让你理解数据的意义。理解之后,把可重复的部分交给 AI 编程代理。这是一份完整的 Codex 技能文件:它读取你的 Search Console 导出、标出竞争群集、产出判定表——全程不碰你的网站。
---
name: keyword-cannibalization-audit
description: Find and classify keyword cannibalization clusters from Google Search Console, crawl, and rank-tracker exports. Use when a query shows multiple URLs, rankings dropped after a new page launch, or you need a cannibalization verdict sheet. Read-only: produces a report, never edits pages.
---
# Keyword Cannibalization Audit
## Inputs (required)
- `gsc-queries.csv` — Search Console query export (query, impressions, clicks, position)
- `gsc-pages.csv` — Search Console page export (page, impressions, clicks, position)
- `crawl-titles.csv` — crawl export with URL, title, H1, canonical
- `rank-history.csv` — optional rank tracker export with per-keyword URL history
## Procedure
1. Load the CSVs. Normalize URLs (lowercase host, strip trailing slash and tracking parameters).
2. Join `gsc-queries.csv` and `gsc-pages.csv` on query to build query-to-URL mappings.
3. Flag queries where 2+ URLs each received at least 10% of the query's impressions in the last 90 days.
4. Flag queries where a URL sits between positions 20-50 and a second URL for the same query was created later (compare crawl or tracker history).
5. From `crawl-titles.csv`, flag pairs whose titles or H1s are identical or share 80%+ of their significant tokens.
6. From `rank-history.csv`, flag queries whose ranking URL changed more than twice in 6 months.
7. Cross-check every flag. Keep only clusters confirmed by at least two signals (Search Console + crawl counts as two).
8. Classify each surviving cluster as MERGE, CANONICALIZE, DIFFERENTIATE, or REMOVE:
- Same intent + one page clearly more complete → MERGE (fold unique sections into the survivor; note a 301 only if the removed URL has external backlinks)
- Near-identical variants that must exist (parameters, variants) → CANONICALIZE
- Same topic, genuinely different intent you want to keep → DIFFERENTIATE (rewrite one page, no title overlap)
- Thin or fully duplicated page with no unique value → REMOVE
- Complementary intent (how-to vs. product for the same keyword) → NOT CANNIBALIZATION, skip
9. Output `cannibalization-verdicts.md`: a table of query | competing URLs | signals found | verdict | action, ordered by query impressions. Include for each cluster the exact URLs, the evidence rows (dates, positions, impressions), and fix text ready to paste into a CMS task.
## Rules
- Read-only. Never edit pages, robots.txt, or canonicals. Output the report and a proposed action plan only.
- Never merge a URL into a survivor whose content is not equal to or better than the merged output.
- Do not classify locale variants (hreflang) or genuinely different intents as cannibalization.
- Clusters with fewer than two confirming signals get marked "unconfirmed — review manually," never dropped.
- When the rank tracker export is missing, run with Search Console + crawl only and say so in the report header.把它存成 Codex 技能文件夹里的 keyword-cannibalization-audit/SKILL.md,把四个 CSV 丢进一个工作区文件夹,然后运行。典型几千页的跑一次只需几分钟,返回判定表。
两个更小、适合不想用完整技能时的提示词:
- 导出分诊:「这是我的 Search Console 查询导出。找出所有我两个以上 URL 各自获得至少 10% 展示次数的查询。输出一个表格,列为查询、URL、展示次数分摊、每个 URL 的排名。不要给建议。」
- 判定群集:「我的两个页面都在 [查询] 排名:[URL A] 第 [X] 名、[URL B] 第 [Y] 名。[URL B] 于 [日期] 上线。比较两者内容,用两句话告诉我四种判定——合并、规范化、差异化、删除——中哪一种适用及其原因。」
FAQ
我的关键词有多个页面在排名——这自动算蚕食吗?
不算。如果页面服务不同意图(研究 vs. 购买)或不同语言区域,搜索引擎处理得很好。只有同一漏斗阶段争夺同一份工作的页面需要判定。
Canonical 还是 noindex——该用哪个?
变体必须保持可访问(商品变体、参数)且其信号要流向官方页面时用 canonical。纯粹重复、不服务任何用户需求的页面,用程序化应用的 noindex。当重复页面其实含有有用内容时,两者都无法取代内容整合。
我该 301 输家页面吗?
只有在它有外部反向链接或自己的实质排名时才该。否则把它的独特内容折进存活页面后移除。导向一个并非真正替代品的页面的 301,会浪费重定向的资产并困惑用户。
合并后流量下滑——我弄坏了吗?
Google 重新评估群集期间的短期下滑很常见。以四周为准来衡量:如果存活页面拿到该查询排名、群集展示次数恢复,修复就撑住了。如果是另一页在胜出,你合并的方向错了。在问题恶化前把它倒转回来。
蚕食会影响 AI 搜索引用吗?
会。当你的两个 URL 竞争时,AI 回答会在两者之间选择,可能引用任何一个——或都不引用。整合会给你一个强壮、适合被引用的 URL,而不是两个被稀释的。
我应该多久跑一次审计?
基准是每季度一次,加上任何一波新页面之后。用 AI 生成内容的网站,应该把审计视为发布管线的一部分,而不是周期性杂务。
作者:Clara Bennett,Auspia 十年内容策略从业者。她撰写关于编辑系统、主题地图,以及让内容发布计划不会互相撞车的可重复内容运营。












