OpenAI 爬蟲完整指南:如何讓您的網站出現在 ChatGPT 搜尋中
OpenAI 營運著四個獨立的網路爬蟲,每個爬蟲都有不同的目的、不同的 robots.txt 指示,以及對您的網站是否出現在 ChatGPT 中的不同影響。2026年7月14日,Search Engine Roundtable 報導 OpenAI 悄悄更新了其爬蟲文件,明確了兩點:使用者代理程式字串中的版本號碼可能會隨時間變化,以及 OpenAI 在抓取 robots.txt 檔案時可能會附加一個 robots.txt 標記,以協助網站擁有者在伺服器日誌中區分這些請求。
這不是重大的政策轉變。但這是一個很好的理由來審查您的 robots.txt 檔案,確保您沒有在允許訓練爬蟲的同時意外封鎖了 ChatGPT 的搜尋爬蟲,反之亦然。這四個爬蟲是獨立的——您可以只允許搜尋而不允許訓練,並且這些設定不會相互影響。
您需要了解的四個 OpenAI 爬蟲
OpenAI 的官方文件(2026年7月更新,詳見 developers.openai.com/api/docs/bots)定義了四個使用者代理程式。每個都有特定的角色和特定的 robots.txt 令牌。
| 使用者代理程式 | 用途 | 爬取觸發條件 | 用於 AI 訓練? | 出現在 ChatGPT 搜尋中? |
|---|---|---|---|---|
| OAI-SearchBot | 爬取網頁以便在 ChatGPT 搜尋結果中展示頁面 | 自動、定期 | 否 | 是——這是讓您被引用的爬蟲 |
| GPTBot | 爬取可能用於生成式 AI 模型訓練的內容 | 自動、定期 | 是 | 否——僅用於訓練資料 |
| OAI-AdsBot | 驗證提交到 ChatGPT 廣告的廣告登陸頁面 | 由廣告提交觸發 | 否 | 否 |
| ChatGPT-User | 當使用者向 ChatGPT 提問或使用 Custom GPT 時造訪頁面 | 使用者發起 | 否 | 不適用——即時頁面獲取,非爬取 |
最重要的區別是:OAI-SearchBot 和 GPTBot 是獨立的爬蟲。封鎖 GPTBot 不會封鎖 ChatGPT 搜尋結果。封鎖 OAI-SearchBot 會將您的網站從 ChatGPT 的搜尋答案中移除(儘管如果使用者直接輸入您的網址,它仍可能作為導航連結出現)。
這次更新為什麼重要
2026年7月14日的文件更新不是關於新爬蟲或新政策。而是關於透明度。進行了兩項變更:
版本號碼可能會變化。 文件中記錄的使用者代理程式字串顯示為OAI-SearchBot/1.4和GPTBot/1.4,但 OpenAI 現在明確指出版本號碼可能會更新。如果您的伺服器日誌或 WAF 規則匹配特定的版本字串(例如OAI-SearchBot/1.2),您可能會意外封鎖較新的版本。始終匹配機器人名稱,而不是版本號碼。
用於 robots.txt 抓取的 robots.txt 標記。 當 OpenAI 抓取您的 robots.txt 檔案時,它可能會使用帶有額外robots.txt標記的使用者代理程式字串。這有助於網站擁有者在伺服器日誌中區分 robots.txt 請求和常規內容請求——特別是當日誌不包含路徑時。標記如下所示:
Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; robots.txt; +https://openai.com/searchbot
版本號碼後的robots.txt令牌表示此請求專門用於獲取 robots.txt 檔案,而不是爬取內容頁面。
如何設定 robots.txt 以實現 ChatGPT 能見度
最常見的問題很簡單:是否應該允許 OAI-SearchBot?答案取決於您是否希望您的頁面出現在 ChatGPT 搜尋結果中。
如果您希望 ChatGPT 在搜尋答案中展示您的內容,請允許 OAI-SearchBot:
User-agent: OAI-SearchBot
Allow: /
如果您希望允許搜尋能見度但阻止 AI 訓練,請允許 OAI-SearchBot 並封鎖 GPTBot:
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
如果您想同時阻止搜尋和訓練(除非有特定原因,否則不建議):
User-agent: OAI-SearchBot
Disallow: /
User-agent: GPTBot
Disallow: /
ChatGPT-User 不需要 robots.txt 設定。 因為這些造訪是使用者發起的(一個人向 ChatGPT 提問,ChatGPT 獲取頁面來閱讀),所以 robots.txt 規則可能不適用。OpenAI 的文件明確指出了這一點。您不能依賴 robots.txt 來控制 ChatGPT-User——如果您需要阻止即時頁面獲取,則需要伺服器端 WAF 規則或基於 IP 的封鎖。
IP 白名單因素
OpenAI 為每個爬蟲發布了 IP 範圍。如果您的 WAF 或 CDN 封鎖來自未知 IP 範圍的請求,即使您的 robots.txt 允許,您可能也在悄悄封鎖 OpenAI 的爬蟲。
| 爬蟲 | IP 範圍網址 |
|---|---|
| OAI-SearchBot | https://openai.com/searchbot.json |
| GPTBot | https://openai.com/gptbot.json |
| OAI-AdsBot | https://openai.com/adsbot.json |
| ChatGPT-User | https://openai.com/chatgpt-user.json |
如果您的網站使用 Cloudflare、AWS WAF 或具有啟用機器人管理的類似服務,請驗證這些 IP 範圍未被封鎖或挑戰。如果爬蟲永遠無法到達您的伺服器,robots.txt 的Allow規則將毫無用處。
實用審查清單
執行此清單以確保您的網站已正確設定 ChatGPT AI 索引:
檢查 OAI-SearchBot 的 robots.txt。 它是被明確允許還是封鎖?如果兩者都不是,它預設為允許——但明確的規則更安全。
單獨檢查 GPTBot。 獨立決定是否希望您的內容用於模型訓練。
檢查您的 WAF 或 CDN 機器人規則。 不要僅依賴 robots.txt。驗證 OpenAI 發布的 IP 範圍未被封鎖或被 CAPTCHA 挑戰。
檢查伺服器日誌匹配機器人名稱,而不是版本。 如果您有匹配OAI-SearchBot/1.2或GPTBot/1.0的規則,請更新它們以匹配機器人名稱,無論版本如何。OpenAI 已確認版本號碼可能會變化。
允許約24小時使變更生效。 OpenAI 表示,在 robots.txt 更新後,他們的系統大約需要24小時來調整。
使用 ChatGPT 搜尋進行測試。 進行變更後,向 ChatGPT 提出與您的內容相關的問題,看看您的頁面是否出現在搜尋結果中。
封鎖 ChatGPT 能見度的常見錯誤
錯誤1:使用 blanket Disallow 封鎖所有機器人。
User-agent: *
Disallow: /
這會封鎖所有爬蟲,包括 OAI-SearchBot。如果您想封鎖特定機器人,請按名稱進行。
錯誤2:封鎖 GPTBot 並假設 ChatGPT 搜尋也被封鎖。 GPTBot 僅用於訓練。如果您封鎖 GPTBot 但不限制 OAI-SearchBot,您的頁面仍可能出現在 ChatGPT 搜尋中。如果您想從 ChatGPT 搜尋答案中排除,您必須專門封鎖 OAI-SearchBot。
錯誤3:在 WAF 規則中匹配版本號碼。 OpenAI 已確認版本號碼可能會變化。匹配OAI-SearchBot/1.2的規則在版本更新為1.3或1.4時將失敗。匹配字串OAI-SearchBot而不包含版本後綴。
錯誤4:忘記 ChatGPT-User。 當使用者向 ChatGPT 提問時,ChatGPT 可能會使用 ChatGPT-User 代理程式即時獲取頁面。這不是爬取——這是使用者發起的請求。您的 robots.txt 規則可能不適用。如果您需要封鎖這些請求,請使用伺服器端控制,而不是 robots.txt。
錯誤5:忽略 IP 白名單。 某些 CDN 和 WAF 具有積極的機器人偵測,會挑戰或封鎖未知的爬蟲。即使您的 robots.txt 正確,爬蟲也可能永遠無法到達您的內容。檢查您的 WAF 日誌中來自 OpenAI IP 範圍的被封鎖請求。
這對您的 AI 搜尋能見度策略意味著什麼
ChatGPT 不再僅僅是一個聊天機器人。它擁有具有即時網頁結果的完整搜尋引擎。要將您的內容放入這些結果中,需要與您已經為 Googlebot 和 Bingbot 管理的相同的爬取可訪問性,但使用 OpenAI 特定的規則。
值得注意的是:OpenAI 將搜尋和訓練視為獨立的系統。您可以在不同意模型訓練的情況下參與 ChatGPT 搜尋。Google 在 Googlebot 之上使用 Google-Extended 做類似的事情,但 OpenAI 的方法從一開始就更精細——四個獨立的爬蟲,四個獨立的決定。
如果您正在為 AI 爬蟲執行 robots.txt 審查,請按爬蟲逐一做出決定,而不是使用 blanket 允許或拒絕規則。
常見問題
允許 OAI-SearchBot 意味著我的內容將用於訓練 OpenAI 的模型嗎?
不。OAI-SearchBot 僅用於 ChatGPT 搜尋結果。訓練資料收集由 GPTBot 處理,這是一個具有單獨 robots.txt 指示的獨立爬蟲。您可以在允許 OAI-SearchBot 的同時封鎖 GPTBot。
robots.txt 變更需要多長時間才能生效?
OpenAI 表示,在 robots.txt 更新後,他們的系統大約需要24小時來調整。這比 Google 的典型 robots.txt 刷新週期更快。
如果我封鎖 OAI-SearchBot,我的網站仍會出現在 ChatGPT 中嗎?
是的,但僅作為導航連結——不會作為搜尋答案中的來源。如果使用者直接向 ChatGPT 輸入您的網址,它仍可以連結到您的網站。但您的頁面不會被引用為 ChatGPT 搜尋生成答案的來源。
使用者代理程式字串中的 robots.txt 標記是什麼?
這是 OpenAI 在獲取您的 robots.txt 檔案時附加到使用者代理程式字串的額外令牌(robots.txt)。它幫助您在伺服器日誌中區分 robots.txt 獲取請求和常規內容爬取請求,特別是當日誌格式不包含請求路徑時。
我應該在伺服器規則中匹配版本號碼嗎?
不。OpenAI 已明確指出版本號碼可能會變化。在您的 WAF 規則、日誌過濾器或存取控制清單中匹配機器人名稱(例如OAI-SearchBot或GPTBot),而不包含版本後綴。
我可以用 robots.txt 控制 ChatGPT-User 嗎?
不可靠。ChatGPT-User 造訪是由使用者提問發起的,而不是自動爬取。OpenAI 的文件指出,robots.txt 規則可能不適用於這些使用者發起的請求。如果您需要封鎖即時頁面獲取,請使用伺服器端控制。
作者:Julian Mercer,Auspia 擁有14年經驗的技術 SEO 實踐者。Julian 撰寫關於爬取能力、robots.txt 設定、結構化資料以及使內容對搜尋引擎和 AI 系統都可讀的技術基礎的文章。