OpenAI 爬蟲完整指南:如何讓您的網站出現在 ChatGPT 搜尋中

OpenAI 營運著四個獨立的網路爬蟲,每個爬蟲都有不同的目的、不同的 robots.txt 指示,以及對您的網站是否出現在 ChatGPT 中的不同影響。2026年7月14日,OpenAI 更新了其爬蟲文件,明確了版本號碼變更可能性和 robots.txt 標記。

OpenAI 爬蟲完整指南:如何讓您的網站出現在 ChatGPT 搜尋中

OpenAI 營運著四個獨立的網路爬蟲,每個爬蟲都有不同的目的、不同的 robots.txt 指示,以及對您的網站是否出現在 ChatGPT 中的不同影響。2026年7月14日,Search Engine Roundtable 報導 OpenAI 悄悄更新了其爬蟲文件,明確了兩點:使用者代理程式字串中的版本號碼可能會隨時間變化,以及 OpenAI 在抓取 robots.txt 檔案時可能會附加一個 robots.txt 標記,以協助網站擁有者在伺服器日誌中區分這些請求。

這不是重大的政策轉變。但這是一個很好的理由來審查您的 robots.txt 檔案,確保您沒有在允許訓練爬蟲的同時意外封鎖了 ChatGPT 的搜尋爬蟲,反之亦然。這四個爬蟲是獨立的——您可以只允許搜尋而不允許訓練,並且這些設定不會相互影響。

您需要了解的四個 OpenAI 爬蟲

OpenAI 的官方文件(2026年7月更新,詳見 developers.openai.com/api/docs/bots)定義了四個使用者代理程式。每個都有特定的角色和特定的 robots.txt 令牌。

使用者代理程式

用途

爬取觸發條件

用於 AI 訓練?

出現在 ChatGPT 搜尋中?

OAI-SearchBot

爬取網頁以便在 ChatGPT 搜尋結果中展示頁面

自動、定期

是——這是讓您被引用的爬蟲

GPTBot

爬取可能用於生成式 AI 模型訓練的內容

自動、定期

否——僅用於訓練資料

OAI-AdsBot

驗證提交到 ChatGPT 廣告的廣告登陸頁面

由廣告提交觸發

ChatGPT-User

當使用者向 ChatGPT 提問或使用 Custom GPT 時造訪頁面

使用者發起

不適用——即時頁面獲取,非爬取

最重要的區別是:OAI-SearchBot 和 GPTBot 是獨立的爬蟲。封鎖 GPTBot 不會封鎖 ChatGPT 搜尋結果。封鎖 OAI-SearchBot 會將您的網站從 ChatGPT 的搜尋答案中移除(儘管如果使用者直接輸入您的網址,它仍可能作為導航連結出現)。

四種 OpenAI 爬蟲類型比較:OAI-SearchBot、GPTBot、OAI-AdsBot、ChatGPT-User

這次更新為什麼重要

2026年7月14日的文件更新不是關於新爬蟲或新政策。而是關於透明度。進行了兩項變更:

版本號碼可能會變化。 文件中記錄的使用者代理程式字串顯示為OAI-SearchBot/1.4GPTBot/1.4,但 OpenAI 現在明確指出版本號碼可能會更新。如果您的伺服器日誌或 WAF 規則匹配特定的版本字串(例如OAI-SearchBot/1.2),您可能會意外封鎖較新的版本。始終匹配機器人名稱,而不是版本號碼。

用於 robots.txt 抓取的 robots.txt 標記。 當 OpenAI 抓取您的 robots.txt 檔案時,它可能會使用帶有額外robots.txt標記的使用者代理程式字串。這有助於網站擁有者在伺服器日誌中區分 robots.txt 請求和常規內容請求——特別是當日誌不包含路徑時。標記如下所示:

Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; robots.txt; +https://openai.com/searchbot

版本號碼後的robots.txt令牌表示此請求專門用於獲取 robots.txt 檔案,而不是爬取內容頁面。

如何設定 robots.txt 以實現 ChatGPT 能見度

最常見的問題很簡單:是否應該允許 OAI-SearchBot?答案取決於您是否希望您的頁面出現在 ChatGPT 搜尋結果中。

如果您希望 ChatGPT 在搜尋答案中展示您的內容,請允許 OAI-SearchBot:

User-agent: OAI-SearchBot
Allow: /

如果您希望允許搜尋能見度但阻止 AI 訓練,請允許 OAI-SearchBot 並封鎖 GPTBot:

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

如果您想同時阻止搜尋和訓練(除非有特定原因,否則不建議):

User-agent: OAI-SearchBot
Disallow: /

User-agent: GPTBot
Disallow: /

ChatGPT-User 不需要 robots.txt 設定。 因為這些造訪是使用者發起的(一個人向 ChatGPT 提問,ChatGPT 獲取頁面來閱讀),所以 robots.txt 規則可能不適用。OpenAI 的文件明確指出了這一點。您不能依賴 robots.txt 來控制 ChatGPT-User——如果您需要阻止即時頁面獲取,則需要伺服器端 WAF 規則或基於 IP 的封鎖。

IP 白名單因素

OpenAI 為每個爬蟲發布了 IP 範圍。如果您的 WAF 或 CDN 封鎖來自未知 IP 範圍的請求,即使您的 robots.txt 允許,您可能也在悄悄封鎖 OpenAI 的爬蟲。

爬蟲

IP 範圍網址

OAI-SearchBot

https://openai.com/searchbot.json

GPTBot

https://openai.com/gptbot.json

OAI-AdsBot

https://openai.com/adsbot.json

ChatGPT-User

https://openai.com/chatgpt-user.json

如果您的網站使用 Cloudflare、AWS WAF 或具有啟用機器人管理的類似服務,請驗證這些 IP 範圍未被封鎖或挑戰。如果爬蟲永遠無法到達您的伺服器,robots.txt 的Allow規則將毫無用處。

實用審查清單

執行此清單以確保您的網站已正確設定 ChatGPT AI 索引:

檢查 OAI-SearchBot 的 robots.txt。 它是被明確允許還是封鎖?如果兩者都不是,它預設為允許——但明確的規則更安全。

單獨檢查 GPTBot。 獨立決定是否希望您的內容用於模型訓練。

檢查您的 WAF 或 CDN 機器人規則。 不要僅依賴 robots.txt。驗證 OpenAI 發布的 IP 範圍未被封鎖或被 CAPTCHA 挑戰。

檢查伺服器日誌匹配機器人名稱,而不是版本。 如果您有匹配OAI-SearchBot/1.2GPTBot/1.0的規則,請更新它們以匹配機器人名稱,無論版本如何。OpenAI 已確認版本號碼可能會變化。

允許約24小時使變更生效。 OpenAI 表示,在 robots.txt 更新後,他們的系統大約需要24小時來調整。

使用 ChatGPT 搜尋進行測試。 進行變更後,向 ChatGPT 提出與您的內容相關的問題,看看您的頁面是否出現在搜尋結果中。

封鎖 ChatGPT 能見度的常見錯誤

錯誤1:使用 blanket Disallow 封鎖所有機器人。

User-agent: *
Disallow: /

這會封鎖所有爬蟲,包括 OAI-SearchBot。如果您想封鎖特定機器人,請按名稱進行。

錯誤2:封鎖 GPTBot 並假設 ChatGPT 搜尋也被封鎖。 GPTBot 僅用於訓練。如果您封鎖 GPTBot 但不限制 OAI-SearchBot,您的頁面仍可能出現在 ChatGPT 搜尋中。如果您想從 ChatGPT 搜尋答案中排除,您必須專門封鎖 OAI-SearchBot。

錯誤3:在 WAF 規則中匹配版本號碼。 OpenAI 已確認版本號碼可能會變化。匹配OAI-SearchBot/1.2的規則在版本更新為1.31.4時將失敗。匹配字串OAI-SearchBot而不包含版本後綴。

錯誤4:忘記 ChatGPT-User。 當使用者向 ChatGPT 提問時,ChatGPT 可能會使用 ChatGPT-User 代理程式即時獲取頁面。這不是爬取——這是使用者發起的請求。您的 robots.txt 規則可能不適用。如果您需要封鎖這些請求,請使用伺服器端控制,而不是 robots.txt。

錯誤5:忽略 IP 白名單。 某些 CDN 和 WAF 具有積極的機器人偵測,會挑戰或封鎖未知的爬蟲。即使您的 robots.txt 正確,爬蟲也可能永遠無法到達您的內容。檢查您的 WAF 日誌中來自 OpenAI IP 範圍的被封鎖請求。

這對您的 AI 搜尋能見度策略意味著什麼

ChatGPT 不再僅僅是一個聊天機器人。它擁有具有即時網頁結果的完整搜尋引擎。要將您的內容放入這些結果中,需要與您已經為 Googlebot 和 Bingbot 管理的相同的爬取可訪問性,但使用 OpenAI 特定的規則。

值得注意的是:OpenAI 將搜尋和訓練視為獨立的系統。您可以在不同意模型訓練的情況下參與 ChatGPT 搜尋。Google 在 Googlebot 之上使用 Google-Extended 做類似的事情,但 OpenAI 的方法從一開始就更精細——四個獨立的爬蟲,四個獨立的決定。

如果您正在為 AI 爬蟲執行 robots.txt 審查,請按爬蟲逐一做出決定,而不是使用 blanket 允許或拒絕規則。

常見問題

允許 OAI-SearchBot 意味著我的內容將用於訓練 OpenAI 的模型嗎?

不。OAI-SearchBot 僅用於 ChatGPT 搜尋結果。訓練資料收集由 GPTBot 處理,這是一個具有單獨 robots.txt 指示的獨立爬蟲。您可以在允許 OAI-SearchBot 的同時封鎖 GPTBot。

robots.txt 變更需要多長時間才能生效?

OpenAI 表示,在 robots.txt 更新後,他們的系統大約需要24小時來調整。這比 Google 的典型 robots.txt 刷新週期更快。

如果我封鎖 OAI-SearchBot,我的網站仍會出現在 ChatGPT 中嗎?

是的,但僅作為導航連結——不會作為搜尋答案中的來源。如果使用者直接向 ChatGPT 輸入您的網址,它仍可以連結到您的網站。但您的頁面不會被引用為 ChatGPT 搜尋生成答案的來源。

使用者代理程式字串中的 robots.txt 標記是什麼?

這是 OpenAI 在獲取您的 robots.txt 檔案時附加到使用者代理程式字串的額外令牌(robots.txt)。它幫助您在伺服器日誌中區分 robots.txt 獲取請求和常規內容爬取請求,特別是當日誌格式不包含請求路徑時。

我應該在伺服器規則中匹配版本號碼嗎?

不。OpenAI 已明確指出版本號碼可能會變化。在您的 WAF 規則、日誌過濾器或存取控制清單中匹配機器人名稱(例如OAI-SearchBotGPTBot),而不包含版本後綴。

我可以用 robots.txt 控制 ChatGPT-User 嗎?

不可靠。ChatGPT-User 造訪是由使用者提問發起的,而不是自動爬取。OpenAI 的文件指出,robots.txt 規則可能不適用於這些使用者發起的請求。如果您需要封鎖即時頁面獲取,請使用伺服器端控制。

作者:Julian Mercer,Auspia 擁有14年經驗的技術 SEO 實踐者。Julian 撰寫關於爬取能力、robots.txt 設定、結構化資料以及使內容對搜尋引擎和 AI 系統都可讀的技術基礎的文章。

探索此主題

繼續閱讀相同的成長脈絡