AI 代理無視 robots.txt:OpenAI、Perplexity 與其他 AI 爬蟲正在繞過你的網站封鎖——香港企業應對策略 | SEO Agency Hong Kong
TollBit 最新報告顯示 ChatGPT-User、Bytespider、Youbot 等 AI 代理在近半數歐洲網站上訪問了 robots.txt 禁止的頁面。OpenAI 文件更明確表示 robots.txt 規則可能不適用於 ChatGPT 的頁面擷取機器人。本文以香港企業角度分析對網站內容控制、AI 能見度與品牌保護的影響,並提供實用應對策略。
一、事件背景:TollBit 報告揭示 AI 代理繞過 robots.txt 的規模
TollBit(一家 AI 內容授權分析平台)發布最新一期的 「State of the Bots」報告,涵蓋 2026 年上半年的數據,揭示了一個令網站營運者震驚的事實:AI 爬蟲正在系統性地繞過 robots.txt 的限制。
報告數據顯示,在報告涵蓋的歐洲網站中,約 15% 的已識別 AI 頁面擷取器訪問了網站標記為禁止(disallowed)的網址。這個比例並非微不足道——在特定 AI 代理上,這個數字更高:
- ChatGPT-User、Bytespider 和 Youbot 各自在近半數明確列出它們的歐洲網站上,訪問了 robots.txt 禁止的頁面
- 其中 ChatGPT-User 影響的網站數量最多
- 許多較新的頁面擷取代理幾乎沒有被封鎖——僅 9% 的歐洲網站封鎖了 Claude-User,相比之下北美地區為 26%
- Perplexity-User 的封鎖率在歐洲僅為 13%,北美為 26%
這些數據來自對 歐洲主要新聞和媒體網站 的 AI 爬蟲流量分析。雖然報告聚焦歐洲,但這些爬蟲的行為模式是全球性的——香港企業網站同樣暴露在相同的風險之下。
二、OpenAI 的立場:robots.txt 可能「不適用」於 ChatGPT
更令人關注的是 OpenAI 官方文件的立場。Search Engine Journal 在 8 月 14 日的獨家報道中指出,OpenAI 的爬蟲文件明確說明,ChatGPT-User 可能不受 robots.txt 約束。
根據 OpenAI 的文件,ChatGPT-User 的運作方式是:當 ChatGPT 用戶提出問題時,ChatGPT-User 會訪問相關頁面以提供答案。由於這些操作是由用戶發起的,OpenAI 認為 robots.txt 規則「可能不適用」。這意味著即使你的網站在 robots.txt 中明確禁止了 ChatGPT-User,ChatGPT 仍然可能在回答用戶問題時訪問你的內容。
Perplexity 也採取了類似立場,聲稱 Perplexity-User 出於同樣原因通常會忽略 robots.txt。相反,Anthropic 持不同觀點,明確表示其所有三個機器人都遵守 robots.txt——這在 2 月的相關報道中已有記載。
然而,TollBit 將任何對 robots.txt 禁止頁面的訪問都視為「繞過」,不論爬蟲營運商如何聲稱。
三、對香港企業的具體影響
這項發展對香港企業有幾個值得關注的面向:
1. 「封鎖」與「被看見」之間的矛盾
- OpenAI 實際上運營著 兩個不同的機器人:
- OAI-SearchBot——決定網站是否出現在 ChatGPT 搜尋結果中的代理,官方表示會遵守 robots.txt
- ChatGPT-User——當用戶提問時擷取頁面的代理,OpenAI 表示 robots.txt 可能不適用
- 這代表一個兩難:如果你同時封鎖了兩個機器人,你既放棄了在 ChatGPT 搜尋中的能見度(OAI-SearchBot 被阻),又無法阻止 ChatGPT-User 在用戶提問時訪問你的內容(因為 robots.txt 對它可能無效)
- 按 OpenAI 文件所述:「只封鎖 ChatGPT-User 是要求 OpenAI 的文件說可能不適用的東西。」
2. 香港網站的實際風險
- 內容被 AI 引用但無法控制:即使你的網站設定了嚴格的 robots.txt 規則來阻止 AI 爬蟲,ChatGPT 仍然可能在回答用戶問題時使用你的內容
- 品牌聲譽管理難度增加:如果你的敏感內容(如定價資訊、合作夥伴名單、內部資料)被 AI 存取並用於回答,可能影響商業機密和競爭優勢
- 版權與內容價值的分配問題:AI 代理訪問你的內容而不遵守你的 robots.txt 偏好,實際上是在重新定義內容價值的分配方式——類似我們之前報道的 法國報紙投訴 AI Overviews 的核心問題
3. 哪些行業最受影響
- 新聞和媒體網站:香港的媒體網站(如《南華早報》、《明報》等)的付費內容可能被 AI 繞過 paywall 訪問
- 電商網站:產品描述、價格、庫存資訊等商業敏感內容可能被 AI 爬取用於比價和回答
- 專業服務網站:法律、會計、醫療等專業服務網站的知識文章可能被 AI 直接引用,繞過網站自身的流量獲取機制
- 內容付費網站:需要訂閱才能訪問的內容可能面臨被 AI 間接公開的風險
四、Cloudflare 的新措施:從網絡層封鎖 AI 爬蟲
在 AI 代理繞過 robots.txt 問題日益嚴重的背景下,Cloudflare 正在採取更積極的措施。從 2026 年 9 月 15 日起,新增的 Cloudflare 域名將在包含廣告的頁面上,默認封鎖 Training(訓練)和 Agent(代理)爬蟲,同時保留 Search 爬蟲的權限。
Cloudflare 的做法是將決策轉移到網絡層(network layer)。對於 Cloudflare 能夠識別的機器人,合規性不再完全依賴爬蟲自身的誠信——而是由 Cloudflare 在網絡層強制執行。這是一個重要的技術進步,因為傳統 robots.txt 完全依賴爬蟲營運商的自律。
對於使用 Cloudflare 的香港企業來說,這項更新提供了一定程度的保護。但值得注意的是,這項措施僅適用於 Cloudflare 能夠識別的爬蟲——新出現的 AI 代理可能暫時不在其資料庫中。
五、香港企業的實用應對策略
- 不要只是封鎖——理解 AI 能見度的新規則:完全封鎖所有 AI 爬蟲可能會讓你的品牌消失在 AI 搜尋結果中。更好的策略是區分對待——封鎖訓練爬蟲(防止你的內容被用於模型訓練),但允許搜尋和引用爬蟲(保持 AI 搜尋中的能見度)
- 區分 OpenAI 的兩個機器人:在 robots.txt 中分別處理 OAI-SearchBot 和 ChatGPT-User。如果你希望內容出現在 ChatGPT 搜尋結果中,允許 OAI-SearchBot;如果你不希望內容在未經授權的情況下被擷取,考慮使用更強力的伺服器層級封鎖
- 使用 CDN 層的封鎖:Cloudflare、Akamai 等 CDN 提供的 AI 爬蟲封鎖功能,比 robots.txt 更可靠。如果你使用的是 Cloudflare,確保在 9 月 15 日後檢查你的 AI 爬蟲管理設定
- 定期檢查伺服器日誌:robots.txt 只是「請求」而非「強制」。實際檢查伺服器日誌或 CDN 記錄,看哪些 AI 代理確實訪問了你的網站,而不是僅僅依賴 robots.txt 來阻擋
- 制定 AI 內容使用政策:考慮在網站上增加明確的 AI 爬蟲使用條款,並使用
llms.txt等新興標準來告訴 AI 模型你的網站哪些內容可以被引用、哪些不可以 - 監測 AI 搜尋中的品牌出現情況:定期在 ChatGPT、Perplexity、Gemini 等平台上搜尋你的品牌名稱和核心關鍵字,檢查是否有未經授權的內容被引用
小結
TollBit 的報告和 OpenAI 的文件清楚地表明:在 AI 時代,robots.txt 不再是網站內容控制的有效防線。對於香港企業而言,這意味著需要從「完全依賴 robots.txt 封鎖」的策略,轉向更細緻的「分層式 AI 爬蟲管理」——理解不同 AI 代理的用途和行為,分別制定對應的處理規則。
更重要的是,AI 代理繞過 robots.txt 的現象,與 AI Overviews 的內容引用問題本質上是同一枚硬幣的兩面:AI 搜尋正在重新定義網站內容的價值分配方式。香港企業不僅需要了解如何封鎖(或允許)AI 爬蟲,更需要理解如何在 AI 引用你的內容時獲得相應的品牌曝光和流量回報。
如果你的網站正在遭遇 AI 流量管理方面的困擾,歡迎聯繫我們的專家團隊,我們可以為你進行免費的 AI 爬蟲審計和策略諮詢。