SEO 新聞 2026-09-01 8 分鐘

John Mueller 實測分享:唯一會請求 Markdown 的爬蟲來自 SEO 工具——香港企業 AI SEO 的 Markdown 神話與現實 | SEO Agency Hong Kong

Google 的 John Mueller 在 Reddit 上分享了他測試 Markdown 檔案的真實經驗:「在我的測試網站上,唯一聲稱接受 Markdown 的爬蟲來自 SEO 工具。」這個坦率的分享打破了 Markdown 檔案能顯著提升 AI 搜尋曝光的普遍說法。本文從香港企業角度深度剖析 Markdown 在 AI SEO 中的真實角色,以及真正有效的 AI 內容策略。

一、事件始末:John Mueller 如何測試 Markdown 檔案?

過去一年,「為 AI 爬蟲提供 Markdown 檔案」一直是 GEO(生成式引擎優化)社群中的熱門話題。理論很直接:Markdown 檔案比 HTML 更簡潔、沒有 JavaScript 干擾,AI 模型可以更有效地讀取和引用你的內容。Cloudflare 更推出「Markdown for Agents」功能,聲稱 Markdown「已迅速成為代理和 AI 系統的通用語言」。

然而,Google 搜尋公關 John Mueller 在 Reddit 上分享的個人測試結果,給這個熱潮澆了一盆冷水。一位 Reddit 用戶詢問是否有人成功讓 AI 模型請求 Markdown 檔案時,Mueller 坦率回應:

「在我的測試網站上,唯一聲稱接受 Markdown 的爬蟲是 SEO 工具。你的情況可能有所不同。

(另外,我的伺服器設定不會記錄 Accept header,所以即使只是想看看有沒有人會請求 Markdown,你也需要手動設定記錄系統。如果你對自己的網站感到好奇,我建議你先弄清楚如何記錄這個資訊,然後再檢查數據。)」

這項分享的關鍵啟示:

  • SEO 工具 vs 真正的 AI 爬蟲:像 AhrefsBot、MozBot 等 SEO 工具確實會請求 Markdown,但它們並非 AI 搜尋模型(GPTBot、ClaudeBot、Google-Extended 等)
  • AI 模型不需要 Markdown:主要 AI 公司已經完全掌握了爬取和索引 HTML 檔案的能力,為何要回頭請求一個閹割版?
  • 數據先行:Mueller 的建議是:先設定好記錄系統,親自檢查你的伺服器日誌,看看是否有任何 AI 爬蟲真正請求 Markdown,然後再投入開發資源

二、Markdown 在 AI 搜尋中的神話與現實

神話一:AI 模型「偏愛」Markdown 格式

現實:所有主流 AI 搜尋模型(GPTBot、ClaudeBot、Google-Extended、PerplexityBot)都可以完美地爬取和解析 HTML。事實上,它們的訓練資料本身就是從 HTML 文件中提取的。為它們提供 Markdown 不僅沒有好處,反而可能引入風險——因為網站管理員無法被信任去提供僅供 LLM 使用的特殊內容。這正是過去 keyword meta tag 失敗的根本原因:SEO 從業者總會在特殊格式中塞入不相關的內容。LLM 公司下載正常用戶看到的內容,才是最安全的做法。

神話二:Markdown 檔案可以節省 AI 爬蟲的伺服器資源

現實:雖然 Markdown 檔案確實更小(約為 HTML 的三分之一大小),但這對 AI 爬蟲來說並不重要。AI 公司運行的爬蟲基礎設施極其龐大,帶寬成本與訓練成本相比微不足道。真正需要擔憂伺服器資源的是你的小型香港企業網站本身——但這可以通過 304 狀態碼、CDN 快取和適當的速率限制來解決,而非提供 Markdown 版本。

神話三:Cloudflare 的 Markdown for Agents 很受歡迎

現實:Cloudflare 最近撰文宣稱 Markdown「已迅速成為代理和 AI 系統的通用語言」,並提供自動將 HTML 轉換為 Markdown 的邊緣功能。但 Mueller 的測試結果顯示,實際上並沒有 AI 爬蟲在請求這個功能——如果真有需求,Reddit 討論中應該充滿成功案例,而不是只有 Mueller 的否定回應。Cloudflare 的服務可能在技術上可行,但需求並不存在。

三、Markdown 的真實用途:AI 代理指令而非內容

雖然 Markdown 對 AI 搜尋爬蟲的價值被誇大了,但它在另一個領域確實非常有用:AI 代理的指令檔案。

OpenAI 和 Anthropic 都正式支援 Markdown 格式的工作指令檔案:

  • OpenAI Codex 的 AGENTS.md:OpenAI 明確指出「Codex 在開始任何工作前會讀取 AGENTS.md 檔案」,這是一個提供專案上下文和指令的 Markdown 檔案
  • Anthropic Claude 的類似機制:Anthropic 也支援類似的方式來為 AI 代理提供背景資訊
  • llms.txt V2:Jeremy Howard 的 llms.txt 規範仍然有價值,但它的主要用途是為 AI 代理提供網站結構和摘要,而非讓 AI 搜尋引擎偏好你的內容

關鍵區別:AI 代理指令檔案(AGENTS.md、llms.txt)是告訴 AI 代理如何與你的網站互動的工具,而非讓 AI 搜尋引擎優先引用你的內容的捷徑。前者是技術指南,後者是內容策略,兩者不應混淆。

四、對香港企業 AI SEO 策略的啟示

Mueller 的分享為香港企業的 GEO 策略提供了幾個關鍵教訓:

  • 不要追逐 Markdown 捷徑:花時間將網站內容轉換為 Markdown 格式並提供給 AI 爬蟲,很可能是在浪費資源。優先順序應放在優化 HTML 內容本身。
  • HTML 內容品質才是王道:AI 模型爬取的是你的 HTML 頁面,因此確保你的 HTML 內容清晰、結構化、易於理解,才是真正有效的 AI 搜尋策略。
  • 先測試,再投入:在投資任何 AI 搜尋優化技術之前,先檢查你的伺服器日誌。分析 Accept header 記錄,看看實際上有哪些爬蟲在請求你的網站。
  • 不要過度解讀 Cloudflare 的營銷內容:Cloudflare 推廣 Markdown for Agents 有其商業考量——他們的邊緣網路可以從中獲利。但作為香港企業,你的決策應該基於數據而非供應商營銷。
  • 專注實質而非格式:即使 Markdown 對 AI 爬蟲的吸引力有限,提供清晰、事實豐富、結構良好的內容——無論是 HTML、Markdown 還是純文字——仍然是 AI 引用你的最佳策略。
  • llms.txt 仍有其定位:雖然 Markdown 作為內容提供格式被誇大,但 llms.txt 作為網站摘要目錄仍有其價值,特別是幫助 AI 代理理解你的網站結構。這是一個低風險、潛在收益的補充策略。

五、香港企業即時行動清單

  • 檢查伺服器日誌:在本週內檢查你的伺服器日誌,查看是否有任何 AI 爬蟲(GPTBot、ClaudeBot、Google-Extended、PerplexityBot)在你的網站上請求 Markdown 檔案
  • 設定 Accept header 記錄:如果你的伺服器沒有記錄 Accept header(Mueller 遇到的情況),現在就在伺服器層級加入記錄
  • 檢視現有 Markdown 部署:如果你已經部署了 Markdown 版本給 AI 爬蟲,確認這是否真的有為你帶來任何 AI 搜尋曝光。檢查 Google Search Console 的 AI 成效報告
  • 優化 HTML 優先:將原本計劃投入 Markdown 轉換的資源,轉向優化現有 HTML 內容的結構化程度、清晰度和事實豐富性
  • 設定 AGENTS.md 或 llms.txt:如果你的網站有需要被 AI 代理以特定方式理解的結構(如 API 端點、電子商務產品目錄),設定 AGENTS.md 或 llms.txt 檔案提供指引
  • 定期重新評估:AI 爬蟲的行為在快速變化中,每季重新檢查伺服器日誌和業界報告,確保你的 AI 內容策略仍然基於最新數據

小結

John Mueller 的 Markdown 測試分享是一個重要的現實提醒:在 AI 搜尋的熱潮中,SEO 行業很容易追逐未經驗證的捷徑。Markdown 檔案作為 AI 內容策略的核心假設——「AI 模型偏愛 Markdown 格式」——在 Mueller 的實際測試中並未得到支持。

這並不表示 Markdown 完全沒有價值。它在 AI 代理指令、llms.txt 摘要和專案上下文中的角色是真實的。但作為提升 AI 搜尋曝光的主要策略,它的價值被嚴重誇大了。

對於香港企業而言,真正有效的 AI 內容策略應該回歸基本面:創造清晰、有結構、富含事實、由人類把關的高品質內容,並確保這些內容以標準 HTML 形式可被爬取。當你的內容本身就是為人類讀者設計的高品質資訊時,AI 模型自然會引用它——無論它是以什麼格式呈現的。

如需專業的 AI 搜尋(GEO)內容策略評估,歡迎聯繫我們的團隊進行免費諮詢。