GEO / AEO 2026-08-18 10 分鐘

ChatGPT 檢索系統深度拆解:索引、快取與真正被讀取的頁面——香港企業 GEO 策略技術清單 | SEO Agency Hong Kong

RESONEO 最新研究分析了 1,200 個 ChatGPT 答案、88,000 個搜尋結果和 26,900 個網頁,全面揭示了 ChatGPT 如何檢索和引用內容。免費模式下,93% 的答案不開啟任何網頁,僅依賴預先建立的摘要。本文為香港企業提供完整的技術對策清單。

一、全新研究:ChatGPT 檢索系統首次全面曝光

一支由 SEO 技術顧問公司 RESONEO 領導的研究團隊發布了迄今為止最全面的 ChatGPT 檢索系統分析報告。通過分析 1,200 個 ChatGPT 答案、88,000 個搜尋結果和 26,900 個不同網頁,研究團隊揭示了 ChatGPT 獲取和引用網頁內容的完整技術架構。這項研究於 2026 年 8 月 17 日在 Search Engine Land 上發表,對香港所有關注 AI 能見度的企業具有即時且重大的策略意義。

研究發現,ChatGPT 的內容檢索系統由三個層級構成:發現索引(Discovery Index)、閱讀快取(Reading Cache)和即時頁面開啟(Live Page Opens)。每個層級都有自己的規則、更新頻率和盲點。理解這些層級,就能解釋為甚麼有些網頁被檢索、有些被閱讀、而只有極少數最終被引用。

二、三大檢索管道的具體運作

研究團隊通過 Chrome 擴展程式捕捉 ChatGPT 傳送到瀏覽器的原始數據串流,發現了 ChatGPT 實際上使用多個不同的檢索管道:

  • Labrador:OpenAI 自有索引(免費用戶的主力)——這是 OpenAI 自己的檢索中樞,除了網絡搜尋外,還整合了新聞、學術論文(arXiv)、Reddit 和 YouTube 結果。免費用戶 Instant 模式中,幾乎所有搜索結果都來自 Labrador。
  • Bright 和 Oxylabs:即時 Google 搜尋結果(付費用戶專屬)——這是從 Google 即時購買的搜尋結果。付費 Thinking 模式下,75% 的搜尋結果來自這個管道。
  • B1/B3、Yelp、TripAdvisor:本地搜尋結果——值得注意的是,這些本地結果顯示的連結指向的是 Google Maps,而非商家自己的網站。

免費 vs 付費的巨大差異:研究發現,免費 Instant 模式下 93% 的答案從不實際開啟任何網頁——回應完全基於標題和約 200 字符的摘要。只有付費 Thinking 模式會真正開啟頁面並閱讀完整內容。考慮到超過 90% 的 ChatGPT 用戶是免費 tier,這意味著大部分 AI 答案依賴的只是你網頁上的一小段文字。

三、Think 按鈕改變了 ChatGPT 看到的內容

研究還追蹤了 ChatGPT 最新「Think」按鈕的影響。當免費帳戶點擊 Think 按鈕時:

  • 檢索池擴大超過一倍:從平均 15.1 個 URL 增加到 35.3 個,從 9.8 個不同域名增加到 16.3 個。
  • 但檢索內容完全不同:免費 Think 模式 74.7% 的結果來自 Labrador(OpenAI 自有索引),僅 3.1% 來自 Google 搜尋結果。而付費 Thinking 模式則相反——75.3% 來自 Google 搜尋。
  • 這代表兩個用戶問同一問題,看到的內容完全不同——你的品牌可能在付費用戶的答案中出現,但在免費用戶的答案中缺席,即使兩者使用了相似的搜尋資源。

更具策略意義的是,研究發現高 effort 的付費模式中,「site:」操作符的使用率從 40.8% 升至 58.1%。ChatGPT 正在更頻繁地直接造訪特定品牌和官方來源,而非廣泛搜索。品牌認知度正在成為 AI 能見度的入場券。

四、Labrador 索引的秘密:標題和 200 字符摘要決定一切

這是整個研究中最關鍵的發現。Labrador 索引中的搜尋結果只包含三樣東西:

  • 網址(URL)
  • 完整頁面標題——從不截斷,即使用 289 個字符的標題也能完整保留
  • 約 200 字符的摘要——基於 H1 標題及其周圍的文本

摘要的構建方式完全出乎意料:

  • 摘要以你的 H1 為錨點,擷取 H1 周圍的可見文本
  • Meta Description 被完全忽略——你精心撰寫的 meta description 對 Labrador 索引完全無效
  • 摘要與查詢無關——同一個 URL 無論用戶問甚麼問題,返回的都是同一段摘要。這在現代搜尋引擎標準中是二十年前就已經淘汰的技術
  • 摘要可能 100% 是目錄、分類標籤、圖片 alt 文字、作者信息或發布日期——完全不含實際內容
  • 研究團隊發現一個案例中,摘要完全由目錄(Table of Contents)組成,實際內容為零

五、閱讀快取:一個被忽略的 AI 曝光指標

ChatGPT 維護著一個所有用戶共享的頁面快取:當一個付費用戶開啟了你的頁面,該頁面的完整 Markdown 版本會被快取約 30 分鐘,期間所有用戶(包括免費)都能讀取這份快取版本。

關鍵發現包括:

  • Cache-Control: no-store 被忽略——即使你的服務器指示不要快取,ChatGPT 仍然會儲存
  • noindex 也被忽略——OpenAI 不尊重標準的網頁排除協議
  • JavaScript 不被執行——客戶端渲染的內容對 ChatGPT 完全不可見
  • 頁面最大 4MB——超過 4MB 的頁面直接被拒絕(HTTP 400),不讀取任何內容
  • JSON-LD 結構化數據被剝離——你精心標記的結構化數據永遠不會通過這個管道到達模型
  • CSS 隱藏的文本仍被提取——ChatGPT 能看到人類訪客看不到的內容

研究團隊還發現了一個寶貴的指標:API 參數可以返回每個 URL 最後被 ChatGPT 快取的時間戳。這提供了一個近乎免費的 AI 曝光監測工具——你可以通過 API 查詢自己頁面的最後快取日期,了解用戶何時曾觸發 ChatGPT 閱讀你的內容。

六、漏斗數據:從檢索到引用的殘酷現實

研究團隊整理的漏斗數據極為直觀:

  • 61,332 個 URL 被顯示在 ChatGPT 的來源側邊欄
  • 5,032 個 URL 成為引用背後的來源(lead source)
  • 僅 759 個頁面被實際開啟(全部在 Thinking 模式下)
  • 一個被開啟的頁面,被引用的機率是 74%
  • 一個僅被檢索但從未開啟的頁面,被引用的機率只有 7%

這意味著:被 ChatGPT 檢索到只是第一步,真正的戰場是能否被實際「開啟」。而開啟只發生在付費 Thinking 模式中。

七、引用之謎:部分引用來自模型記憶而非檢索

研究還發現了一個尚未被完全解釋的現象:部分被引用的來源在搜尋結果中完全不存在。研究團隊推測,這些引用來自模型的參數記憶(parametric memory)——即模型在訓練過程中學到的知識,而非即時檢索的結果。這些「來自記憶」的引用幾乎總是知名網站的根域名,並被加上 utm_source=chatgpt.com 參數,看起來就像來自搜尋結果一樣。

這對香港企業的啟示是:品牌聲望和訓練數據中的出現頻率,可能比即時 SEO 優化更能決定 AI 引用。這與我們之前報道的 ChatGPT 內部品牌偏見研究完全一致。

行動清單

  • 優化 H1 後的首 200 字符:確保第一個 H1 標題後立即跟隨你的核心訊息——分類標籤、日期、作者信息等雜項應放在內容區塊之後
  • 撰寫自成一體的標題:因為完整標題(無論多長)都會被 Labrador 索引保留,寫一個能獨立傳達關鍵信息的標題
  • 保持 4MB 以下:檢查頁面大小,過重的頁面會被 ChatGPT 完全忽略
  • 避免客戶端渲染關鍵內容:重要的品牌訊息和 SEO 內容不應僅通過 JavaScript 渲染
  • 保留 Meta Description:雖然對 Labrador 無效,但 Google-fed 管道(Bright/Oxylabs)仍會使用
  • 通過 API 監測快取時間:利用 OpenAI API 查詢你的頁面最後被 ChatGPT 快取的日期
  • 關注 utm_source=chatgpt.com 以外的信號:ChatGPT 在 Thinking 模式下開啟的頁面不會攜帶 UTM 參數,需同時監測 ChatGPT-User User Agent
  • 針對免費用戶構建摘要優化策略:因為 90% 的 ChatGPT 用戶只看到你的 200 字符摘要

小結

這項 RESONEO 研究是迄今為止對 ChatGPT 檢索系統最徹底的剖析。它的核心發現十分清晰:ChatGPT 的引用機制遠比大多數 SEO 從業者想像的更粗糙——查詢無關的摘要、不執行的 JavaScript、被忽略的 noindex、共享的閱讀快取——這些「技術債務」在短期內反而為內容創作者提供了可操作的優化空間。

對香港企業而言,最緊急的行動是確保 H1 後的 200 字符傳達了你的核心價值。在 ChatGPT 免費用戶的 93% 答案中,這就是模型對你網頁的唯一了解。與此同時,品牌聲望建設仍然是長期 AI 能見度的基礎——無論是通過媒體報導、行業評測還是用戶生成內容。

如果您的團隊需要全面的 GEO 技術審計和內容優化策略,歡迎聯繫我們的專家團隊進行免費諮詢。