Google 更新爬取預算文件:304 狀態碼與 Cloudflare AI 封鎖的雙重提醒

過去一週的 SEO 圈子有兩個值得香港企業留意的技術更新:第一是 Google 正式更新了爬取預算(Crawl Budget)的官方文件,明確建議網站使用 HTTP 304 Not Modified 狀態碼來節省伺服器資源;第二是有用戶報告指出,Cloudflare 的 AI Bot 阻擋功能可能意外地同時封鎖了合法的 Googlebot 和 Bingbot,導致網站無法被正常索引。

這兩個事件看似獨立,但其實都指向同一個核心問題 — 你的網站伺服器如何與搜尋引擎爬蟲溝通。本文將拆解這兩項變化,並為香港企業提供可立即執行的技術檢查清單。

一、Google 爬取預算文件更新:304 狀態碼正式獲推薦

Google 近日更新了其 Optimize Your Crawl Budget(優化爬取預算)文件,加入了兩個關鍵的新指引。

什麼是爬取預算?

爬取預算是指 Google 分配給你的網站進行爬取和索引的資源上限。對於大型網站(超過 10,000 頁)或內容頻繁更新的網站來說,爬取預算的管理直接影響新內容被 Google 發現和收錄的速度。

兩項重點更新

1. 所有 Google 爬蟲共享同一個爬取容量

Google 在文件中明確指出:

“雖然每個爬蟲有不同的爬取需求,但爬取容量上限是所有爬蟲共享的。這意味著一個爬蟲的高需求可能會降低其他爬蟲可用的容量。”

換句話說,如果 Googlebot-Image(圖片爬蟲)正在大量爬取你的圖片,Googlebot(網頁爬蟲)可用的爬取資源就會被擠壓。對於香港常見的 電子商務網站和內容型網站來說,這是一個容易被忽略的問題 — 你可能只關注網頁索引情況,卻不知道圖片爬蟲正在消耗寶貴的爬取配額。

2. 強烈建議使用 304 Not Modified 回應碼

Google 新增的建議原文:

“使用 HTTP 快取:支援 304 (Not Modified) HTTP 狀態碼。如果一個頁面自 Google 上次爬取以來沒有變更,回傳 304 狀態碼可以告訴 Google 使用快取版本,從而節省你的伺服器頻寬和資源。”

304 狀態碼的運作方式:當 Googlebot 再次請求一個頁面時,你的伺服器可以檢查該頁面是否有更新。如果沒有變更,伺服器只需回傳一個輕量級的 304 響應(不需要重新傳送整個頁面的 HTML 內容),Googlebot 就會繼續使用之前索引的版本。

對香港企業的實際影響

  • 使用共享主機的網站:如果你的網站與其他網站共享伺服器資源,304 狀態碼可以有效減少伺服器負載,避免因為 Googlebot 頻繁爬取而導致網站速度下降。
  • 大型產品目錄:擁有數百或數千個產品頁面的香港電商網站,如果大部分產品頁面內容更新頻率不高,啟用 304 狀態碼可以大幅節省爬取預算,讓 Google 集中資源爬取真正重要的新頁面。
  • 新聞或媒體網站:內容頻繁更新的網站可以透過 304 狀態碼確保 Googlebot 知道哪些頁面是真正更新過的,而不是無差別地重新爬取所有頁面。

如何檢查你的伺服器是否支援 304 狀態碼?

你可以使用瀏覽器的開發者工具或 curl 指令檢查:

curl -I -H "If-Modified-Since: Thu, 01 Aug 2026 00:00:00 GMT" https://你的網站.com/某頁面/

如果伺服器回傳 304 Not Modified,表示該頁面已正確支援此功能。如果回傳 200 OK 並附帶完整內容,則代表你的伺服器沒有正確利用這個機制。

二、Cloudflare AI Bot 阻擋功能:可能意外封鎖 Googlebot

另一個重要消息來自於 Reddit 社群上的報告:有用戶發現啟用 Cloudflare 的 AI Crawlers & Scrapers 阻擋功能後,Googlebot 和 Bingbot 也開始收到 HTTP 403 禁止存取的回應。

事件始末

一位 Reddit 用戶在 r/TechSEO 社群中描述:

“當我將 AI Training 設為 Block 時,Googlebot 和 Bingbot 在嘗試獲取我的 sitemap 時開始收到 403 錯誤。當我關閉 AI Training 封鎖後,sitemap 又可以正常存取。”

他進一步解釋,Cloudflare 現在將 Googlebot 和 Bingbot 歸類為 “Search + Training”(搜尋 + 訓練)混合用途爬蟲,因此啟用 AI 訓練封鎖時會連帶影響這些搜尋引擎爬蟲。

Cloudflare 的官方立場

Cloudflare 早在先前的公告中已預告,從 2026 年 9 月 15 日起,新網域的默認設定將會封鎖被歸類為 Training 或 Agent 的爬蟲,而 Search 仍會保留。但關鍵問題是:混合用途爬蟲(同時進行搜尋索引和 AI 訓練)也會被一併封鎖。

香港企業應如何應對?

  • 立即檢查你的 Cloudflare 設定:登入 Cloudflare 後台,前往 Scrape Shield 或 Bot Management 區域,檢查 AI Crawlers & Scrapers 的設定是否已啟用。如果啟用了,請確認 Googlebot 和 Bingbot 是否被列入阻擋清單。
  • 考慮使用白名單:如果你希望繼續阻擋 AI 訓練爬蟲但不想影響搜尋排名,可以手動將 Googlebot 和 Bingbot 的 IP 範圍加入白名單。Google 的官方爬蟲 IP 範圍可以在 developers.google.com/search/apis/ipranges 找到。
  • 監控 Search Console:定期檢查 Google Search Console 中的 索引覆蓋報告,如果發現索引頁面數量突然大幅下降,這可能是 Cloudflare 或其他 CDN 設定問題的信號。
  • 使用 robots.txt 作為輔助:在 robots.txt 中明確指定哪些爬蟲可以或不可以存取,作為 Cloudflare 設定的備用方案。

三、本週行動清單(可在 30 分鐘內完成)

1. 測試 304 狀態碼 選取 3–5 個你網站上較少更新的頁面(如「關於我們」、「聯絡我們」等),使用上述 curl 指令測試你的伺服器是否正確回應 304。

2. 檢查 Cloudflare 設定 如果你正在使用 Cloudflare,立即檢查 AI Crawlers & Scrapers 的設定,確保 Googlebot 沒有被不當封鎖。

3. 檢視 Search Console 索引報告 前往 Google Search Console 的「索引」>「頁面」報告,查看過去一週的索引趨勢是否有異常下降。

4. 檢查伺服器日誌 查看伺服器存取日誌,確認 Googlebot 的爬取頻率是否正常,以及是否有大量 403 錯誤記錄。

總結

這次 Google 爬取預算文件的更新和 Cloudflare 的 AI Bot 封鎖事件,提醒了我們一個不變的道理:技術 SEO 的基礎建設仍然至關重要。無論 AI 搜尋如何演進,如果 Googlebot 無法正常存取你的網站,再好的內容策略也無法發揮效果。

香港企業在追逐 AI SEO 新技術的同時,切勿忽略了這些基本的技術環節 — 確保伺服器正確回應 304 狀態碼、檢查 CDN 設定不會意外阻擋搜尋引擎爬蟲,這些都是維持網站搜索可見度的基本功。

如果你對 Google 爬取預算的詳細技術文件感興趣,可以參考 Google 官方 Crawl Budget 文檔。如果你對 Cloudflare 的 AI Bot 封鎖政策有疑問,可以查閱 Cloudflare 官方公告。

準備好開始優化您的網站了嗎?

獲取免費SEO分析報告,了解您網站的優化潛力

免費諮詢