AI 時代的網站流量,有一部分是由「看不見的訪客」決定的:GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot 這些 AI 爬蟲,決定您的內容會不會被拿去訓練模型、會不會出現在 AI 的答案裡。很多網站把它們全部封鎖,結果連被 AI 引用的機會也一起關掉了。本文整理各家 AI 爬蟲的完整清單與分工,並提供三種情境的 robots.txt 設定範例。
本篇目錄
AI 爬蟲是什麼?和 Googlebot 差在哪?
AI 爬蟲是由 OpenAI、Anthropic、Perplexity、Google 等 AI 公司派出的自動化程式,用來抓取網頁內容,供大型語言模型訓練、建立 AI 搜尋索引,或在使用者提問當下即時讀取網頁。
AI 爬蟲是 AI 公司用來抓取網頁的自動化程式,依用途分為訓練型、索引型與使用者觸發型三類;網站可以用 robots.txt 分別放行或封鎖,決定內容「被訓練」與「被引用」的界線。
它和 Googlebot 最大的差別在「抓了之後拿去做什麼」。Googlebot 抓取網頁是為了建立搜尋索引,網站獲得的回報是搜尋流量;AI 爬蟲抓取的內容,可能變成模型訓練資料(不一定帶來流量),也可能成為 AI 答案的引用來源(帶來品牌曝光與導流)。
正因為回報不同,AI 爬蟲不能用「一律歡迎」或「一律封鎖」的粗略方式處理。想做出正確決策,得先分清楚它們的三種類型。若您對 robots.txt 本身還不熟,建議先閱讀robots.txt 完整教學,本文聚焦在 AI 爬蟲的部分。
三種類型:訓練型、索引型、使用者觸發型
各家 AI 公司的爬蟲命名不同,但用途都可以歸入三類。分清楚類型,比背熟名字更重要,因為封鎖決策是跟著類型走的。
| 類型 | 用途 | 封鎖後的影響 | 代表爬蟲 |
|---|---|---|---|
| 訓練型 | 抓取內容作為模型訓練資料 | 內容不進入未來模型的訓練集;不影響被 AI 搜尋引用 | GPTBot、ClaudeBot、Google-Extended、CCBot |
| 索引型 | 建立 AI 搜尋的內容索引 | 內容難以出現在該平台的 AI 答案與引用清單中 | OAI-SearchBot、Claude-SearchBot、PerplexityBot |
| 使用者觸發型 | 使用者提問當下即時讀取網頁 | AI 無法替使用者即時開啟您的頁面;此類抓取不一定完全遵守 robots.txt | ChatGPT-User、Claude-User、Perplexity-User |
簡單記法:訓練型決定「內容會不會變成模型的一部分」,索引型決定「內容會不會被 AI 答案引用」,使用者觸發型則是「AI 替使用者代讀網頁」的即時行為。
AI 爬蟲完整清單:四大平台與常見第三方
以下清單依 2026 年 8 月各家官方文件整理。爬蟲名稱就是伺服器 log 與 robots.txt 中使用的 User-Agent 代號,大小寫照抄即可。
| User-Agent | 所屬 | 類型 | 說明 |
|---|---|---|---|
GPTBot |
OpenAI | 訓練型 | 抓取內容供 OpenAI 模型訓練;封鎖它不影響 ChatGPT 搜尋引用 |
OAI-SearchBot |
OpenAI | 索引型 | 建立 ChatGPT 搜尋功能的索引;想被 ChatGPT 引用必須放行 |
ChatGPT-User |
OpenAI | 使用者觸發 | 使用者要求 ChatGPT 開啟特定網頁時使用 |
ClaudeBot |
Anthropic | 訓練型 | 抓取內容供 Claude 模型訓練 |
Claude-SearchBot |
Anthropic | 索引型 | 改善 Claude 搜尋結果的品質;想被 Claude 引用建議放行 |
Claude-User |
Anthropic | 使用者觸發 | 使用者在 Claude 中要求讀取網頁時使用 |
PerplexityBot |
Perplexity | 索引型 | Perplexity 的搜尋索引爬蟲;Perplexity 未另設訓練型爬蟲 |
Perplexity-User |
Perplexity | 使用者觸發 | 使用者提問當下的即時讀取 |
Google-Extended |
訓練型(控制代號) | 控制內容能否用於 Gemini 訓練與 grounding;詳見下一節的例外說明 | |
Googlebot |
索引型 | 傳統搜尋與 AI Overviews 共用同一套索引,沒有獨立的 AI 索引爬蟲 | |
CCBot |
Common Crawl | 訓練型 | 非營利的公開網路資料集,許多模型以其資料訓練 |
Applebot-Extended |
Apple | 訓練型(控制代號) | 控制內容能否用於 Apple 的 AI 模型訓練;一般搜尋仍由 Applebot 負責 |
Bingbot 完成。封鎖 Bingbot 會同時失去 Bing 搜尋排名與 Copilot 引用,兩者無法拆開處理,決定前請把 Bing 帶來的搜尋流量一併算進去。
最常見的誤解:封鎖 GPTBot 不等於退出 ChatGPT
這是我們在客戶網站健檢時最常遇到的設定錯誤:因為「不想內容被 AI 拿走」,一口氣把清單上所有 AI 爬蟲全部 Disallow: /。
問題在於,封鎖 GPTBot 只是退出模型訓練,真正決定 ChatGPT 引不引用您的是 OAI-SearchBot。把索引型爬蟲一起封鎖,等於同時放棄了 AI 搜尋帶來的品牌曝光與導流——而這部分流量的價值並不低:根據 Digiday 於 2025 年 12 月彙整的媒體數據,來自 AI 平台的訪客訂閱轉換率約為一般搜尋來源的 2.4 倍。
反過來的誤解也存在:有網站主以為放行 GPTBot 就會被 ChatGPT 搜尋引用,實際上兩件事各自獨立。訓練與引用,是兩條不同的管線。
- 只封鎖
GPTBot:內容不進未來訓練集,仍可能被 ChatGPT 搜尋引用。 - 只封鎖
OAI-SearchBot:內容可能被拿去訓練,但不會出現在 ChatGPT 搜尋的引用清單。 - 兩者都封鎖:既不訓練也不引用,等於完全退出 OpenAI 生態。
Google 的例外:Google-Extended 與 AI Overviews
Google 是規則最特殊的一家,有兩件事必須分開理解。
第一,Google-Extended 不是一隻實際出動的爬蟲,而是一個控制代號:抓取仍由 Googlebot 執行,Google-Extended 只決定抓到的內容能否用於 Gemini 的模型訓練與 grounding。它不是排名訊號,封鎖它不影響搜尋排名。
第二,封鎖 Google-Extended 並不會讓您退出 AI Overviews。AI Overviews 與傳統搜尋共用 Googlebot 的索引,若真的要退出 AI Overviews 與 AI Mode,2026 年起應改用 Search Console 的「Search generative AI control」屬性層級開關;頁面層級的控制預計 2027 年 3 月上線。AI Overviews 的運作原理與退出前該評估的取捨,另見〈AI Overviews 是什麼〉的完整說明。
三種情境的 robots.txt 設定範例
以下三組範例可以直接依需求取用。robots.txt 放在網站根目錄(https://您的網域/robots.txt),修改後即時生效,不需要重新提交。
情境一:想被 AI 引用,也接受被訓練(全開放)
經營內容行銷、希望 AI 搜尋最大曝光的網站適用。什麼都不用寫——robots.txt 沒有提到的爬蟲,預設就是允許。只要確認沒有 Disallow: / 擋到它們即可。
情境二:拒絕訓練,保留引用(多數內容網站的務實選擇)
# 封鎖訓練型爬蟲
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Applebot-Extended
Disallow: /
# 索引型(OAI-SearchBot、Claude-SearchBot、PerplexityBot)
# 不列出即為允許,內容仍可被 AI 搜尋引用
情境三:全面退出 AI 生態
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Disallow: /
User-agent: Claude-User
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Perplexity-User
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Applebot-Extended
Disallow: /
提醒:情境三仍無法退出 Google AI Overviews(原因見上一節),也擋不住不表明身分的爬蟲。若需要頁面層級而非全站層級的控制,可改用 Robots Meta 指令搭配處理。
本站實例:具名群組會覆蓋 User-agent: * 的陷阱
分享一個我們自己網站的真實案例。2026 年 8 月底全站健檢時,我們發現本站 robots.txt 長年把 Googlebot、GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot 等十多個爬蟲各自列成具名群組、各給一個空的 Disallow:(意思是全部歡迎),另外用 User-agent: * 群組擋掉後台與工具目錄。
看起來很周到,實際上有個隱藏問題:robots 規則是以「最符合的具名群組」為準,具名群組會整組覆蓋 User-agent: *。也就是說,GPTBot 只會讀自己那組空的 Disallow,下方 * 群組裡的後台目錄限制,對這些具名爬蟲通通不生效——它們反而比一般爬蟲擁有更大的存取範圍。
由於這些具名群組的政策其實完全相同,我們最後把它們合併回單一 User-agent: * 群組,行為不變、漏洞消失,日後要對特定爬蟲差別待遇時再單獨拆出即可。如果您的 robots.txt 也是「具名群組+通用群組」並存的寫法,建議立刻檢查一次:每一個具名群組都必須完整重複所有該遵守的 Disallow 規則,不能指望它「繼承」通用群組。
如何驗證設定有沒有生效?
-
直接檢查 robots.txt 本文
在瀏覽器開啟
https://您的網域/robots.txt,逐一確認:想封鎖的爬蟲有自己的具名群組且Disallow: /;想放行的爬蟲沒有被任何規則擋到。 -
到伺服器 access log 看實際造訪
在 log 中搜尋
GPTBot、OAI-SearchBot、ClaudeBot等關鍵字,看封鎖後造訪是否停止、放行的是否持續來訪。以本站為例,我們每月檢查一次 access log 中的 AI 爬蟲紀錄,其中索引型爬蟲的造訪頻率明顯高於訓練型,這也符合「索引需要持續更新、訓練是批次抓取」的特性。 - 確認回應狀態碼 爬蟲收到 200 表示成功抓取;若您用 .htaccess 或防火牆層封鎖,應看到 403。robots.txt 的封鎖不會產生 403——遵守規則的爬蟲會直接不來。
- 把爬蟲紀錄納入常態監測 爬蟲造訪只是起點,後續還要追蹤 AI 實際帶來的點擊與引用,完整方法見〈AI 流量怎麼追蹤〉。
robots.txt 的限制與例外
誠實揭露:本文教的方法有明確的邊界,以下三點請先知道再做決定。
- robots.txt 是君子協定,不是存取控制。它防「爬取」不防「存取」,惡意爬蟲可以完全無視。真正的機密目錄應該用伺服器層(.htaccess、防火牆)直接回 403,作法可參考〈使用 .htaccess 阻擋不想要的訪客〉。
- 使用者觸發型爬蟲不一定遵守規則。各家對 ChatGPT-User、Perplexity-User 這類「代替使用者讀網頁」的行為,遵守 robots.txt 的程度不一;2024 年 WIRED 就曾實測質疑 Perplexity 的抓取未完全遵守 robots.txt。您能控制的是索引與訓練管線,控制不了每一次即時讀取。
- 產業環境仍在快速變動。2025 年 7 月起,Cloudflare 對新註冊網域預設封鎖 AI 爬蟲,並推出按次收費的抓取授權實驗;各家爬蟲名單也持續增修。本文清單依 2026 年 8 月官方文件整理,執行前建議再對照各平台最新文件。
結論與行動清單
AI 爬蟲管理的本質是一個商業決策:您願意用內容交換什麼?多數經營內容的中小企業,答案會落在「拒絕訓練、保留引用」——這正是情境二的設定。真正要避免的是不理解分工就全部封鎖,把 AI 搜尋時代的曝光機會一起關掉。
- 打開自己的 robots.txt,列出目前封鎖與放行的 AI 爬蟲清單
- 確認索引型爬蟲(OAI-SearchBot、Claude-SearchBot、PerplexityBot)沒有被誤擋
- 依「要不要被訓練」決定 GPTBot、ClaudeBot、Google-Extended、CCBot 的去留
- 檢查具名群組是否完整重複了通用群組的 Disallow 規則
- 每月看一次 access log 的 AI 爬蟲紀錄,確認行為與設定一致
爬蟲放行只是 GEO 的第一步,內容能不能被 AI 選中引用,取決於可擷取性、事實密度與權威訊號,完整方法請見〈生成式引擎優化五步驟實戰〉;整體搜尋佈局的基本功,則可回到SEO 完整指南。
常見問答 FAQ
AI 爬蟲是什麼?
封鎖 GPTBot 之後,我的網站就不會出現在 ChatGPT 了嗎?
封鎖 Google-Extended 可以退出 Google AI Overviews 嗎?
該不該封鎖 AI 爬蟲?
robots.txt 擋得住所有 AI 爬蟲嗎?
參考來源
- OpenAI,〈Overview of OpenAI Crawlers〉,OpenAI 官方文件。
- Anthropic,〈Does Anthropic crawl data from the web?〉,Anthropic 官方說明。
- Perplexity,〈Perplexity Crawlers〉,Perplexity 官方文件。
- Google Search Central,〈Google 檢索器與擷取工具總覽〉,Google 官方文件。
- Google Search Central,〈AI 功能與您的網站〉,Google 官方文件。
- Dhruv Mehrotra、Tim Marchman,〈Perplexity Is a Bullshit Machine〉,WIRED,2024。
- 新視野網頁設計,〈GEO 是什麼? 生成式引擎優化完整教學〉,本站自有內容。
本文爬蟲清單依 2026 年 8 月各平台官方文件整理;文中本站 robots.txt 調整為 2026 年 8 月 30 日的實際維運紀錄。