SEO GUIDE
SEO 指南 Q & A
AI SEO 與 AEO

AI 爬蟲是什麼?GPTBot、ClaudeBot 完整清單與 robots.txt 設定

AI 爬蟲示意圖,介紹 GPTBot、ClaudeBot 完整清單與 robots.txt 存取設定方法。

最後更新:

AI 時代的網站流量,有一部分是由「看不見的訪客」決定的:GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot 這些 AI 爬蟲,決定您的內容會不會被拿去訓練模型、會不會出現在 AI 的答案裡。很多網站把它們全部封鎖,結果連被 AI 引用的機會也一起關掉了。本文整理各家 AI 爬蟲的完整清單與分工,並提供三種情境的 robots.txt 設定範例。

本篇目錄

AI 爬蟲是什麼?和 Googlebot 差在哪?

AI 爬蟲是由 OpenAI、Anthropic、Perplexity、Google 等 AI 公司派出的自動化程式,用來抓取網頁內容,供大型語言模型訓練、建立 AI 搜尋索引,或在使用者提問當下即時讀取網頁。

AI 爬蟲是 AI 公司用來抓取網頁的自動化程式,依用途分為訓練型、索引型與使用者觸發型三類;網站可以用 robots.txt 分別放行或封鎖,決定內容「被訓練」與「被引用」的界線。

它和 Googlebot 最大的差別在「抓了之後拿去做什麼」。Googlebot 抓取網頁是為了建立搜尋索引,網站獲得的回報是搜尋流量;AI 爬蟲抓取的內容,可能變成模型訓練資料(不一定帶來流量),也可能成為 AI 答案的引用來源(帶來品牌曝光與導流)。

正因為回報不同,AI 爬蟲不能用「一律歡迎」或「一律封鎖」的粗略方式處理。想做出正確決策,得先分清楚它們的三種類型。若您對 robots.txt 本身還不熟,建議先閱讀robots.txt 完整教學,本文聚焦在 AI 爬蟲的部分。

三種類型:訓練型、索引型、使用者觸發型

各家 AI 公司的爬蟲命名不同,但用途都可以歸入三類。分清楚類型,比背熟名字更重要,因為封鎖決策是跟著類型走的。

AI 爬蟲三種類型示意圖,說明訓練型、索引型與使用者觸發型爬蟲的運作差異。
表格說明:AI 爬蟲三種類型的用途、對網站的影響與建議處理方式
類型 用途 封鎖後的影響 代表爬蟲
訓練型 抓取內容作為模型訓練資料 內容不進入未來模型的訓練集;不影響被 AI 搜尋引用 GPTBot、ClaudeBot、Google-Extended、CCBot
索引型 建立 AI 搜尋的內容索引 內容難以出現在該平台的 AI 答案與引用清單中 OAI-SearchBot、Claude-SearchBot、PerplexityBot
使用者觸發型 使用者提問當下即時讀取網頁 AI 無法替使用者即時開啟您的頁面;此類抓取不一定完全遵守 robots.txt ChatGPT-User、Claude-User、Perplexity-User

簡單記法:訓練型決定「內容會不會變成模型的一部分」,索引型決定「內容會不會被 AI 答案引用」,使用者觸發型則是「AI 替使用者代讀網頁」的即時行為。

決策核心:想經營 AI 搜尋能見度的網站,該放行的是「索引型」爬蟲。您完全可以封鎖訓練型、放行索引型,也就是「拒絕被訓練,保留被引用」。這個組合是目前多數內容網站的務實選擇,詳細策略脈絡可見GEO 是什麼?完整教學

AI 爬蟲完整清單:四大平台與常見第三方

以下清單依 2026 年 8 月各家官方文件整理。爬蟲名稱就是伺服器 log 與 robots.txt 中使用的 User-Agent 代號,大小寫照抄即可。

表格說明:主要 AI 爬蟲清單,含所屬公司、類型與封鎖時的實際影響
User-Agent 所屬 類型 說明
GPTBot OpenAI 訓練型 抓取內容供 OpenAI 模型訓練;封鎖它不影響 ChatGPT 搜尋引用
OAI-SearchBot OpenAI 索引型 建立 ChatGPT 搜尋功能的索引;想被 ChatGPT 引用必須放行
ChatGPT-User OpenAI 使用者觸發 使用者要求 ChatGPT 開啟特定網頁時使用
ClaudeBot Anthropic 訓練型 抓取內容供 Claude 模型訓練
Claude-SearchBot Anthropic 索引型 改善 Claude 搜尋結果的品質;想被 Claude 引用建議放行
Claude-User Anthropic 使用者觸發 使用者在 Claude 中要求讀取網頁時使用
PerplexityBot Perplexity 索引型 Perplexity 的搜尋索引爬蟲;Perplexity 未另設訓練型爬蟲
Perplexity-User Perplexity 使用者觸發 使用者提問當下的即時讀取
Google-Extended Google 訓練型(控制代號) 控制內容能否用於 Gemini 訓練與 grounding;詳見下一節的例外說明
Googlebot Google 索引型 傳統搜尋與 AI Overviews 共用同一套索引,沒有獨立的 AI 索引爬蟲
CCBot Common Crawl 訓練型 非營利的公開網路資料集,許多模型以其資料訓練
Applebot-Extended Apple 訓練型(控制代號) 控制內容能否用於 Apple 的 AI 模型訓練;一般搜尋仍由 Applebot 負責
Microsoft Copilot 沒有獨立的 AI 爬蟲:Copilot 的答案建立在 Bing 索引之上,抓取由 Bingbot 完成。封鎖 Bingbot 會同時失去 Bing 搜尋排名與 Copilot 引用,兩者無法拆開處理,決定前請把 Bing 帶來的搜尋流量一併算進去。

最常見的誤解:封鎖 GPTBot 不等於退出 ChatGPT

這是我們在客戶網站健檢時最常遇到的設定錯誤:因為「不想內容被 AI 拿走」,一口氣把清單上所有 AI 爬蟲全部 Disallow: /

問題在於,封鎖 GPTBot 只是退出模型訓練,真正決定 ChatGPT 引不引用您的是 OAI-SearchBot。把索引型爬蟲一起封鎖,等於同時放棄了 AI 搜尋帶來的品牌曝光與導流——而這部分流量的價值並不低:根據 Digiday 於 2025 年 12 月彙整的媒體數據,來自 AI 平台的訪客訂閱轉換率約為一般搜尋來源的 2.4 倍。

反過來的誤解也存在:有網站主以為放行 GPTBot 就會被 ChatGPT 搜尋引用,實際上兩件事各自獨立。訓練與引用,是兩條不同的管線。

  • 只封鎖 GPTBot:內容不進未來訓練集,仍可能被 ChatGPT 搜尋引用。
  • 只封鎖 OAI-SearchBot:內容可能被拿去訓練,但不會出現在 ChatGPT 搜尋的引用清單。
  • 兩者都封鎖:既不訓練也不引用,等於完全退出 OpenAI 生態。

Google 的例外:Google-Extended 與 AI Overviews

Google 是規則最特殊的一家,有兩件事必須分開理解。

第一,Google-Extended 不是一隻實際出動的爬蟲,而是一個控制代號:抓取仍由 Googlebot 執行,Google-Extended 只決定抓到的內容能否用於 Gemini 的模型訓練與 grounding。它不是排名訊號,封鎖它不影響搜尋排名。

第二,封鎖 Google-Extended 並不會讓您退出 AI Overviews。AI Overviews 與傳統搜尋共用 Googlebot 的索引,若真的要退出 AI Overviews 與 AI Mode,2026 年起應改用 Search Console 的「Search generative AI control」屬性層級開關;頁面層級的控制預計 2027 年 3 月上線。AI Overviews 的運作原理與退出前該評估的取捨,另見〈AI Overviews 是什麼〉的完整說明。

台灣網站要特別留意 Google:依 Statcounter 統計,2026 年 7 月台灣 AI 聊天機器人流量中 Gemini 佔 23.63%,遠高於全球平均的 9.9%。在台灣市場,Google 系的 AI 能見度比多數國家更值錢,封鎖前請三思。

三種情境的 robots.txt 設定範例

以下三組範例可以直接依需求取用。robots.txt 放在網站根目錄(https://您的網域/robots.txt),修改後即時生效,不需要重新提交。

情境一:想被 AI 引用,也接受被訓練(全開放)

經營內容行銷、希望 AI 搜尋最大曝光的網站適用。什麼都不用寫——robots.txt 沒有提到的爬蟲,預設就是允許。只要確認沒有 Disallow: / 擋到它們即可。

情境二:拒絕訓練,保留引用(多數內容網站的務實選擇)

robots.txt
# 封鎖訓練型爬蟲
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Applebot-Extended
Disallow: /

# 索引型(OAI-SearchBot、Claude-SearchBot、PerplexityBot)
# 不列出即為允許,內容仍可被 AI 搜尋引用

情境三:全面退出 AI 生態

robots.txt
User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-SearchBot
Disallow: /

User-agent: Claude-User
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Perplexity-User
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Applebot-Extended
Disallow: /

提醒:情境三仍無法退出 Google AI Overviews(原因見上一節),也擋不住不表明身分的爬蟲。若需要頁面層級而非全站層級的控制,可改用 Robots Meta 指令搭配處理。

本站實例:具名群組會覆蓋 User-agent: * 的陷阱

分享一個我們自己網站的真實案例。2026 年 8 月底全站健檢時,我們發現本站 robots.txt 長年把 Googlebot、GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot 等十多個爬蟲各自列成具名群組、各給一個空的 Disallow:(意思是全部歡迎),另外用 User-agent: * 群組擋掉後台與工具目錄。

看起來很周到,實際上有個隱藏問題:robots 規則是以「最符合的具名群組」為準,具名群組會整組覆蓋 User-agent: *。也就是說,GPTBot 只會讀自己那組空的 Disallow,下方 * 群組裡的後台目錄限制,對這些具名爬蟲通通不生效——它們反而比一般爬蟲擁有更大的存取範圍。

由於這些具名群組的政策其實完全相同,我們最後把它們合併回單一 User-agent: * 群組,行為不變、漏洞消失,日後要對特定爬蟲差別待遇時再單獨拆出即可。如果您的 robots.txt 也是「具名群組+通用群組」並存的寫法,建議立刻檢查一次:每一個具名群組都必須完整重複所有該遵守的 Disallow 規則,不能指望它「繼承」通用群組。

如何驗證設定有沒有生效?

如何驗證 robots.txt 設定是否生效,依序檢查檔案內容、伺服器 access log、HTTP 回應狀態碼與爬蟲監測紀錄。
  • 直接檢查 robots.txt 本文 在瀏覽器開啟 https://您的網域/robots.txt,逐一確認:想封鎖的爬蟲有自己的具名群組且 Disallow: /;想放行的爬蟲沒有被任何規則擋到。
  • 到伺服器 access log 看實際造訪 在 log 中搜尋 GPTBotOAI-SearchBotClaudeBot 等關鍵字,看封鎖後造訪是否停止、放行的是否持續來訪。以本站為例,我們每月檢查一次 access log 中的 AI 爬蟲紀錄,其中索引型爬蟲的造訪頻率明顯高於訓練型,這也符合「索引需要持續更新、訓練是批次抓取」的特性。
  • 確認回應狀態碼 爬蟲收到 200 表示成功抓取;若您用 .htaccess 或防火牆層封鎖,應看到 403。robots.txt 的封鎖不會產生 403——遵守規則的爬蟲會直接不來。
  • 把爬蟲紀錄納入常態監測 爬蟲造訪只是起點,後續還要追蹤 AI 實際帶來的點擊與引用,完整方法見〈AI 流量怎麼追蹤〉。

robots.txt 的限制與例外

誠實揭露:本文教的方法有明確的邊界,以下三點請先知道再做決定。

  • robots.txt 是君子協定,不是存取控制。它防「爬取」不防「存取」,惡意爬蟲可以完全無視。真正的機密目錄應該用伺服器層(.htaccess、防火牆)直接回 403,作法可參考〈使用 .htaccess 阻擋不想要的訪客〉。
  • 使用者觸發型爬蟲不一定遵守規則。各家對 ChatGPT-User、Perplexity-User 這類「代替使用者讀網頁」的行為,遵守 robots.txt 的程度不一;2024 年 WIRED 就曾實測質疑 Perplexity 的抓取未完全遵守 robots.txt。您能控制的是索引與訓練管線,控制不了每一次即時讀取。
  • 產業環境仍在快速變動。2025 年 7 月起,Cloudflare 對新註冊網域預設封鎖 AI 爬蟲,並推出按次收費的抓取授權實驗;各家爬蟲名單也持續增修。本文清單依 2026 年 8 月官方文件整理,執行前建議再對照各平台最新文件。

結論與行動清單

AI 爬蟲管理的本質是一個商業決策:您願意用內容交換什麼?多數經營內容的中小企業,答案會落在「拒絕訓練、保留引用」——這正是情境二的設定。真正要避免的是不理解分工就全部封鎖,把 AI 搜尋時代的曝光機會一起關掉。

  • 打開自己的 robots.txt,列出目前封鎖與放行的 AI 爬蟲清單
  • 確認索引型爬蟲(OAI-SearchBot、Claude-SearchBot、PerplexityBot)沒有被誤擋
  • 依「要不要被訓練」決定 GPTBot、ClaudeBot、Google-Extended、CCBot 的去留
  • 檢查具名群組是否完整重複了通用群組的 Disallow 規則
  • 每月看一次 access log 的 AI 爬蟲紀錄,確認行為與設定一致

爬蟲放行只是 GEO 的第一步,內容能不能被 AI 選中引用,取決於可擷取性、事實密度與權威訊號,完整方法請見〈生成式引擎優化五步驟實戰〉;整體搜尋佈局的基本功,則可回到SEO 完整指南

常見問答 FAQ

AI 爬蟲是什麼?
AI 爬蟲是 OpenAI、Anthropic、Perplexity、Google 等 AI 公司派出的自動化程式,用來抓取網頁內容。依用途分三類:訓練型(如 GPTBot、ClaudeBot)把內容納入模型訓練資料;索引型(如 OAI-SearchBot、PerplexityBot)建立 AI 搜尋的引用索引;使用者觸發型(如 ChatGPT-User)在使用者提問當下即時讀取網頁。網站可以在 robots.txt 中用各爬蟲的 User-Agent 名稱分別放行或封鎖,最常見的務實做法是封鎖訓練型、放行索引型,也就是拒絕內容被拿去訓練模型,但保留被 AI 答案引用、帶來品牌曝光的機會。
封鎖 GPTBot 之後,我的網站就不會出現在 ChatGPT 了嗎?
不會。GPTBot 只負責抓取模型訓練資料,封鎖它代表內容不進入 OpenAI 未來模型的訓練集,但 ChatGPT 搜尋功能引不引用您的網站,是由另一隻索引型爬蟲 OAI-SearchBot 決定的。只要 OAI-SearchBot 沒被封鎖,您的內容仍可能出現在 ChatGPT 的答案與引用清單中;反過來說,若您封鎖了 OAI-SearchBot,就算放行 GPTBot 也不會被引用。訓練與引用是兩條獨立的管線,設定 robots.txt 前務必分清楚,這是實務上最常見的誤解。
封鎖 Google-Extended 可以退出 Google AI Overviews 嗎?
不行。Google-Extended 只控制內容能否用於 Gemini 的模型訓練與 grounding,它不是實際出動的爬蟲,也不是排名訊號。AI Overviews 與傳統搜尋共用 Googlebot 的同一套索引,所以封鎖 Google-Extended 之後,您的內容仍可能出現在 AI Overviews 中。若確定要退出 AI Overviews 與 AI Mode,2026 年起應使用 Search Console 的「Search generative AI control」屬性層級開關;頁面層級的控制 Google 預告於 2027 年 3 月上線。退出前建議先評估流量取捨,因為這會同時放棄 AI 版位帶來的曝光。
該不該封鎖 AI 爬蟲?
取決於您的商業模式。內容本身就是商品(付費牆媒體、線上課程、資料庫服務)的網站,封鎖訓練型爬蟲合理,甚至可以連索引型一起封鎖;但多數靠內容換曝光與詢問的企業網站,建議至少放行索引型爬蟲,因為 AI 搜尋帶來的訪客品質不差——Digiday 於 2025 年 12 月彙整的媒體數據顯示,AI 平台訪客的訂閱轉換率約為一般搜尋來源的 2.4 倍。務實的中間路線是:封鎖 GPTBot、ClaudeBot、Google-Extended、CCBot 等訓練型,放行 OAI-SearchBot、Claude-SearchBot、PerplexityBot 等索引型,拒絕被訓練的同時保留被引用的機會。
robots.txt 擋得住所有 AI 爬蟲嗎?
擋不住。robots.txt 是自願遵守的君子協定,主要 AI 公司的訓練型與索引型爬蟲大多會遵守,但使用者觸發型抓取(如替使用者即時開啟網頁)各家遵守程度不一,2024 年 WIRED 就曾實測質疑 Perplexity 未完全遵守 robots.txt;不表明身分的惡意爬蟲更是完全無視。若有內容絕對不能被抓取,應該在伺服器層處理:用 .htaccess 或防火牆比對 User-Agent 與 IP 直接回 403,或將內容放在登入牆之後。robots.txt 的定位是管理善意爬蟲的存取範圍,而不是安全機制。

參考來源

  1. OpenAI,〈Overview of OpenAI Crawlers〉,OpenAI 官方文件。
  2. Anthropic,〈Does Anthropic crawl data from the web?〉,Anthropic 官方說明。
  3. Perplexity,〈Perplexity Crawlers〉,Perplexity 官方文件。
  4. Google Search Central,〈Google 檢索器與擷取工具總覽〉,Google 官方文件。
  5. Google Search Central,〈AI 功能與您的網站〉,Google 官方文件。
  6. Dhruv Mehrotra、Tim Marchman,〈Perplexity Is a Bullshit Machine〉,WIRED,2024。
  7. 新視野網頁設計,〈GEO 是什麼? 生成式引擎優化完整教學〉,本站自有內容。

本文爬蟲清單依 2026 年 8 月各平台官方文件整理;文中本站 robots.txt 調整為 2026 年 8 月 30 日的實際維運紀錄。

關於作者

內容揭露:本文由新視野網頁設計 SEO 團隊撰寫。文中連結的站內指南與延伸閱讀均為本站自有內容;新視野提供網頁設計與 SEO/AI SEO 服務,讀者在採用本文建議前請自行評估是否符合自身情況。文中引用的第三方研究與官方文件皆附可點擊出處,歡迎查證。

新視野網頁設計 SEO 團隊

新視野網頁設計自 2005 年起投入企業網站建置與搜尋行銷,服務範圍涵蓋 RWD 網站設計、技術 SEO、結構化資料佈署,以及 AI 搜尋時代的 AEO/GEO 內容優化。本文由新視野 SEO 團隊撰寫、審閱並持續維護更新。

服務據點:
台中(總公司)台中市南區忠明南路 758 號 21 樓 B4台北高雄
聯絡電話:
04-2260-1329
公司資訊:
關於我們公司位置線上詢價
對外平台:
FacebookLinkedIn
本站同主題內容:
GEO 完整教學llms.txt 指南robots.txt 教學AI 流量追蹤

歡迎推廣本文,請務必連結(LINK)本文出處:新視野網頁設計公司