kirin.ceo

home / notes / crawler log surprises

Note

看了三個月的 AI 爬蟲日誌,三件跟我想的不一樣的事

我原本以為爬蟲日誌會告訴我「誰對我有興趣」。它其實更常告訴我「我的網站以前長什麼樣子」。

期間
2026-06-18 ~ 2026-09-08(82 天)
資料集
自有站台的伺服器端存取記錄,16 種 AI 爬蟲、18,097 筆請求
方法
邊緣記錄每個請求的 UA、路徑、狀態碼;對有公開驗證方法的廠商做反向 DNS 正解
限制
樣本來自我自己的站台。流量規模與主題會影響哪些爬蟲來、來多少,不能當成全網路的市佔
這篇寫的是我在自己資料裡看到什麼、原本以為是什麼。如果你要找的是「怎麼從日誌辨識 AI 爬蟲」的操作方法,那是另一件事,我把它寫在 topcc.me 的技術指南

一、請求量最大的那一支,最抓不到東西

請求量前六名(82 天,自有站台)
爬蟲請求數取得內容(HTTP 200)
Bytespider4,15233.2%
Amazonbot3,97152.6%
Meta-ExternalAgent2,29780.0%
ClaudeBot2,22565.3%
ChatGPT-User86491.4%
OAI-SearchBot80981.0%

我原本的直覺是請求量代表興趣程度。但排第一的 Bytespider 有三分之二的請求什麼都沒拿到,而排第五的 ChatGPT-User 幾乎每次都拿到。

差別在於它們怎麼決定要抓什麼。ChatGPT-User 抓的是使用者當下貼出來的網址——那些網址剛剛才被人看過,所以存在。Bytespider 是自主探索,而它記得的路徑有一大半是我很久以前的網站結構。

所以這張表其實在講我自己:200 率低不是爬蟲的問題,是我改過網址而沒有留轉址。我一開始把它讀成「爬蟲品質」,讀錯了。

二、有一支來了 27 次,一次都沒拿到東西

cohere-ai 在 2026-09-06 第一次出現,到 09-08 為止 27 次請求,200 率 0%

它抓的路徑目前一條都不存在。對一個第一次來訪的爬蟲來說,這代表它拿到的網址不是從我的網站上找到的——而是來自別的地方(外部連結、既有語料、或某份過期的清單)。

這件事的實際意義:新爬蟲出現時,它對你的第一印象可能完全建立在你的舊網站上。我沒辦法控制它從哪裡拿到那些網址,但我可以決定那些網址現在回什麼。

三、有一支安靜地消失了

爬蟲最後一次出現這 82 天的總數
anthropic-ai2026-08-02369
Google-Extended2026-08-16399
Diffbot2026-07-26294(只在 7 月中下旬密集出現一週)

anthropic-ai 是一個極短的 UA,字串裡連網址都沒有。它在 8 月初之後就沒再出現,而同期間 ClaudeBotClaude-UserClaude-SearchBot 三支都還在跑。看起來像是舊識別字被新的系列取代了。

我不能從自己的日誌證明這件事——我只能觀察到「不再出現」,不能觀察到「為什麼」。這是單站觀測的天花板。

值得記下來的是:爬蟲清單會過期。如果我在 7 月寫死一份 UA 比對清單,它現在會漏掉 8 月才開始出現的 cohere-ai,同時還在比對一個已經不來的 anthropic-ai

我改變的判讀方式