AI 爬虫抓取验证工具
模拟 GPTBot、ClaudeBot、CCBot、Kimi、Bytespider 等 30+ 主流 AI 爬虫的 User-Agent 访问你的网站,按优先级检测抓取状态、robots.txt 规则和 Meta robots 标签,覆盖中美主要 AI 厂商
输入网站 URL
输入你想检测的网站域名或完整 URL(支持带或不带 http/https 前缀)
功能简介
工具内置 36 个主流 AI 爬虫(2026-07 核查版),按 高 中 低 三档优先级排序检测。本次更新新增了 CCBot(Common Crawl,众多大模型训练语料的上游数据源)、Claude-SearchBot、Google-GeminiNotebook、bingbot,以及 Kimi(KimiBot / Kimi-SearchBot / Kimi-User)、Bytespider(字节跳动)、Baiduspider 等中国厂商爬虫。下表展示完整清单:
地区标识:★中国厂商 ★美国厂商(其他地区不标注); 优先级:高 = 主流 AI 搜索/聊天产品、基础模型训练或高抓取量,建议默认检测;中 = 有明确用途但流量或资料完整度相对较低;低 = 特定场景补充。 带 非官方 标注的爬虫,其 UA 来自日志观测或第三方记录,厂商尚未正式确认。
| 优先级 | 名称 | 厂商 | 说明 | 完整 User-Agent | Robots.txt disallow 规则 |
|---|---|---|---|---|---|
| 高优先级 | |||||
| 高 | ★GPTBot | OpenAI | OpenAI 模型训练数据抓取。 | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot |
User-agent: GPTBot Disallow: /private-folder |
| 高 | ★OAI-SearchBot | OpenAI | ChatGPT Search 搜索索引抓取(非训练用途),允许它有助于进入 ChatGPT 搜索结果。 | Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; +https://openai.com/searchbot |
User-agent: OAI-SearchBot Disallow: /private-folder |
| 高 | ★ChatGPT-User | OpenAI | ChatGPT 用户触发的实时网页访问代理。 ⚠️ 用户触发型,可能不受 robots.txt 约束。 | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ChatGPT-User/1.0; +https://openai.com/bot |
User-agent: ChatGPT-User Disallow: /private-folder |
| 高 | ★ClaudeBot | Anthropic | Anthropic 模型训练数据抓取。 | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com) |
User-agent: ClaudeBot Disallow: /private-folder |
| 高 | ★Claude-SearchBot | Anthropic | Anthropic 搜索索引抓取,用于改善 Claude 搜索结果相关性与内容引用(对标 OAI-SearchBot)。 | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Claude-SearchBot/1.0; +https://www.anthropic.com) |
User-agent: Claude-SearchBot Disallow: /private-folder |
| 高 | ★Claude-User | Anthropic | Claude 用户请求触发的实时网页访问代理。 ⚠️ 用户触发型,可能不受 robots.txt 约束。 | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Claude-User/1.0; +Claude-User@anthropic.com) |
User-agent: Claude-User Disallow: /private-folder |
| 高 | ★Googlebot | Google 搜索主抓取爬虫,同时是 AI Overviews / AI Mode 与 Gemini 搜索的内容来源。 | Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html) |
User-agent: Googlebot Disallow: /private-folder |
|
| 高 | ★Google-Extended | 控制内容能否用于 Gemini / Vertex AI 训练的 robots.txt token,不发起独立请求。 ℹ️ Token 型,不发起独立 HTTP 请求,仅作 robots.txt 控制。 | Mozilla/5.0 (compatible; Google-Extended) |
User-agent: Google-Extended Disallow: /private-folder |
|
| 高 | ★Google-GeminiNotebook | Gemini Notebook(原 NotebookLM)用户添加来源 URL 时的抓取器,2026-07 由 Google-NotebookLM 更名。 ⚠️ 用户触发型,通常忽略 robots.txt。 | Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/137.0.0.0 Safari/537.36 (compatible; Google-GeminiNotebook; +https://developers.google.com/crawling/docs/crawlers-fetchers/google-gemininotebook) |
User-agent: Google-GeminiNotebook Disallow: /private-folder |
|
| 高 | ★Google-Agent (Desktop) | Google 托管 Agent(如 Project Mariner)桌面端访问代理。 ⚠️ 用户触发型,通常忽略 robots.txt。 | Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko; compatible; Google-Agent; +https://developers.google.com/crawling/docs/crawlers-fetchers/google-agent) Chrome/W.X.Y.Z Safari/537.36 |
User-agent: Google-Agent Disallow: /private-folder |
|
| 高 | ★Google-Agent (Mobile) | Google 托管 Agent 移动端访问代理。 ⚠️ 用户触发型,通常忽略 robots.txt。 | Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z Mobile Safari/537.36 (compatible; Google-Agent; +https://developers.google.com/crawling/docs/crawlers-fetchers/google-agent) |
User-agent: Google-Agent Disallow: /private-folder |
|
| 高 | ★PerplexityBot | Perplexity | Perplexity 答案引擎的索引抓取,用于搜索结果与引用,不用于训练基础模型。 | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot) |
User-agent: PerplexityBot Disallow: /private-folder |
| 高 | ★Perplexity-User | Perplexity | Perplexity 用户触发的实时网页访问代理。 ⚠️ 用户触发型,通常忽略 robots.txt。 | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Perplexity-User/1.0; +https://perplexity.ai/perplexity-user) |
User-agent: Perplexity-User Disallow: /private-folder |
| 高 | ★CCBot | Common Crawl | Common Crawl 开源网页存档爬虫,是众多 AI 公司 LLM 预训练语料的上游数据源;屏蔽它等于退出大量模型的训练语料。 | CCBot/2.0 (https://commoncrawl.org/faq/) |
User-agent: CCBot Disallow: /private-folder |
| 高 | ★bingbot | Microsoft | 同时驱动 Bing 搜索与 Copilot AI 回答的基础爬虫,GEO 检测不可缺。 | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; bingbot/2.0; +http://www.bing.com/bingbot.htm) Chrome/116.0.1938.76 Safari/537.36 |
User-agent: bingbot Disallow: /private-folder |
| 高 | ★KimiBot | 月之暗面 Kimi | 月之暗面(Moonshot AI)模型训练数据抓取,遵守 robots.txt。 | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; KimiBot/1.0; +https://www.kimi.com/policies/kimi-crawlers |
User-agent: KimiBot Disallow: /private-folder |
| 高 | ★Kimi-SearchBot | 月之暗面 Kimi | Kimi AI 搜索索引抓取。 | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; Kimi-SearchBot/1.0; +https://www.kimi.com/policies/kimi-crawlers |
User-agent: Kimi-SearchBot Disallow: /private-folder |
| 高 | ★Kimi-User | 月之暗面 Kimi | 用户向 Kimi 提问需要实时检索时按需抓取。 ⚠️ 用户触发型,robots.txt 可能不直接适用。 | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; Kimi-User/1.0; +https://www.kimi.com/policies/kimi-crawlers |
User-agent: Kimi-User Disallow: /private-folder |
| 高 | ★DeepSeekBot 非官方 | DeepSeek | DeepSeek AI 内容抓取,具体用途未正式公开。 ⚠️ UA 为日志观测所得,官方尚无爬虫文档。 | Mozilla/5.0 (compatible; DeepSeekBot/1.0; +https://www.deepseek.com/bot) |
User-agent: DeepSeekBot Disallow: /private-folder |
| 高 | ★Bytespider 非官方 | 字节跳动 | 字节跳动 LLM(豆包等)训练数据抓取,实测抓取量大;豆包无独立 UA,Bytespider 即字节事实上的 AI 爬虫。 ⚠️ robots.txt 合规性存在争议。 | Mozilla/5.0 (Linux; Android 5.0) AppleWebKit/537.36 (KHTML, like Gecko) Mobile Safari/537.36 (compatible; Bytespider; spider-feedback@bytedance.com) |
User-agent: Bytespider Disallow: /private-folder |
| 高 | ★Baiduspider | 百度 | 百度搜索主爬虫,百度 AI 搜索与文心联网信息的基础数据来源(百度暂无独立"文心爬虫")。 | Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html) |
User-agent: Baiduspider Disallow: /private-folder |
| 中优先级 | |||||
| 中 | ★Gemini-Deep-Research | Gemini Deep Research 功能的资料收集 agent。 | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Gemini-Deep-Research; +https://gemini.google/overview/deep-research/) Chrome/135.0.0.0 Safari/537.36 |
User-agent: Gemini-Deep-Research Disallow: /private-folder |
|
| 中 | ★Google-CloudVertexBot | Vertex AI Agent Builder 访问代理(仅应站长请求抓取,不影响 Google 搜索)。 | Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/141.0.7390.122 Mobile Safari/537.36 (compatible; Google-CloudVertexBot; +https://cloud.google.com/enterprise-search) |
User-agent: Google-CloudVertexBot Disallow: /private-folder |
|
| 中 | ★meta-externalagent | Meta | Meta LLM(Llama 等)训练数据抓取与内容索引,实测抓取量大。 | meta-externalagent/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/crawler) |
User-agent: meta-externalagent Disallow: /private-folder |
| 中 | ★meta-externalfetcher | Meta | Meta AI 用户触发的实时网页抓取。 ⚠️ 用户触发型,可能绕过 robots.txt。 | meta-externalfetcher/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/crawler) |
User-agent: meta-externalfetcher Disallow: /private-folder |
| 中 | ★Meta-WebIndexer | Meta | 用于改进 Meta AI 搜索的索引爬虫。 | meta-webindexer/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/crawler) |
User-agent: meta-webindexer Disallow: /private-folder |
| 中 | ★Amazonbot | Amazon | Alexa 及 Amazon AI 训练数据抓取,实测抓取量大。 | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Amazonbot/0.1; +https://developer.amazon.com/support/amazonbot) Chrome/119.0.6045.214 Safari/537.36 |
User-agent: Amazonbot Disallow: /private-folder |
| 中 | ★Applebot | Apple | Apple 搜索 / Siri 索引爬虫,为 Apple Intelligence 提供实时上下文。 | Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/17.4 Safari/605.1.15 (Applebot/0.1; +http://www.apple.com/go/applebot) |
User-agent: Applebot Disallow: /private-folder |
| 中 | ★Applebot-Extended | Apple | 控制 Applebot 抓取内容能否用于 Apple 基础模型(Apple Intelligence)训练的 robots.txt token,不独立抓取。 ℹ️ Token 型,不发起独立 HTTP 请求,仅作 robots.txt 控制。 | Applebot-Extended |
User-agent: Applebot-Extended Disallow: /private-folder |
| 中 | ★QwenBot 非官方 | 阿里·通义千问 | 疑似通义千问内容抓取。 ⚠️ 阿里无正式爬虫文档,UA 为社区流传,未验证。 | Mozilla/5.0 (compatible; QwenBot/1.0; +https://tongyi.aliyun.com/bot) |
User-agent: QwenBot Disallow: /private-folder |
| 中 | ★ChatGLM-Spider 非官方 | 智谱AI | 智谱 AI 内容抓取,可能用于训练。 ⚠️ UA 为日志观测所得,官方未正式确认。 | Mozilla/5.0 (compatible; ChatGLM-Spider/1.0; +https://chatglm.cn/) |
User-agent: ChatGLM-Spider Disallow: /private-folder |
| 中 | ★MinimaxBot 非官方 | MiniMax | 可能用于 MiniMax 模型训练。 ⚠️ 第三方记录的实验性匹配,等待厂商确认。 | MinimaxBot |
User-agent: MinimaxBot Disallow: /private-folder |
| 中 | ★Minimax-User 非官方 | MiniMax | 可能为 MiniMax 用户触发抓取。 ⚠️ 第三方记录的实验性匹配,等待厂商确认。 | Minimax-User |
User-agent: Minimax-User Disallow: /private-folder |
| 中 | ★PetalBot 非官方 | 华为 | Petal Search 搜索索引爬虫,可能为华为搜索和 AI 产品提供公开网页索引基础。 | Mozilla/5.0 (compatible;PetalBot;+https://webmaster.petalsearch.com/site/petalbot) |
User-agent: PetalBot Disallow: /private-folder |
| 低优先级 | |||||
| 低 | MistralAI-User | Mistral AI | Mistral Le Chat 的实时引用抓取。 | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; MistralAI-User/1.0; +https://docs.mistral.ai/robots) |
User-agent: MistralAI-User Disallow: /private-folder |
| 低 | ★DuckAssistBot | DuckDuckGo | DuckDuckGo AI 回答(DuckAssist)抓取。 | DuckAssistBot/1.2; (+http://duckduckgo.com/duckassistbot.html) |
User-agent: DuckAssistBot Disallow: /private-folder |
不仅如此,还会分析抓取时的状态:
- HTTP 状态码(200、403、429 等)
- robots.txt 合规性检查
- Meta robots 标签分析(包括 noindex 检测)
- 响应时间和性能指标
操作步骤
输入 URL
在输入框中输入要检查的网站 URL(支持带或不带 http/https 前缀)。
开始检查
点击"免费检测"按钮,系统将模拟各种 AI Bot 访问该网站。
查看结果
查看详细的检查结果,包括访问状态、robots.txt 规则、Meta 标签等。
分析优化
分析结果,了解你的网站对 AI Bot 的访问策略是否按预期工作,针对性优化。
常见问答
为什么需要检查 AI 爬虫访问?
现代大型网站通常采用多层安全系统。即使 AI 爬虫在 robots.txt 中被明确允许,它们仍可能在其他级别被阻止,如 CDN 级别阻止、防火墙规则、频率限制系统等。这造成了预期政策与实际访问之间的差距。所以检查 AI 爬虫访问,可以全方位分析 AI 爬虫抓取是否正常。
检查结果中的状态码代表什么?
200 表示可访问,403 表示被阻止,429 表示频率限制,404 表示页面不存在。这些状态码帮助你了解 AI 爬虫访问你网站时的具体遭遇。
robots.txt 和 meta robots 标签有什么区别?
robots.txt 是网站根目录下的文件,用于指导所有爬虫的访问规则;meta robots 标签是 HTML 页面中的标签,用于控制特定页面的索引和爬取行为。两者都很重要,需要配合使用。
如何根据检查结果优化网站?
如果发现 AI 爬虫被意外阻止,可以检查 CDN 设置、防火墙规则、频率限制等;如果希望 AI 爬虫访问,确保 robots.txt 和 meta 标签设置正确;如果希望阻止,可以明确设置相应的阻止规则。
爬虫的优先级(高/中/低)是怎么划分的?
高:主流 AI 搜索、聊天产品、基础模型训练,或在国内外具有较高抓取量的爬虫(如 GPTBot、ClaudeBot、CCBot、Kimi、Bytespider),建议默认检测;中:具有明确用途或覆盖重要生态,但流量、影响力或资料完整度相对较低(如 Meta、Amazon、Apple 系爬虫);低:特定场景使用或补充覆盖(如 MistralAI-User、DuckAssistBot)。检测过程、结果展示和页面清单均按此优先级排序。
为什么 Google-Extended、Applebot-Extended 没有访问状态?
它们是 robots.txt 控制 token,不是真正发起 HTTP 请求的爬虫:Google-Extended 控制已抓取内容能否用于 Gemini / Vertex AI 训练,Applebot-Extended 控制 Applebot 抓取内容能否用于 Apple 基础模型训练。因此工具只检查 robots.txt 中是否存在对应规则,不做(也无法做)访问模拟。
哪些 AI 平台无法通过 User-Agent 检测?
以下平台不在 User-Agent 中标识自己,模拟 UA 的检测方式对它们无效,只能靠官方 IP 段识别:you.com、ChatGPT Operator(ChatGPT Agent 模式)、Bing Copilot chat、Grok(xAI 无公开爬虫 UA),以及各类 AI 浏览器(Perplexity Comet、ChatGPT Atlas 等,UA 与普通用户浏览器完全一致)。另外,MiniMax 官方尚未公布爬虫政策,工具内的 MinimaxBot / Minimax-User 为第三方记录的实验性匹配。
UA 检测结果完全可信吗?
有两点局限需要注意:① User-Agent 可以被伪造,仅凭 UA 无法确认请求一定来自对应厂商,如厂商提供官方 IP 清单,应结合 IP 或反向 DNS 验证;② 用户触发型抓取器(ChatGPT-User、Claude-User、Perplexity-User、Google-GeminiNotebook 等)可能忽略 robots.txt,即使 robots.txt 显示"禁止",实际仍可能被访问。本工具反映的是"以该 UA 访问时服务器的真实响应",适合排查 CDN / 防火墙误拦截等问题。
工具长期免费,背后每次调用都在消耗 AI Token。如果它帮到了你,欢迎请我喝杯咖啡 ☕
欢迎打赏,用于购买 Token ❤️
用支付宝或微信扫码即可,感谢你的支持!
遇到问题或有使用建议?
工具仍在持续迭代中,如果你在使用过程中碰到了问题,或者有功能改进的想法,欢迎直接联系我。
📬 alexkh#163.com (请将 # 替换为 @)