【工具】AI 爬虫抓取验证工具升级
AI 爬虫抓取验证工具本周进行了升级,主要有以下更新:
1. 完善了 AI 爬虫库,目前已覆盖 36 个主流 AI 爬虫
- 补充了国内的主流 AI 爬虫,如近期爆火的 Kimi,以及 Bytespider(字节跳动)、Baiduspider 等,这样做国内 GEO 也可以用了
- 补充了 Claude-SearchBot、Google-GeminiNotebook、bingbot 等国外爬虫
- 补充了通用爬虫 CCBot,它是众多大模型训练语料的上游数据源
2. 字段补充
- 加入了优先级字段(很重要):主流 AI 搜索/聊天产品、基础模型训练或高抓取量的 AI 爬虫,会标为高优先级
- 加入了中国 ★ 和美国 ★ 的地区标识(紧跟时事)

如上图,就是 GPTBot 被 Cloudflare 的提示页面屏蔽。所以非常建议做 GEO 的朋友,对每个主流页面都做一次 AI 爬虫抓取验证。
3. 新增下载和复制功能
本工具并非真实的 AI 爬虫在抓取,只是在模拟 AI 爬虫做检测,所以检测结果最好再确认一遍。因此提供了复制和下载功能,可以把结果直接交给开发同事,确认是否真的存在屏蔽,再进行优化动作。
再说一下 AI 爬虫抓取验证工具的地址:https://www.zhidaow.com/tools/ai-bot-crawl-checker/
【工具】结构化数据分析工具升级
本次更新主要是接入了一个新的官方数据源:Google 与 Schema.org 社区联合发布的 Schema.org 字段使用数据集。
现在,当你用本工具分析一个页面的结构化数据时,除了标记本身的检测结果,还可以看到每个 Schema 类型(Type)和属性(Property)在全球网络的实际采用热度,以及优先级状态。

背景:2026 年 6 月 4 日,Schema.org 官方博客宣布推出该数据集,目的是让开发者和站长更透明地了解各个类型(Type)和属性(Property)在全球范围内的真实使用情况,间接推动 Schema 数据的应用。首批数据来自 Google,Schema.org 官方同时邀请其他爬虫和索引方以同样的开放格式贡献数据。
数据以 CSV 和 JSON 格式托管在 Schema.org 官方 GitHub 仓库:https://github.com/schemaorg/schemaorg/tree/main/data/public_stats/google
我基于这次 Schema.org 公布的数据集,更新了结构化数据分析工具,有以下几个核心更新:
- 完善了 Schema.org 的字段,有了这个数据集,算是全球范围内最完整的检测了
- 数据源更新到了 6 月,昨晚刚更新
- 检测结果中增加了应用情况的统计,比如:全网 100 万–1000 万个域名在用
- 新增了几个实用标签:
- 优先级标签:必填、推荐、可选
- 应用场景标签:Google 富结果(Google 搜索结果有特殊展示形式)、GEO 高价值(对 AI 爬虫的识别有帮助)
- 检测结果按"已有、报错、推荐新增"3 个部分展示
- 同样提供了复制和下载功能,可以直接复制给开发同事或 AI 进行深入分析
- 数据源自动更新:工具内的热度数据将随官方数据集每月同步更新
最后再次展示工具地址:https://www.zhidaow.com/tools/structured-data-analysis/,欢迎免费使用!
评论
暂无评论,来写第一条吧 👇
写下你的评论