GEO

SEO/GEO 工具更新 20260722:新增 Kimi、CCBot 等主流 AI 爬虫检测、结构化数据新增全网数据集

更新:AI爬虫验证工具扩展至36种(含Kimi、CCBot),新增优先级与国别标识、复制/下载功能;结构化数据分析接入Google/Schema.org使用数据集,显示字段采纳热度、优先级与场景标签,支持自动同步与导出。

【工具】AI 爬虫抓取验证工具升级

地址:https://www.zhidaow.com/tools/ai-bot-crawl-checker/

AI 爬虫抓取验证工具本周进行了升级,主要有以下更新:

1. 完善了 AI 爬虫库,目前已覆盖 36 个主流 AI 爬虫

  • 补充了国内的主流 AI 爬虫,如近期爆火的 Kimi,以及 Bytespider(字节跳动)、Baiduspider 等,这样做国内 GEO 也可以用了
  • 补充了 Claude-SearchBot、Google-GeminiNotebook、bingbot 等国外爬虫
  • 补充了通用爬虫 CCBot,它是众多大模型训练语料的上游数据源

2. 字段补充

  • 加入了优先级字段(很重要):主流 AI 搜索/聊天产品、基础模型训练或高抓取量的 AI 爬虫,会标为高优先级
  • 加入了中国 ★ 和美国 ★ 的地区标识(紧跟时事)

GPTBot 被 Cloudflare 的提示页面屏蔽

如上图,就是 GPTBot 被 Cloudflare 的提示页面屏蔽。所以非常建议做 GEO 的朋友,对每个主流页面都做一次 AI 爬虫抓取验证。

3. 新增下载和复制功能

本工具并非真实的 AI 爬虫在抓取,只是在模拟 AI 爬虫做检测,所以检测结果最好再确认一遍。因此提供了复制和下载功能,可以把结果直接交给开发同事,确认是否真的存在屏蔽,再进行优化动作。

再说一下 AI 爬虫抓取验证工具的地址:https://www.zhidaow.com/tools/ai-bot-crawl-checker/

【工具】结构化数据分析工具升级

地址:https://www.zhidaow.com/tools/structured-data-analysis/

本次更新主要是接入了一个新的官方数据源:Google 与 Schema.org 社区联合发布的 Schema.org 字段使用数据集

现在,当你用本工具分析一个页面的结构化数据时,除了标记本身的检测结果,还可以看到每个 Schema 类型(Type)和属性(Property)在全球网络的实际采用热度,以及优先级状态

某页面的检测结果示例

背景:2026 年 6 月 4 日,Schema.org 官方博客宣布推出该数据集,目的是让开发者和站长更透明地了解各个类型(Type)和属性(Property)在全球范围内的真实使用情况,间接推动 Schema 数据的应用。首批数据来自 Google,Schema.org 官方同时邀请其他爬虫和索引方以同样的开放格式贡献数据。

数据以 CSV 和 JSON 格式托管在 Schema.org 官方 GitHub 仓库:https://github.com/schemaorg/schemaorg/tree/main/data/public_stats/google

我基于这次 Schema.org 公布的数据集,更新了结构化数据分析工具,有以下几个核心更新:

  • 完善了 Schema.org 的字段,有了这个数据集,算是全球范围内最完整的检测了
  • 数据源更新到了 6 月,昨晚刚更新
  • 检测结果中增加了应用情况的统计,比如:全网 100 万–1000 万个域名在用
  • 新增了几个实用标签
    • 优先级标签:必填、推荐、可选
    • 应用场景标签:Google 富结果(Google 搜索结果有特殊展示形式)、GEO 高价值(对 AI 爬虫的识别有帮助)
  • 检测结果按"已有、报错、推荐新增"3 个部分展示
  • 同样提供了复制和下载功能,可以直接复制给开发同事或 AI 进行深入分析
  • 数据源自动更新:工具内的热度数据将随官方数据集每月同步更新

最后再次展示工具地址:https://www.zhidaow.com/tools/structured-data-analysis/,欢迎免费使用!

评论

暂无评论,来写第一条吧 👇

写下你的评论

邮箱仅用于识别身份,不会公开显示