每三个网站就有一个会不小心挡住给 ChatGPT 和 Perplexity 供数据的爬虫。这款 AI 爬虫检测工具会读取你的 robots.txt、meta robots 和响应头,精确告诉你 15 个 AI 爬虫里哪些能看到你的页面。
首页或深层页面都行——工具会针对你给的确切路径评估,因为 robots 规则因路径而异。
15 个 AI 爬虫的 robots.txt 规则、meta robots 标签、X-Robots-Tag 响应头、llms.txt 是否存在、站点地图声明——一次跑完完整的抓取检测。
一张按爬虫列出的允许/拦截表格,每条都附上负责该结果的确切 robots.txt 规则,几分钟就能查清并修好网站的抓取可访问性。
GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot、Google-Extended、Bytespider、CCBot 等等——所有对 AI 可见度重要的爬虫。
CDN 预设和老旧的 robots.txt 模板会悄悄挡住 AI。如果你曾问过"ChatGPT 能抓到我的站点吗",这里给你答案。
robots.txt 只是第一层。我们还在页面层面检测抓取可访问性:meta robots 和 X-Robots-Tag 的 noindex 指令。
每一条判定都注明是哪一行 Allow/Disallow 造成的——不用在你那 40 条 robots 规则里猜是哪条生效。
同一次检测会确认你的 llms.txt 能正常解析、站点地图已声明——这正是 AI 用来了解你的两个文件。
能被读到只是第一步,被推荐才是目标。把这次审计和一次 Kairosy 免费品牌扫描搭配着做。
AI 爬虫是什么?它是 AI 公司派来读取公开网页的机器人:OpenAI 的 GPTBot 采集训练数据、OAI-SearchBot 驱动 ChatGPT 搜索、ClaudeBot 给 Anthropic 的模型供数据、PerplexityBot 构建 Perplexity 的索引。当买家向这些助手求推荐时,助手只能谈论它们的爬虫读得到的站点。挡住它们,就是靠配置把自己变隐形——所以在操心内容之前,你更该先检查页面能不能被抓取。
要自己检查网站的抓取可访问性,得为每个爬虫的 User-agent 分组读 robots.txt,再检查页面的 meta robots 和 X-Robots-Tag 响应头——或者跑一次本工具,五秒拿到全部结果。而且问一次"我的站点能被抓吗"还不够:主题、插件和 CDN 规则会悄悄改动 robots 文件,所以每月做一次 AI 抓取可访问性审计(每次迁移后再快速复测),才是保持可见的好习惯。
“我们的 WAF 模板挡了 GPTBot 整整一年。第一次跑就发现了,当天就修好了。”
“每接一个新客户我都用它测抓取可访问性。半数客户在自己不知情的情况下至少挡着一个 AI 爬虫。”
“规则级解释太宝贵了——它精确告诉我哪条 Disallow 命中了 Bytespider、又放行了其他的。”
“简单、诚实、快。三层检查(robots、meta、响应头)逮到了我们 CDN 注入的一个 noindex 头。”
AI 公司用来读取公开网页的机器人,好让它们的助手了解——并推荐——网页上的内容。
通常能:没有 robots.txt 意味着没有限制,爬虫会默认所有公开内容都可抓。但你仍可能被 meta robots 标签、X-Robots-Tag 响应头或防火墙挡住——这正是本工具会检查的。
对该页面网址跑一次工具,在结果表里找到那个爬虫。判定会注明生效的 robots.txt 规则,所以你能查到 GPTBot 能抓、而 Bytespider 被挡这种情况。
有些发布方会屏蔽训练类爬虫(GPTBot、CCBot)但放行搜索类爬虫(OAI-SearchBot、PerplexityBot)以保持可被引用。这是一种合理策略——关键是主动选择,而不是从模板里继承来的。
能抓意味着可读,不等于被推荐。跑一次 Kairosy 免费扫描,看看 ChatGPT、Gemini、Claude、Perplexity 到底怎么向买家介绍你,以及如果答案扎心该修什么。
Kairosy 向 ChatGPT、Gemini、Claude 和 Perplexity 提出买家真实会问的问题,并展示它们是推荐你、忽略你,还是把买家引向竞品。
运行免费 AI 品牌扫描