AI爬虫抓取量远大于回荐流量,这组对比对内容站意味着什么
这组对比量的是消耗与返还之间的落差:分子是抓取器发出的请求数,分母是带着来源链接回到站内的会话数。比值高说明内容被大量读取却很少被送回,比值低说明抓取与回荐大致同步。Cloudflare Radar 在 2025 年 6 月 19 日至 26 日的监测里给出过一组差异极大的数据,各 AI 模型的爬取与回荐比率从 Anthropic 的 70900:1 到 Mistral 的 0.1:1 不等。对内容站来说,这条数据的意义不在于该不该屏蔽爬虫,而在于不要把抓取量当成可见度的代理指标。
这组比例到底在量什么
抓取请求与回荐会话不是同一个分母。一次问答可能在后台触发对多个页面的读取,但最终只生成一条回答,甚至不附来源链接;反过来,一次回荐会话也可能来自并没有抓取本页面的历史索引。因此比值高有两种完全不同的解释:一是模型把内容当作素材消耗掉而不回报,二是抓取器在遍历站点做索引或训练语料收集,本来就不产生即时访问。
报告里另一组数字更适合对照看:同一时间窗内 Google 的回荐流量下降 19.4%,而 DuckDuckGo 与 Yandex 出现超过 6% 的增长。模型持续消费更多内容,送到内容源的流量却没有同步跟上,这才是内容方需要处理的核心矛盾。
为什么抓取多不等于回流多
三个机制决定了两者不成正比。
第一,引用与不引用是生成阶段的决定,不是抓取阶段的决定。抓取器读到了内容,只保证它进入候选,不保证它出现在答案里。
第二,读取深度与回答长度反向相关。答案越短,被引用的来源越少,抓取却可能覆盖更多页面来保证准确。
第三,回荐路径本身在变。带链接的引用只是回流的一种形式,答案里提到品牌但不给链接时,站内日志只能看到搜索量变化,看不到来源。
| 观察指标 | 它在量什么 | 不能说明什么 |
|---|---|---|
| 抓取请求数 | 内容被读取的强度 | 内容是否被引用 |
| 带链接回荐会话 | 引用转化为访问的量 | 品牌是否被提及 |
| 品牌词搜索量 | 提及带来的后续动作 | 抓取与引用是否发生 |
| 页面收录量 | 传统检索的可见面 | AI 问答里的可见面 |
内容站可核对的三件事
第一件,把抓取日志按抓取器标识分开。把所有 AI 类抓取器混在一起统计,得出的是一个没有决策价值的总量;分开之后才能看出哪一家在读、读哪些目录、读了有没有回报。
第二件,检查回答单元的组织方式。能不能被单独引用,取决于段落是否自包含:一个小标题对应一个问题,一段话能脱离上下文被复述。整页只有一个长段落的内容即便被抓取,也很难成为引用对象。
第三件,核对站内事实入口是否完整。联系方式、覆盖范围、价格政策这类信息如果只存在于图片里,抓取器读不到,答案也就没有可引用的对象。
抓取授权与引用可见性是两件事
这两件事常被合并处理,实际是两条独立的控制。
抓取授权解决「允许谁来读」。robots 文件里的规则按产品标识匹配,写成一条通配就等于对所有抓取器一视同仁,而不同厂商的抓取器用途差别很大,同一份规则会一刀切掉本不该切掉的对象。
引用可见性解决「读了之后是否被引用」。AnQiCMS 支持自动生成站点的 LLMs.txt,用来帮助大语言模型理解和索引网站内容,它属于面向模型侧的内容说明入口;这与 robots 的抓取授权分工不同,前者是介绍站有什么,后者是允许谁来访问。站内还有链接推送与站点地图负责被发现,三者不要混为一谈。
顺序上建议这样处理:先按厂商用途决定放开与限制,再优化可引用单元,最后用带链接回荐与品牌搜索量做验证。只放开抓取而不改内容组织方式,看到的通常只有请求数上涨。
常见问题
比值高是不是就该屏蔽? 不一定。要区分它是在做索引还是在做语料收集:前者与可见度有关,后者与站内收益关系较弱,处理策略不同。
回荐少能不能归因到内容质量? 单一时间窗不能。需要同时看引用率、页面覆盖范围与品牌搜索量三条一起判断。
改了内容组织方式多久见效? 通常要在下一轮抓取之后才可观察,按周而不是按天判断变化更合理。