AI抓取开始按次付费,返回402之后报价由哪一层来定

📅 2026-10-11 👁️ 0

有一类新做法是让 AI 爬虫为抓取内容按次付费,进不来时返回一个 402 状态码。关键问题是:报价和放行这件事,到底配在哪一层。把这条链路拆开看,落点其实在网络代理层,而不是网站程序层。站端要先把「愿不愿意放行」和「怎么报价」分开——排除文件表达的是抓取意愿,付费放行执行的是交易,二者管的不是同一件事。

402是谁发出来的

402 Payment Required 这个状态码,不是网页代码在渲染内容时返回的,而是挡在站点前面的那层访问控制在请求还没进到内容之前发出的。提出按次付费这套机制的平台,把它做在代理层:站点为不同区域设定每次抓取的单价,AI 爬虫带着有效支付凭据来才放行取内容,缺少有效凭据的请求就收到一个带报价的 402 响应。也就是说,决定「给不给、按多少钱给」的动作发生在请求进入应用之前,程序本身甚至还不知道有没有这个爬虫来过。

报价配在哪一层

既然放行判定在代理层,报价也就配在这一层,而不是写进网站的某个开关里。这带来两个现实含义。其一,它作用于「谁用什么身份来取」,是在访问通道上设的闸门,和页面内容长什么样无关。其二,同一套内容,对浏览器访客、对普通搜索引擎、对按次付费的 AI 爬虫,可以走不同的放行与计价规则,因为判定发生在统一的入口层。目前这类按次付费能力仍处于内测阶段,规则还在演化,站点在接入时要把它当成「入口层的访问与计费策略」来理解,而不是「内容发布设置」。

与排除文件的分工

这里最容易混的是 robots 规则和付费放行。Robots 配置表达的是「希不希望被抓取」的意愿声明,是站点对外宣告的抓取偏好,属于意愿层。付费放行是另一层:它执行的是「你来取要不要先付钱」的交易判定。两者对象不同——排除文件谈的是抓不抓,付费层谈的是放行要不要计费;层级也不同——一个更像给爬虫看的声明,一个是在入口实际拦一道的闸门。一个站完全可以同时用 robots 表达整体抓取偏好,又在更外层对特定 AI 抓取设付费门槛,因为它们本就不冲突。

站端先要定的是什么

在考虑报价之前,站端要先把「对模型侧的态度」定清楚,而这恰恰是 CMS 层能直接落的两件事。一是让内容对大模型可读:AnQiCMS 支持自动生成站点 LLMs.txt,便于大语言模型理解和索引站点内容,这解决的是「愿不愿意被模型读懂」的正向一侧。二是把抓取意愿配置清楚:robots 配置让站点能声明希望或不希望被抓取的范围。先有这两层表态,再去外层谈要不要对 AI 抓取收费,顺序才顺——先定身份和意愿,后定交易。

常见问题

问:402 是网站程序返回的吗? 答:不是,是挡在站点前的访问控制在请求进入内容之前发出的。

问:报价配置算不算 CMS 里的功能? 答:这套按次付费落在网络代理层,和站点内容发布设置不在同一层。

问:有了 robots 还要不要管付费放行? 答:robots 表达抓取意愿,付费层执行放行与计费,二者管的事不同。

相关文章

被抓到和被引用不是一回事,决定先被引到的两项因素是什么

一项在多模型上跑的对照实验发现,决定一个来源被模型优先引用的两项主要因素是主题相关性与列表位置;明确的价格信息和较新的时间戳也有一致帮助。落到站内,能否给出这两项,取决于关键词库能否把主题对齐、时间因子能否让内容带着可信的更新时间。

2026-10-11

实验报告写的可见度提升四成,做生成式优化时该怎么读这个数

提出 GEO 的论文里那个「提升可达四成」的数,是在自建的大规模基准 GEO-bench、特定实验设置下测得的上限,作者同时指出各策略的效果随领域不同而差别明显。读这类结论要看域差异与实验设置,而不是当成承诺值;站端能稳定做的是收录、站点说明和后台能力清单覆盖这些可控项。

2026-10-11

生成式引擎引用的来源里混进了AI生成的内容,站点怎么自证是原始出处

一份对四家生成式搜索的审计发现,被引来源里有一部分是 AI 生成内容。内容站要让自己被当成原始出处,站端能配合的是两段:一是来源可辨识,让模型读得懂站点在讲什么、内容从哪来;二是站内留质量证据,用敏感词过滤与内容审核保证发出的内容本身干净可核。

2026-10-11

插件生态越大暴露面越宽,主机端能收的三道在哪

面对 WordPress 这类插件众多建站系统爆出的高危远程代码执行告警,主机端能收的三道是升级窗口、能力暴露面与登录凭证。升级窗口要和备份恢复配合,全站级操作默认关闭按需开启,凭证轮换与改密码一起排。

2026-10-11

同类系统把模型可读清单做成按栏目实时生成,配置该放哪一处

有同类 CMS 在版本记录里新增了面向大模型的站点清单,并按栏目和内容实时生成、配套后台配置。清单由静态模板拼出,还是随栏目与内容实时生成,差别在于内容模型能给出多少结构化信息。自定义字段决定清单可列举的内容,配置宜收在后台的站点说明这一处,而非散在模板里。

2026-10-11

站内跳转加了参数或换了语言版本,来源信息带出去多少由什么决定

按协议,来源信息带出去多少由引用策略决定,缺省是严格同源跨域策略:同源请求带完整路径与查询串,跨源且安全级别不变时只带源,降级到更不安全目的地时干脆不带。落到站内,多语言版本切换与伪静态改写后的路径,会改变统计里来源信息如何归并,口径要提前对齐。

2026-10-11

站点维护期返回503并写明恢复时间,抓取方会怎么处理

维护或过载时返回503并给出恢复时间,抓取方按临时不可用处理,通常保留原有收录并稍后重试。风险点在于把这类响应缓存下来,修复上线后访客仍读到旧错误页。本文说明状态码语义、恢复时间该由哪一层给出,以及站点地图与跳转表要连带核对的三处。

2026-10-11

装内容系统前先核对数据库和脚本语言版本,兼容下限写着停止维护意味着什么

安装内容系统前要分两件事核对:官方推荐的运行版本,和写着「也能用」的兼容下限。WordPress 的官方要求页推荐较新的脚本语言与数据库版本,同时说明旧版本已进入停止维护阶段、可能带来安全风险。本文讲按哪一档配、下限命中停止维护时风险落在哪,并对比少一层运行时的部署差别。

2026-10-11