AI 抓取开始按次收费之后,内容站要先确认哪几件事
AI 抓取开始按次收费之后,内容站要先确认哪几件事?按已经公开的机制文档,三件事的顺序是:先确认排除规则表达得准不准,再确认给大模型的站点说明文件写了什么,最后确认防采集措施与授权意图有没有互相打脸。这一能力目前仍在封闭内测,机制清晰但覆盖面有限。
按次收费的抓取控制做到哪一步
机制文档给出的要点是:站点所有者可以控制并对 AI 爬虫访问内容收费(Pay Per Crawl),自动访问如果没有提供对应的支付凭证,收到的是需要付费的响应码 HTTP 402 Payment Required;文档同时写明这一功能当前处于封闭内测(closed beta)。也就是说,「按次收费」现在还是一套正在被接入的机制,不是所有模型抓取都会走这条路径。
控制粒度落在域名还是目录
配置层级决定了站群的工作量。文档给出的方式是按 zone 设定价格,也就是在域名所属的区域层级上配置,而不是对某个目录或某一类内容单独定价。这一点对多站点运营影响直接:同一套程序管若干个站、每个站有独立域名时,定价与授权是逐个 zone 的判断;把分站放在同一域名下的子目录里时,则无法只对其中的一个分站单独设定。
| 站点组织方式 | 授权能否分别表达 | 需要额外确认的点 |
|---|---|---|
| 每个分站独立域名 | 可以按域名分别设定 | 各域名的排除规则是否分别维护 |
| 分站放子目录 | 与主站共用一套设定 | 子目录内容是否本就要一并授权 |
| 多语言站点分语种域名 | 逐域名确认 | 译文与原文是否视为同一份内容 |
| 只有主站 | 一次决定 | 说明文件与排除规则是否一致 |
排除规则与说明文件的分工
按次收费的判定发生在抓取环节,而站点对外表达意图仍然靠两处。一是 Robots.txt 配置,负责划定哪些路径不希望被抓取;二是自动生成的 llms.txt,负责向大语言模型说明站点结构与可读内容。两处承担的作用不同,不能互相替代:排除文件不解释内容组织,说明文件也不具备拦截能力。内容站在这一层要做的是让两者说法一致,避免出现「文件里没禁止、说明里却声明不接受抓取」这类自相矛盾。
防采集和授权不要互相矛盾
另一处容易被忽略的是站内已有的防采集措施。防采集干扰码的作用是抬高批量采集的代价,它针对的是把内容整段搬走的采集行为;而模型抓取与授权讨论的是「是否允许被读取用于回答」。两者对象不同,但落在同一批请求上:如果干扰码把合法的大模型读取也一并干扰掉,站点一边宣称愿意被引用、一边让读者取到残缺内容,判断依据就消失了。开启这项能力时,应逐类访客确认作用范围。
站群要按域逐个确认
链接推送与主动推送解决的是「有新内容请来取」,按次收费与授权解决的是「取走要不要付出对价」,两组机制在同一批抓取上并行。站群在确认时至少要按域逐项检查:推送通道是否按站点分别配置、排除规则是否分别维护、说明文件是否各站一份。共用一套配置的代价是,某个分站不希望被读取时无法单独表达。
常见问题
问:封闭内测阶段有没有必要提前配置? 答:可以先做两件与是否开通无关的事:统一排除规则与说明文件的表述,以及给每个域留出一份当前配置记录。等机制开放时,这两项是直接使用的前提。
问:按次收费会不会影响搜索引擎收录? 答:这是两条独立路径。收录依赖的是清单提交与链接推送,按次收费针对的是模型侧的自动访问,不要为了后者改动前者配置。
问:内容站怎么判断自己被哪些模型抓取? 答:靠抓取记录与访客标识分组,而不是靠猜测。判断依据不足时,先不要修改授权表述。