内容和 AI 之间的授权信号,现在能表达到哪一层
站点想在内容和 AI 之间表达授权范围,现在能表达到两层:一层是按路径的排除规则,告诉抓取器哪些地址不要来;另一层是按用途的授权声明,告诉对方「你拿这份内容去做什么」是可以的。前者已经存在很多年,后者是最近才成型的部分。已经出现的做法是把访问用途拆成搜索、代理、训练三类分别表态,甚至有 CDN 层给出按页面条件设默认值——展示广告的页面默认阻断训练与代理两类。
排除规则能说什么,说不了什么
排除规则的表达能力止于路径。它能说「后台目录不要抓」「某个临时页面不要抓」,但说不清同一件事的两面:一篇允许被抓取的文章,是否可以被拿去训练模型;一次为了回答用户问题而来的抓取,是否允许把整段原文留住。
这是设计上的限制,不是配置不够细。排除规则诞生时没有这类问题,它的语义里就没有「用途」这个维度。所以只看 robots 配置,站点对 AI 的表态其实是不完整的。
按用途拆分的三类访问
把访问按用途分开,是最近这一轮变化的核心:
| 用途 | 它在做什么 | 站点的常见诉求 | 能表达到哪一步 |
|---|---|---|---|
| 搜索 | 建索引,之后给用户返回链接 | 通常希望被爬到 | 路径级排除 + 用途声明允许 |
| 代理 | 替用户把内容取回并展示摘要 | 希望被引用,也希望带来源 | 用途声明,档位可细到是否允许展示全文 |
| 训练 | 把内容纳入模型参数 | 多数原创站不希望 | 用途声明直接拒绝 |
第三行是这一层信号真正的价值所在:过去想让训练器不要拿走内容,只能整站屏蔽,把搜索也一起挡了;按用途拆开后,才可能做到「允许被检索到,但拒绝被拿去训练」。
信号字段怎么写、由谁解析
写法上,用途声明是随 robots 文件一起下发的附加字段,示例形态是这样一行:允许搜索、拒绝训练、代理用途给到「可引用」这一档。上面那档划分说明授权不是开关而是程度——立刻展示、可以引用、可以完整使用,三种诉求本来就不一样。
要注意「由谁解析」这个现实问题:这类信号是建议性的,遵守取决于对方是否读取并按声明行动。它解决的是「站点的意愿有没有被明确表达」,不解决「表达之后一定会被执行」。所以别把它当成访问控制。
默认值切换会改变什么
平台方给默认值时,通常按页面特征来定,而不是按站点声明。已经发生的调整里,展示广告的页面会被默认阻断训练与代理用途。这意味着两件事:
- 你的流量构成要先自己看清楚。以广告变现为主的页面,默认阻断通常正合意图;以被引用获取回荐流量为主的页面,默认阻断就可能把引用一起挡掉。
- 默认变更前先确认自己站点的页面分布,再决定要不要覆盖。这一步不该在变更之后补。
站内两处配置怎么配合
站内负责这件事的是两处。robots 配置负责排除规则与附加声明的下发,位置在系统设置里,改完之后要确认对外可见的那份文件确实更新了内容。第二处是面向大模型的说明文件:AnQiCMS 支持自动生成站点说明,把站点的主题、关键页面和摘要以模型易读的形式给出去,这属于 GEO 的范围。
两处分工不要混:说明文件解决「模型能不能理解我的站点」,robots 与用途声明解决「允许它做什么」。前者是内容可见性,后者是授权边界。再叠加链接推送这类主动通知能力,才是完整的一层:告诉引擎有什么、以及可以怎么用。
常见问题
问:只写 robots 排除规则算不算完成表态? 答:不算。排除规则只覆盖路径,不覆盖用途。同一页面「可被搜索、不可被训练」这种诉求,需要按用途的声明才能表达。
问:站点说明文件和 robots 文件要放同一个位置吗? 答:都是站点根路径下的公开文件,但作用不同,各自独立生成与维护,不需要相互引用。
问:这些信号会被所有引擎遵守吗? 答:不会保证。信号的定位是明确意愿,执行取决于对方解析;对需要硬拦住的路径,仍然要在服务器上配置拒绝规则。