内容和 AI 之间的授权信号,现在能表达到哪一层

📅 2026-10-09 👁️ 0

站点想在内容和 AI 之间表达授权范围,现在能表达到两层:一层是按路径的排除规则,告诉抓取器哪些地址不要来;另一层是按用途的授权声明,告诉对方「你拿这份内容去做什么」是可以的。前者已经存在很多年,后者是最近才成型的部分。已经出现的做法是把访问用途拆成搜索、代理、训练三类分别表态,甚至有 CDN 层给出按页面条件设默认值——展示广告的页面默认阻断训练与代理两类。

排除规则能说什么,说不了什么

排除规则的表达能力止于路径。它能说「后台目录不要抓」「某个临时页面不要抓」,但说不清同一件事的两面:一篇允许被抓取的文章,是否可以被拿去训练模型;一次为了回答用户问题而来的抓取,是否允许把整段原文留住。

这是设计上的限制,不是配置不够细。排除规则诞生时没有这类问题,它的语义里就没有「用途」这个维度。所以只看 robots 配置,站点对 AI 的表态其实是不完整的。

按用途拆分的三类访问

把访问按用途分开,是最近这一轮变化的核心:

用途 它在做什么 站点的常见诉求 能表达到哪一步
搜索 建索引,之后给用户返回链接 通常希望被爬到 路径级排除 + 用途声明允许
代理 替用户把内容取回并展示摘要 希望被引用,也希望带来源 用途声明,档位可细到是否允许展示全文
训练 把内容纳入模型参数 多数原创站不希望 用途声明直接拒绝

第三行是这一层信号真正的价值所在:过去想让训练器不要拿走内容,只能整站屏蔽,把搜索也一起挡了;按用途拆开后,才可能做到「允许被检索到,但拒绝被拿去训练」。

信号字段怎么写、由谁解析

写法上,用途声明是随 robots 文件一起下发的附加字段,示例形态是这样一行:允许搜索、拒绝训练、代理用途给到「可引用」这一档。上面那档划分说明授权不是开关而是程度——立刻展示、可以引用、可以完整使用,三种诉求本来就不一样。

要注意「由谁解析」这个现实问题:这类信号是建议性的,遵守取决于对方是否读取并按声明行动。它解决的是「站点的意愿有没有被明确表达」,不解决「表达之后一定会被执行」。所以别把它当成访问控制。

默认值切换会改变什么

平台方给默认值时,通常按页面特征来定,而不是按站点声明。已经发生的调整里,展示广告的页面会被默认阻断训练与代理用途。这意味着两件事:

  • 你的流量构成要先自己看清楚。以广告变现为主的页面,默认阻断通常正合意图;以被引用获取回荐流量为主的页面,默认阻断就可能把引用一起挡掉。
  • 默认变更前先确认自己站点的页面分布,再决定要不要覆盖。这一步不该在变更之后补。

站内两处配置怎么配合

站内负责这件事的是两处。robots 配置负责排除规则与附加声明的下发,位置在系统设置里,改完之后要确认对外可见的那份文件确实更新了内容。第二处是面向大模型的说明文件:AnQiCMS 支持自动生成站点说明,把站点的主题、关键页面和摘要以模型易读的形式给出去,这属于 GEO 的范围。

两处分工不要混:说明文件解决「模型能不能理解我的站点」,robots 与用途声明解决「允许它做什么」。前者是内容可见性,后者是授权边界。再叠加链接推送这类主动通知能力,才是完整的一层:告诉引擎有什么、以及可以怎么用。

常见问题

问:只写 robots 排除规则算不算完成表态? 答:不算。排除规则只覆盖路径,不覆盖用途。同一页面「可被搜索、不可被训练」这种诉求,需要按用途的声明才能表达。

问:站点说明文件和 robots 文件要放同一个位置吗? 答:都是站点根路径下的公开文件,但作用不同,各自独立生成与维护,不需要相互引用。

问:这些信号会被所有引擎遵守吗? 答:不会保证。信号的定位是明确意愿,执行取决于对方解析;对需要硬拦住的路径,仍然要在服务器上配置拒绝规则。

相关文章

站点目录里的数据文件会被直接下载吗,部署时该挡在哪一层

站点目录里的数据库文件、备份产物和日志如果落在公网可访问的路径上,确实可能被直接下载,因为 Web 服务器默认会把能匹配到文件的请求当静态内容返回。拦截要分两层:部署层给数据目录加拒绝规则,程序层保证备份和临时文件不生成在可访问路径里,两者都做完再按清单复核一遍默认端口的暴露面。

2026-10-09

后台的删除和状态切换接口,能不能用浏览器直接访问触发

后台里删除数据、切换状态的接口如果允许浏览器直接用地址访问触发,就有了被跨站请求伪造借用的风险:访客在登录态仍在的时候点开一个恶意链接,改状态的动作就会被执行。收口的做法是两条一起用——改状态的动作限定为提交方法,并附一次性的表单校验;长期登录凭证要比一次性票据设更严的使用边界。

2026-10-09

批量提交链接给搜索引擎时,一次能发多少条、隔多久能重发

批量向搜索引擎提交链接时,跨引擎的提交通道允许在单个请求里带上上万个地址,站点地图则按单文件上限拆分;同一链接频繁更新时应留出最小重发间隔,通常以分钟为单位排队列。提交前先确认域名归属校验通过,密钥或验证文件放在站点根目录或同一主机上可公开访问的位置,否则整批发出去也不会被采信。

2026-10-09

同样是 9 分的两个漏洞,为什么处置顺序不一样

两个评分相同的高危漏洞,处置顺序不同是因为分数由指标组合算出,同样的分值可以对应完全不同的触发门槛与影响范围。读评级要看分数怎么来、需要不需要登录、影响的是机密性还是可用性,再结合自家是否在用它决定的顺序。

2026-10-09

一天里二十多条模块级公告同时发布,处置顺序该按什么排

一天里同时发布二十多条模块级安全公告时,处置顺序不能只按评级排。可用的排法是评级乘以「这个模块我到底装没装」:未安装的可以直接结案,装了的再看暴露面是公网页面还是后台内部页,然后才是评级高低和是否已有可用补丁。全站级操作接口默认关闭,能让需要显式开启的能力天然不在当天的可被打面里。

2026-10-09

远程抓图接口为什么会被用来探测内网,导入图片时该挡什么

按地址抓取远程图片的功能,本质上是程序替发起人去访问一个地址,如果目标地址不加约束,就可以指向内网服务,这就是服务端请求伪造的成因。加固要按四道限制来做:连接超时、响应大小上限、解析后的地址校验与内网地址拦截、跟随跳转后的再校验;批量导入和内容采集这两条链路共用同一套取值边界才有效。

2026-10-09

标题、关键词、描述这三项该由谁写,手写和自动生成怎么配合

标题、关键词、描述这三项的自动化风险不同:标题建议人工定稿、系统给候选;关键词适合半自动再归一到关键词库;描述可以先自动生成再由人工核对口径,因为它会被搜索引擎独立展示。常见分工是系统出初稿、人管事实与口径,自动生成结果先进草稿或待发布状态,验收后再对外。

2026-10-09

找回密码的验证码,强度和错误锁定该怎么配

找回密码验证码、登录验证码和表单防机器人验证码要配的不是同一件事:找回类要的是随机来源足够、有效期短、错误次数锁定绑定同一入口;表单类要的是挡住批量提交,可交给 reCAPTCHA 这类交互验证。同行 CMS 在近版本更新里也按这个方向加固,把验证码改为 6 位安全随机生成并补上过期时间与错误次数锁定。

2026-10-09