AI 爬虫是单独放行还是统一拒绝,判断依据该看哪几项
面对 AI 类爬虫,站点要单独放行还是统一拒绝,判断依据不是爬虫名称,而是三个问题:它抓去做什么、被抓之后站点能不能被认成来源、这份曝露能不能换回什么。这三项定了,配置只是把它翻译成规则。
先分清抓取意图
同一类爬虫的用途差别很大。为检索型答案做索引的抓取,会把站点当作来源并带回访问;做模型训练的抓取不承诺任何回报,也不会把站点带回来;还有一些是代理用户实时取页,属于临时读取。三类混在一个名称下统一处理,容易做错决定。
判断方法要看请求行为而不是自我声明:同一名称的爬虫是否带不同标识轮换、访问频次与页面类型分布是否集中在某个栏目,比名称字符串更能说明意图。
排除文件只表达意愿
需要先明确一条边界:robots.txt 写的是协议约定的四类记录,其余额外条目属于抓取方可以自行解释的范围。协议原文的表述是抓取方可以解释不属于该协议的其他记录。也就是说,在 robots 文件里加一条非标准条目写拒绝,对不遵守的抓取方没有强制力。
因此「在排除文件里加一条就挡住了」这个前提并不成立。它是意愿声明,配合站点说明文件与站内防护才构成完整策略。
放行与拒绝各自的代价
| 做法 | 换来什么 | 付出什么 | 适合的场景 |
|---|---|---|---|
| 单独放行检索类抓取 | 有机会成为被引来源并带回访问 | 站点结构被完整读取 | 内容原创、希望被引用 |
| 统一拒绝全部 AI 抓取 | 曝光面最小 | 同时失去索引带来的可见度 | 内容依赖授权或含隐私数据 |
| 分栏目差异化处理 | 保住核心内容,放开说明性页面 | 配置复杂度高,需定期核对 | 站型混合的站点 |
代价的不对称来自一点:拒绝的成本是放弃收益,放行的成本是承担不确定性。
两处配置的分工
一层管可见范围,一层管被理解的程度。前者是 robots 文件按分组与路径划出允许与拒绝的边界;后者是面向大语言模型的站点说明文件 llms.txt,它把站点栏目与关键内容组织成模型易读的形式,解决 GEO 场景下的来源辨识问题。这两处的作用对象不同,不能用其中一个替代另一个。
站内的干扰码针对的又是第三件事:内容被批量搬运。抓取与搬运不是一回事,被索引不等于被抄走,因此拒绝训练类抓取并不能解决搬运,防采集这一层要单独配。
定不下时的中间做法
判断不清时,不要在全站层面做一刀切。可行的顺序是:先按栏目定授权边界,把不涉及核心的介绍页放开,把原创主体单独处理;同时保持站点说明文件与栏目结构同步,让来源可辨识;一段时间后按实际访问回补判断——是否有引用与回访,是否出现整站被搬走的情况。用观察结果反过来修正边界,比一开始就定终局更稳。
常见问题
问:只按爬虫名拦得住吗? 拦不住。名称可以伪造,要配合请求行为与直连地址判断。
问:放开检索类抓取会不会顺手被训练? 两种用途在同一个抓取行为下难以完全区分,这也是需要按栏目而不是全站定边界的原因。
问:排除文件加了额外条目有用吗? 对遵守协议的抓取方有表达作用,对不遵守的没有强制力,不能当成技术屏障。