有审计发现 AI 回答里的被引来源约一成多是模型自生成的,内容站该怎么看这个数

📅 2026-10-11 👁️ 0

有审计发现 AI 回答里的被引来源约一成多是模型自生成的,这个数来自 arXiv 2605.23684 对四个生成式搜索引擎的审计:在全部四个引擎中都观察到 AI 生成的来源被引用,约占被引来源的 16%,论文把这类来源称为合成来源。看这个数要先确认它的口径,它统计的是被引清单里有什么,不是这些内容对不对,也不是原创来源的份额下降了多少。

合成来源指什么

这里的合成来源不是「模型给出的答案」,而是被当成引用对象列出来的来源:一条机器生成、并不指向某个真实发布者意图的内容,出现在了答案的引用清单里。可能的情形包括自动生成的聚合页、批量产出的模板化文章,以及被采集后再加工一遍的页面。

它之所以值得注意,是因为引用清单承担的是「可回溯」的职能。用户点开一条合成来源,追溯不到原始的编辑意图与责任方,清单的证明作用就被稀释了。

这个数说明什么、不说明什么

说明的是:四个引擎都被观察到,问题不是某一家的偶发状况;比例约 16%,属于清单构成层面的观察。

不说明的是:原创内容被引用份额的变化、单个站点的可见度涨跌,以及这一比例在不同问题类型上是否均匀。审计口径是全体被引来源的构成,长尾问题与热门问题的分布很可能差别很大,不能把它读成「八成多的引用都指向真人写的页面」这种反向保证。

站端能做的,是让自己是可辨的

来源可辨不是加分项,而是被引用时的前提。模型要从一堆候选里判断「这条内容出自谁、覆盖什么、什么时候更新」,判断成本高的内容更容易被忽略,而判断成本低、来源不明的合成页面反而占了便宜。

AnQiCMS 的做法是把这类信息做成站点自身的一部分:系统可自动生成 llms.txt,便于大语言模型理解和索引网站内容,站点的覆盖范围、重点页面与联系归属都在一个入口里说清楚。它与合成来源问题的关系不是「让模型来抓更多」,而是让真实来源在清单里保持可辨识。

第二道在内容质量上。内容安全设置里的敏感词过滤、关键词替换与内容审核,管的是站内产出是否可控。这一条与审计问题的关系容易看反:审核不改变引擎的判断口径,但它决定了自家内容会不会被下游二次加工成难以辨认的形态。批量产出、批量改写如果没人把关,产出方与合成来源的界限就会模糊。

与自动写作的边界

AI 写作功能解决的是产出效率,自 2023 年 4 月起系统就提供 AI 自动写作辅助内容创作。效率工具本身不制造合成来源,边界在编辑环节:谁对这段文字负责、事实有没有出处、页面是否署明发布者,这三问有明确答案的内容就不是合成来源。反过来,无人复核的批量生成,即使挂在真实域名下,也会在审计里成为被质疑的对象。

常见问题

要专门写一份声明来证明内容是真的吗? 与其加声明,不如把已有信息做成稳定入口:作者归属、发布时间、更新记录、联系方式,页面里一致呈现。

这个比例会上升吗? 论文只给出审计时点的观察,趋势判断需要同类口径的复测,单看一份数据不足以下结论。

被引清单里有合成来源,站方可以申诉吗? 审计描述的是引擎自身的行为。站方能做的是管好自家来源的可辨识度与抓取配置,引擎侧的纠错通道以其公开说明为准。

相关文章

实测发现答案里最先被引用的常是清单靠前的条目,页面结构该怎么排

一项跨六个模型、二十五万次量级的实测显示,主题相关性与列表位置是决定来源被优先引用的主要因素,明确的价格信息与较新的时间戳也有持续帮助。本文把这些结论落到页面结构、内容模型与发布时间的排布方式上。

2026-10-11

矢量图标能带脚本,上传图片时净化该挡掉哪些内容

矢量图标不是图片位的数据,而是一种可包含脚本元素的文档格式。上传时做净化要挡掉脚本与事件属性、外部引用与超大解压体积,同时保留正常展示内容。本文给出净化清单与黑名单、白名单两种策略的取舍。

2026-10-11

登录成功后的跳转地址由参数带来,不校验会被拿去做什么

登录回跳参数是外部可控输入,不做集中校验时,一个合法的登录流程会被改造成可信域到钓鱼页的跳板。本文说明这类跳转地址会被拿去做什么、白名单该挡哪几类取值,以及验证码与频率控制在登录链路上的分工。

2026-10-11

页面其实存在却一直返回 404,收录会受到什么影响

内容还在库里,前台却把页面判成不存在,搜索引擎收到的信号是资源消失,收录与流量都会跟着掉。本文说明统一错误码为什么危险,状态码按语义分流的几种情况,以及文档状态、伪静态规则、重定向和站点地图四处配置的排查顺序。

2026-10-11

第三方面板说开箱就能看出哪些 AI 服务在取内容,站方拿这份记录能做什么

这类面板提供的是网络层的抓取可见性:哪些 AI 服务在访问、有没有违反排除指令。本文说明这份记录能回答什么、不能回答什么,以及站方如何把它与自身的排除配置、站点说明文件和访问统计对齐后使用。

2026-10-11

访问量每次都实时写库,高并发下为什么会丢计数,聚合回写解决什么

每次访问都写库的计数属于读改写操作,并发下会互相覆盖造成增量丢失,未落盘就销账还会把已收的增量丢掉。本文说明聚合回写改的是哪一段、要兼顾的恢复能力,以及单机约 500 万 PV 这类官方口径该怎么读。

2026-10-11

博客程序的大版本隔了三年才出,变更清单里读得出什么

判断一个博客程序或内容管理系统的维护活跃度,看的是大版本之间的时间跨度、变更条目的构成和修复类型的分布,而不是版本号涨了多少。本文用公开发布记录对比两种节奏,并给出建站选型时该核的四项。

2026-10-11

robots.txt 里同一个目录一条允许一条禁止抓取时按哪条走

同一个目录既允许又禁止抓取时,判定顺序由协议规定:取匹配字节数最多的那条。本文按协议原文说明冲突条目的优先级、路径与分组名在大小写上的不同处理,以及站内配置怎么避开这种冲突。

2026-10-11