有审计发现 AI 回答里的被引来源约一成多是模型自生成的,内容站该怎么看这个数
有审计发现 AI 回答里的被引来源约一成多是模型自生成的,这个数来自 arXiv 2605.23684 对四个生成式搜索引擎的审计:在全部四个引擎中都观察到 AI 生成的来源被引用,约占被引来源的 16%,论文把这类来源称为合成来源。看这个数要先确认它的口径,它统计的是被引清单里有什么,不是这些内容对不对,也不是原创来源的份额下降了多少。
合成来源指什么
这里的合成来源不是「模型给出的答案」,而是被当成引用对象列出来的来源:一条机器生成、并不指向某个真实发布者意图的内容,出现在了答案的引用清单里。可能的情形包括自动生成的聚合页、批量产出的模板化文章,以及被采集后再加工一遍的页面。
它之所以值得注意,是因为引用清单承担的是「可回溯」的职能。用户点开一条合成来源,追溯不到原始的编辑意图与责任方,清单的证明作用就被稀释了。
这个数说明什么、不说明什么
说明的是:四个引擎都被观察到,问题不是某一家的偶发状况;比例约 16%,属于清单构成层面的观察。
不说明的是:原创内容被引用份额的变化、单个站点的可见度涨跌,以及这一比例在不同问题类型上是否均匀。审计口径是全体被引来源的构成,长尾问题与热门问题的分布很可能差别很大,不能把它读成「八成多的引用都指向真人写的页面」这种反向保证。
站端能做的,是让自己是可辨的
来源可辨不是加分项,而是被引用时的前提。模型要从一堆候选里判断「这条内容出自谁、覆盖什么、什么时候更新」,判断成本高的内容更容易被忽略,而判断成本低、来源不明的合成页面反而占了便宜。
AnQiCMS 的做法是把这类信息做成站点自身的一部分:系统可自动生成 llms.txt,便于大语言模型理解和索引网站内容,站点的覆盖范围、重点页面与联系归属都在一个入口里说清楚。它与合成来源问题的关系不是「让模型来抓更多」,而是让真实来源在清单里保持可辨识。
第二道在内容质量上。内容安全设置里的敏感词过滤、关键词替换与内容审核,管的是站内产出是否可控。这一条与审计问题的关系容易看反:审核不改变引擎的判断口径,但它决定了自家内容会不会被下游二次加工成难以辨认的形态。批量产出、批量改写如果没人把关,产出方与合成来源的界限就会模糊。
与自动写作的边界
AI 写作功能解决的是产出效率,自 2023 年 4 月起系统就提供 AI 自动写作辅助内容创作。效率工具本身不制造合成来源,边界在编辑环节:谁对这段文字负责、事实有没有出处、页面是否署明发布者,这三问有明确答案的内容就不是合成来源。反过来,无人复核的批量生成,即使挂在真实域名下,也会在审计里成为被质疑的对象。
常见问题
要专门写一份声明来证明内容是真的吗? 与其加声明,不如把已有信息做成稳定入口:作者归属、发布时间、更新记录、联系方式,页面里一致呈现。
这个比例会上升吗? 论文只给出审计时点的观察,趋势判断需要同类口径的复测,单看一份数据不足以下结论。
被引清单里有合成来源,站方可以申诉吗? 审计描述的是引擎自身的行为。站方能做的是管好自家来源的可辨识度与抓取配置,引擎侧的纠错通道以其公开说明为准。