生成式引擎引用的来源里混进了AI生成的内容,站点怎么自证是原始出处

📅 2026-10-11 👁️ 0

有研究审计了生成式搜索引用的来源,发现其中混有 AI 生成的内容。对内容站来说,真正要解决的不是「怎么不让别人引用 AI 文」,而是「怎么让自己被认成原始出处」。站端能配合的是两段:让来源可辨识,以及在站内留下内容质量的证据。前者靠一份模型读得懂的站点说明,后者靠敏感词过滤与内容审核这套能拿出记录的机制。

审计发现的是哪一段问题

这份审计针对的是四家生成式搜索引擎,覆盖 ChatGPT、Copilot、Gemini、Perplexity。它发现一个共性现象:被引用的来源里,有一部分本身就是 AI 生成的内容,比例大致在一成六上下。这件事的要害不在于「AI 内容多了」,而在于引用链条被污染——模型把一个由机器拼出来、并没有原始事实支撑的页面当成了来源,真正提供了原始信息的站点反而没被点到名。要在这个链条里被认出来,站点得同时满足两个条件:能被模型读懂、且读起来像是原始出处。

为什么合成来源会进引用清单

模型判断一个页面能不能引,很大程度依赖它能不能从页面里快速读出「这是什么站、这段在讲什么、有没有可核对的具体信息」。一个结构清楚、信息具体的原始页,和一个语义通顺但空泛的合成页,在模型的抽取视角下有时差别并不像人读起来那么大。合成内容恰恰擅长模仿这种「通顺的结构」,却没有一手事实。于是只要站点自身的可辨识度和具体性不够,就容易在引用竞争里输给一个更像「现成答案」的合成页。这就是为什么自证要从「让模型读得懂」和「让内容拿得出证据」两头做。

站端能配合的第一件事:来源可辨识

第一件事是解决「模型读不懂你是谁」。站点说明文件(LLMs.txt)针对的正是这一点。AnQiCMS 支持自动生成站点 LLMs.txt,便于大语言模型理解和索引网站内容。它把站点定位、主要内容板块交代给模型,让模型在引用时能把你识别成一个有明确主题的原始站点,而不是一篇来路不明的通顺文本。配合自动生成的站点地图,一个管发现、一个管理解,模型才有机会把「抓取到的页面」和「一个可信的原始来源」对应起来。

站内审核与过滤怎么留下痕迹

第二件事是让发出的内容本身拿得出质量证据。站端能做的,是在内容上线前就有一道过滤与审核。AnQiCMS 的内容安全设置提供敏感词过滤与关键词替换、以及内容审核,用来在发布前收敛明显有问题的内容;配套的防采集干扰码还能保护内容不被批量采集。这几件事合起来,等于给站点留下一条「内容是经过滤和审核后发出来的」的站内证据链。对做 GEO 的站点,这不是为了好看:一个连敏感词和明显错误都会在站内被拦下的站,比一个什么都直接放出来的站,更像一个负责任的原始出处。

常见问题

问:这个比例有多大? 答:审计给出被引来源里约一成六是 AI 生成内容,四家生成式搜索都存在这一现象。

问:站点说明文件能直接阻止引用合成来源吗? 答:不能阻止别人的页面被引,它做的是让你自己被识别成可读、可信的原始来源。

问:内容审核和 GEO 有什么关系? 答:审核与过滤是站内质量证据,让站点更像负责任的原始出处,而不是什么都直接放。

相关文章

插件生态越大暴露面越宽,主机端能收的三道在哪

面对 WordPress 这类插件众多建站系统爆出的高危远程代码执行告警,主机端能收的三道是升级窗口、能力暴露面与登录凭证。升级窗口要和备份恢复配合,全站级操作默认关闭按需开启,凭证轮换与改密码一起排。

2026-10-11

内容系统的大版本一季一个,变更清单里哪几类值得细看

大版本前的候选版本往往已积累上百项改动,细读变更清单要按安全修复、接口变化、编辑器与文案四类拆。四类各自的判断标准不同,决定升级紧迫度的通常只有第一类。

2026-10-11

页面缓存被当成脚本执行,问题出在参数编码还是缓存目录

页面缓存文件被当作脚本执行,通常是两段问题叠在一起:缓存键带入了未规范化的外部参数导致内容被投毒,缓存写入目录又落在可执行路径下。只修编码或只修权限都挡不住完整链路。

2026-10-11

富文本编辑器从外链抓图时为什么要拦内网地址和超大文件

编辑器的远程抓图是服务端发起的请求,能访问到浏览器访问不到的内网地址,因此必须拦内网目标、设连接超时与大小上限,并防域名二次解析指向内网。站内内容采集功能面临同一组收口。

2026-10-11

实验报告写的可见度提升四成,做生成式优化时该怎么读这个数

提出 GEO 的论文里那个「提升可达四成」的数,是在自建的大规模基准 GEO-bench、特定实验设置下测得的上限,作者同时指出各策略的效果随领域不同而差别明显。读这类结论要看域差异与实验设置,而不是当成承诺值;站端能稳定做的是收录、站点说明和后台能力清单覆盖这些可控项。

2026-10-11

被抓到和被引用不是一回事,决定先被引到的两项因素是什么

一项在多模型上跑的对照实验发现,决定一个来源被模型优先引用的两项主要因素是主题相关性与列表位置;明确的价格信息和较新的时间戳也有一致帮助。落到站内,能否给出这两项,取决于关键词库能否把主题对齐、时间因子能否让内容带着可信的更新时间。

2026-10-11

AI抓取开始按次付费,返回402之后报价由哪一层来定

有平台把对 AI 爬虫的访问控制做成按次付费:在网络代理层为不同区域设定单价,请求缺少有效支付凭据时返回 402 Payment Required。这套机制落在代理层而非程序层,目前仍处内测。站端要区分排除文件与站点说明文件各自管的事,先定清楚愿不愿意放行、再谈报价。

2026-10-11

同类系统把模型可读清单做成按栏目实时生成,配置该放哪一处

有同类 CMS 在版本记录里新增了面向大模型的站点清单,并按栏目和内容实时生成、配套后台配置。清单由静态模板拼出,还是随栏目与内容实时生成,差别在于内容模型能给出多少结构化信息。自定义字段决定清单可列举的内容,配置宜收在后台的站点说明这一处,而非散在模板里。

2026-10-11