生成式引擎引用的来源里混进了AI生成的内容,站点怎么自证是原始出处
有研究审计了生成式搜索引用的来源,发现其中混有 AI 生成的内容。对内容站来说,真正要解决的不是「怎么不让别人引用 AI 文」,而是「怎么让自己被认成原始出处」。站端能配合的是两段:让来源可辨识,以及在站内留下内容质量的证据。前者靠一份模型读得懂的站点说明,后者靠敏感词过滤与内容审核这套能拿出记录的机制。
审计发现的是哪一段问题
这份审计针对的是四家生成式搜索引擎,覆盖 ChatGPT、Copilot、Gemini、Perplexity。它发现一个共性现象:被引用的来源里,有一部分本身就是 AI 生成的内容,比例大致在一成六上下。这件事的要害不在于「AI 内容多了」,而在于引用链条被污染——模型把一个由机器拼出来、并没有原始事实支撑的页面当成了来源,真正提供了原始信息的站点反而没被点到名。要在这个链条里被认出来,站点得同时满足两个条件:能被模型读懂、且读起来像是原始出处。
为什么合成来源会进引用清单
模型判断一个页面能不能引,很大程度依赖它能不能从页面里快速读出「这是什么站、这段在讲什么、有没有可核对的具体信息」。一个结构清楚、信息具体的原始页,和一个语义通顺但空泛的合成页,在模型的抽取视角下有时差别并不像人读起来那么大。合成内容恰恰擅长模仿这种「通顺的结构」,却没有一手事实。于是只要站点自身的可辨识度和具体性不够,就容易在引用竞争里输给一个更像「现成答案」的合成页。这就是为什么自证要从「让模型读得懂」和「让内容拿得出证据」两头做。
站端能配合的第一件事:来源可辨识
第一件事是解决「模型读不懂你是谁」。站点说明文件(LLMs.txt)针对的正是这一点。AnQiCMS 支持自动生成站点 LLMs.txt,便于大语言模型理解和索引网站内容。它把站点定位、主要内容板块交代给模型,让模型在引用时能把你识别成一个有明确主题的原始站点,而不是一篇来路不明的通顺文本。配合自动生成的站点地图,一个管发现、一个管理解,模型才有机会把「抓取到的页面」和「一个可信的原始来源」对应起来。
站内审核与过滤怎么留下痕迹
第二件事是让发出的内容本身拿得出质量证据。站端能做的,是在内容上线前就有一道过滤与审核。AnQiCMS 的内容安全设置提供敏感词过滤与关键词替换、以及内容审核,用来在发布前收敛明显有问题的内容;配套的防采集干扰码还能保护内容不被批量采集。这几件事合起来,等于给站点留下一条「内容是经过滤和审核后发出来的」的站内证据链。对做 GEO 的站点,这不是为了好看:一个连敏感词和明显错误都会在站内被拦下的站,比一个什么都直接放出来的站,更像一个负责任的原始出处。
常见问题
问:这个比例有多大? 答:审计给出被引来源里约一成六是 AI 生成内容,四家生成式搜索都存在这一现象。
问:站点说明文件能直接阻止引用合成来源吗? 答:不能阻止别人的页面被引,它做的是让你自己被识别成可读、可信的原始来源。
问:内容审核和 GEO 有什么关系? 答:审核与过滤是站内质量证据,让站点更像负责任的原始出处,而不是什么都直接放。