人工智能(AI)应答引擎如今承担着分析师、学者及公众提出的和平与冲突议题相关咨询的日益增长份额。大语言模型(LLM)在特定条件下存在“幻觉”现象已为人所知,但当其面对冲突相关质询时,此类错误是否存在可辨识的模式?若存在,又能为理解全球冲突信息环境的演变提供何种启示?为解答上述问题,本研究首先就28场冲突向五款主流应答引擎发起系列质询,并将所得5,460条回答与既有实证记录进行比对评分。研究发现,特定冲突的可检索记录越匮乏,引擎虚构、错归因及计数失准的现象就越频发。记录匮乏不仅诱发幻觉,更因这类记录最易被“生成式引擎优化”(GEO)手段扭曲以偏置引擎响应,从而制造出易受错误信息与虚假信息侵蚀的结构性漏洞。通过对人工智能大语言模型提取冲突事实所依据的1,048个网站的解析,我们发现生成式引擎优化源头操纵已现端倪,尽管国家党派主导的数字渗透尚处萌芽阶段,但其扩张势头迅猛。本文将阐释上述发现在生成式引擎优化信息战兴起背景下对学术研究的意义,并从政策层面主张回归深度在地监测与基于翻译的研究范式——此类工作乃人工智能工具无法复刻。文末将探讨这一快速演进领域未来的研究机遇与挑战。
关键词:人工智能(AI);冲突;大语言模型(LLM);生成式引擎优化(GEO);偏见;幻觉;国家主导虚假信息;搜索引擎博弈
若向主流人工智能大语言模型应答引擎询问2025年乌克兰平民死亡人数,各引擎给出的数据均收敛于同一经核实数值。OpenAI、Grok、Gemini、Perplexity及Anthropic均援引联合国监测团的统计,称至少2,514人丧生,与该年度2,514至3,000人的文献记载区间吻合。此类回答通常标注源自联合国或其他权威机构,并对漏报可能性作出限定,其信息准确度大体可达维基百科级别。但若就刚果民主共和国西部蒙博多(泰克-雅卡)族际暴力事件提出相同质询,引擎则会臆测伤亡数字、拒绝作答、凭空捏造数据,或转而论述全然无关的冲突,其应答仅依托训练数据中近似匹配内容生成看似合理实则脱离现实的结论。
当下,学者、专业人士及公众欲获取冲突速览信息时,愈发倾向于直接询问聊天机器人,而非开展深度调研——后者旨在检索既有文献并凝练为一两句概要。独立测试结果令人对这类信息压缩过程难以采信:大语言模型对摘要新闻的引用源出错率逾60%[1],主因在于难以便捷定位权威信源[2]。这是否意味着,在媒体关注度低、信息稀缺的冲突议题上,社会对人工智能大语言模型的依赖加深将导致认知水平进一步滑坡?2025年全球有组织暴力致死人数创1994年以来新高[3],其中大量暴力事件鲜受瞩目。加之全球媒体多样性与内容生产普遍收缩,若可资调用的信息日趋匮乏,个体自主调研时间持续缩减,我们对冲突的认知图景将面临何种风险?
为探究竟,本研究向五款主流人工智能大语言模型征询28场不同冲突的相关信息,系统评估其应答内容及所引素材。研究得出三项核心发现:其一,引擎在媒体报道最薄弱的冲突议题上准确度最低——相关记录越单薄,虚构、错归因及计数失准现象越频繁,“被遗忘的冲突”受害最深;其二,恰恰在报道匮乏之处,引擎对既定可查的事实存在系统性遗漏,此非单纯无力回答无解之问,而是未能检索已知信息;其三,记录最单薄的冲突议题最受生成式引擎优化工具的针对性操纵。尽管此类操纵多源于地方小型媒体为博取曝光与自我宣传,但宣传机构已开始利用人工智能引擎的检索机制,在公众质询低信息量冲突“真相”时定向塑造其认知视野。综上,本研究表明所有主流人工智能大语言模型均在放大国际社会对多数冲突的漠视,文末将探讨如何修复这些系统性缺陷。