综述 | 大模型幻觉生命周期:成因、检测、缓解与预防

导读

大语言模型已经成为问答、写作、检索增强生成、代码辅助和科学发现等场景中的通用基础设施,但“幻觉”仍然是其可靠落地的核心瓶颈。幻觉并不只是模型在输出端“说错话”,它往往在数据收集、预训练、微调、对齐、提示构造、检索、解码和评测等多个环节中逐步形成;如果只在最终答案上做真假判定,很容易错过真正的风险来源。

这篇综述《Hallucinations in LLMs: A Lifecycle-Based Survey of Causes, Detection, Mitigation, and Prevention》提出了一个生命周期视角:把大模型幻觉问题拆成四类目标,即成因、检测、缓解与预防;同时把每类目标放回数据、训练和推理三个阶段中分析。这样做的价值在于,它不再把幻觉看成单一错误,而是把它还原为一个贯穿模型开发与使用全链条的系统性问题。 本文按照原论文组织结构展开,先介绍研究动机与文献筛选方法,再依次梳理幻觉的成因、检测、缓解、预防、基准适配分析以及未来方向。对读者而言,最值得关注的是三点:第一,幻觉治理需要从“输出纠错”前移到“流程治理”;第二,检测、缓解和预防不是互斥方案,而是覆盖不同生命周期阶段的互补能力;第三,现有幻觉基准仍偏重输出层面的事实性评测,未来更需要能定位成因、评估干预、刻画不确定性和支持持续监控的生命周期基准。

1 Introduction | 引言

大语言模型通过大规模语料学习语言模式和世界知识,在开放问答、摘要、对话、推理和多任务泛化中展现出很强能力。但这种能力也伴随着高置信度错误输出:模型可能编造事实、生成不存在的引用、给出与上下文冲突的结论,或者在缺乏证据时仍以确定语气回答。这类现象通常被称为幻觉。 论文强调,幻觉并不是单一阶段产生的缺陷。训练数据可能包含偏见、过时事实、低质量片段或互相矛盾的来源;训练过程可能出现过拟合、记忆化、对齐不足或结构性偏差;推理阶段又可能受到提示歧义、上下文错配、分布外问题、解码策略等因素影响。最终用户看到的是“错误回答”,但错误背后的路径可能完全不同。 因此,论文提出生命周期式综述框架,把已有研究放入四个互相关联的问题中:幻觉为什么产生,如何被发现,发生后如何降低影响,以及如何在更早阶段减少产生概率。与单纯按方法类型分类相比,这种框架更适合工程实践,因为它能帮助研究者和系统开发者把治理动作放到正确的位置。 论文还指出,当前许多工作集中在事实性检测或检索增强生成等单点技术上,但缺少统一视角来连接数据质量、训练机制、推理行为和评测基准。生命周期视角的意义就在于建立跨阶段的因果链条:从根因到触发条件,再到具体表现和可执行干预。

2 Methodology | 方法论

文献识别

论文采用结构化综述方法,围绕大语言模型幻觉的成因、检测、缓解和预防检索相关文献。作者从多个来源收集研究论文,并将关键词限定在幻觉、事实一致性、知识 grounding、检索增强、模型编辑、置信度校准、对齐训练等主题上。这样可以覆盖从数据层、训练层到推理层的主要研究脉络。

纳入与排除标准

论文筛选时重点保留直接讨论大语言模型幻觉机制、检测方法、干预策略或评测基准的研究。仅泛泛讨论生成质量、与幻觉关系较弱、不可获取全文、语言范围不符合要求,或重复出现的文献会被排除。作者的目标不是做最大规模文献列表,而是构建一个能支撑生命周期分类的代表性证据集。

筛选与资格审查

作者采用类似 PRISMA 的流程展示筛选过程:初始收集 157 篇文章,进一步选出相关性较高的 112 篇;随后去除重复项、排除语言不符合要求和无法获取全文的文献;最终进入全文分析并纳入综述的核心文献为 30 篇。这个数量虽然不算庞大,但便于对每篇工作进行生命周期编码,而不是只做表层罗列。

数据抽取

在数据抽取阶段,论文关注每项研究解决的幻觉类型、所在生命周期阶段、使用的数据集或基准、检测指标、缓解或预防机制、计算成本以及方法局限。这样的抽取维度服务于后续横向比较:同一种技术可能能降低幻觉,但它针对的是数据缺陷、训练偏差还是推理时不确定性,工程含义并不相同。

生命周期编码规则

论文将幻觉治理编码为三个开发阶段和四类问题目标。三个阶段是数据、训练、推理;四类目标是成因、检测、缓解和预防。每篇论文被放入这个二维框架中,形成“某类幻觉风险在哪个阶段出现、用什么方法识别、用什么方式纠正或预防”的对应关系。

方法局限

作者也承认,这种综述方法存在限制。首先,幻觉定义在不同研究中并不完全一致,有些工作关注事实错误,有些关注忠实性、推理链或引用可靠性。其次,许多研究只报告特定任务或特定数据集上的结果,难以直接比较。最后,生命周期编码本身带有解释性,一些方法可能同时作用于多个阶段。

生命周期视角的理由

论文采用生命周期视角的核心理由是:幻觉治理需要从被动修补转向前置控制。只在模型生成答案之后检测错误,往往成本高、覆盖不完整,而且无法解释错误为什么出现。若能把数据污染、训练偏差、上下文冲突和解码不确定性连接起来,就能形成更系统的可靠性工程。

3 Causes of Hallucination | 幻觉成因

数据相关成因

数据阶段的幻觉成因主要来自训练语料本身。第一类是带有偏见的数据,模型会学习社会偏见、文化偏差或特定立场,并在生成中放大这些模式。第二类是低质量或证据不足的数据,例如噪声文本、缺失来源、错误事实和不完整标注。第三类是模糊或冲突数据,当多个来源对同一事实给出不同表述时,模型可能在缺乏判别机制的情况下生成自相矛盾或无支撑内容。 这类问题的关键在于,模型并不天然区分“可靠知识”和“统计共现”。如果训练语料中错误、过时或互相冲突的信息反复出现,模型就可能把它们内化为可生成模式。后续再用提示、检索或解码策略修补,通常只能缓解表现,难以彻底消除根因。

训练相关成因

训练阶段的幻觉成因主要包括过拟合与记忆化、微调或对齐不足,以及模型结构偏置。过拟合会让模型在特定领域或训练样本上产生表面熟悉感,面对相似但不同的问题时仍然给出记忆化答案。对齐不足则会导致模型学会“看起来有帮助”的回答风格,却没有充分学习“不知道时应拒答或寻证”的行为。 结构性偏置也很重要。大语言模型以流畅续写为核心训练目标,天然倾向于生成连贯文本,而不是主动验证每个命题的真实性。在长文本生成、复杂推理和多跳问答中,这种流畅性偏好可能掩盖事实错误,使幻觉更难被用户识别。

推理相关成因

推理阶段的幻觉通常由输入冲突、上下文错配、训练分布外问题和解码错误触发。用户提示若含糊、互相矛盾或缺少关键约束,模型可能自行补全缺失信息。上下文过长或检索内容质量不稳定时,模型可能忽略关键证据、错误引用上下文,或者把无关片段整合进答案。 此外,当问题超出训练知识或实时信息边界时,模型仍可能用已有模式外推,产生看似合理但事实错误的内容。采样温度、束搜索、贪心解码等生成策略也会影响幻觉:过度追求流畅和确定性可能放大错误延续,过度随机则可能引入不稳定输出。

4 Detection of Hallucination | 幻觉检测

数据阶段检测

数据阶段检测关注输入知识和训练语料是否可靠。常见方法包括去重、数据质量评估、事实核验、外部知识库对齐和真实性基准测试。对于检索增强系统,还需要评估检索片段是否覆盖问题、是否来自可信来源、是否与模型生成内容一致。 这一层检测的优势是可以提前发现污染源,尤其适合高风险场景中的知识库维护、语料清洗和领域数据治理。它的局限是成本较高,并且很难保证开放域知识的完整性和实时性。

训练阶段检测

训练阶段检测试图从模型内部行为中识别幻觉风险。论文总结了基于熵和困惑度的检测、模型内部状态分析、注意力权重分析、层级激活测试以及指令遵循与忠实性评估。直觉上,当模型对某些 token 或答案路径表现出异常不确定、过度自信或内部表征不一致时,可能意味着幻觉风险升高。 这类方法的价值在于,它们不只看最终文本,而是尝试捕捉模型生成错误之前的信号。缺点是可解释性和泛化性仍然有限,许多内部指标在不同模型结构、规模和任务之间不一定稳定。

推理阶段检测

推理阶段检测最贴近实际应用,常见方法包括自一致性检查、提示敏感性分析、跨来源验证、置信度估计和机制可解释性分析。自一致性方法会让模型在多种提示或多次采样下回答同一问题,若答案不稳定或互相矛盾,就提示潜在幻觉。跨来源验证则把生成结果与检索证据、知识库或其他模型输出进行比对。

推理阶段检测的优点是部署灵活,可以嵌入聊天机器人、检索增强生成系统和内容生产流程;不足是它往往发生在生成之后,且可能依赖额外模型、检索调用或人工审核,带来延迟和成本。

5 Mitigation of Hallucination | 幻觉缓解

幻觉缓解指的是当幻觉风险已经存在或错误已经生成时,通过外部证据、模型参数修正、训练反馈或推理干预降低错误影响。论文把主要技术放入数据、训练和推理三个阶段比较。

数据阶段缓解

数据阶段最典型的缓解方法是检索增强生成。模型在回答前检索外部知识,并将检索片段作为上下文依据,从而降低凭空编造的概率。RAG 对开放域问答、事实查询、企业知识库和医学法律等高风险应用尤其重要,因为它把模型输出与可追溯证据连接起来。 另一类方法是后训练数据增强,即通过补充事实性样本、反例、纠错数据或领域高质量语料来改善模型表现。这类方法可以增强模型对特定任务的知识覆盖,但也会受到数据质量和覆盖范围限制。

训练阶段缓解

训练阶段缓解包括模型编辑、注意力重加权、基于人类反馈的强化学习、基于人工智能反馈的强化学习,以及面向事实一致性的对比学习。模型编辑希望在不重新训练整个模型的情况下修改特定事实记忆;强化学习和对齐训练则通过偏好反馈鼓励模型避免不可靠回答。 这些方法往往能在特定任务上显著降低幻觉,但代价也更高。模型编辑可能引入知识遗忘或局部修复问题;强化学习依赖偏好数据和奖励模型质量;对比学习需要构造有效正负样本,并避免只优化表面相似度。

推理阶段缓解

推理阶段缓解包括自我反思、置信度校准、激活干预和外部事实核验。自我反思让模型在给出答案后检查自身推理或证据链;置信度校准帮助系统判断何时应降低回答强度、触发检索或转人工;激活干预则尝试在生成过程中调控内部表征;外部事实核验通过搜索、知识库或验证模型检查关键陈述。

总体来看,缓解方法更像“中后段治理”:它能减少错误传播,但不一定消除训练语料和模型内部表示中的根因。因此,在高可靠应用中,缓解应与预防和检测联合使用。

6 Prevention of Hallucination | 幻觉预防

预防与缓解的区别在于,预防希望在幻觉发生前降低其概率。论文将预防策略分为数据、训练和推理三个阶段。

数据阶段预防

数据阶段预防包括高质量数据集构建、数据多样性与覆盖优化,以及知识 grounding。高质量数据集构建强调清洗噪声、移除重复、核验事实来源、减少偏见与矛盾。数据多样性则确保模型接触足够多的主题、语言风格、领域场景和用户表达方式,避免因覆盖不足而凭空外推。 知识 grounding 是更直接的预防路径:让模型学习或访问与外部事实源绑定的知识,而不是只依赖参数记忆。对于企业、医学、金融和法律等场景,知识来源的版本管理、可信度分级和更新时间同样重要。

训练阶段预防

训练阶段预防包括更稳健的微调、对抗训练、神经符号方法和知识注入。微调可以让模型更适应目标任务,但需要避免过窄监督导致的偏差。对抗训练通过构造困难样本、冲突提示或误导性输入,提升模型在压力场景下的稳健性。 神经符号方法和知识注入试图把结构化规则、领域知识或逻辑约束引入模型,使生成过程不完全依赖统计模式。这类方向对复杂推理和高约束领域很有吸引力,但规模化、通用性和噪声处理仍是挑战。

推理阶段预防

推理阶段预防包括提示工程、自一致性解码和受控解码。提示工程通过明确任务、约束证据使用、要求引用来源或允许拒答,减少模型自行补全信息的空间。自一致性解码通过多路径推理筛选更稳定答案,受控解码则通过外部信号、分类器或事实性评分约束生成方向。 与数据和训练阶段相比,推理阶段预防更容易部署,但也更依赖任务设计。单纯优化提示无法弥补低质量知识库、过时数据或模型训练偏差,因此更适合作为系统最后一道前置控制。

7 Suitability Analysis of Hallucination Benchmarks | 幻觉基准适配分析

论文专门分析了现有幻觉基准是否适合生命周期式治理。作者认为,许多基准能评估模型输出是否正确,却很难回答更关键的问题:错误来自数据、训练还是推理?某种缓解方法是否真正修复根因?系统能否在不同任务、语言、上下文长度和知识更新条件下保持稳定?

成因识别能力

理想的基准不仅要有标准答案,还要能标注输入多样性、上下文可变性、推理链、解释信息和模型响应注释。这样才有可能区分事实缺失、语义歧义、上下文冲突、检索错误和推理外推等不同幻觉来源。现有基准在这些维度上覆盖不均,尤其缺少对真实复杂场景的细粒度成因标注。

缓解评估能力

适合评估缓解方法的基准应包含检索增强数据、错误纠正标注、提示改写、反馈数据和跨模型比较。否则,研究者只能报告某个模型在某个静态任务上的准确率提升,却无法判断这种提升来自检索质量、解码策略、奖励模型还是人工反馈。

强化控制能力

面向预防和控制的基准还应提供置信度、不确定性、幻觉严重程度、干预策略、指令调优和人类监督等信息。高风险应用尤其需要区分轻微措辞偏差、事实错误、关键决策错误和潜在安全危害,而不是把所有错误都用一个总体分数概括。

这部分的结论很明确:未来基准需要从“答案对不对”升级为“为什么错、何时错、如何干预、干预后是否稳定”。这也是生命周期框架最直接的评测落点。

8 Discussions and Future Directions | 讨论与未来方向

统一定义与可比较评测

幻觉研究首先需要更统一的定义。不同论文可能把事实错误、忠实性不足、引用缺失、推理链不可靠和上下文不一致都称为幻觉,但这些问题的治理路径不同。未来评测应明确错误类型、证据标准、任务场景和风险等级,使方法之间更可比较。

从输出检测走向过程诊断

仅检测最终输出已经不够。更有价值的方向是过程诊断:在数据准备阶段识别污染和冲突,在训练阶段捕捉不稳定内部信号,在推理阶段实时判断上下文使用、置信度和证据一致性。过程诊断能让系统知道“错在哪里”,而不是只知道“最终错了”。

多阶段组合治理

单一方法很难覆盖所有幻觉来源。RAG 可以补充外部知识,但检索本身可能错误;强化学习可以改善回答风格,但奖励模型可能偏置;提示工程容易部署,但对深层知识缺陷作用有限。未来可靠系统需要组合数据治理、训练对齐、检索验证、置信度校准和人工监督。

面向真实应用的成本约束

很多幻觉治理方法有效但昂贵,例如多次采样、外部搜索、人工审核和模型编辑。真实系统必须在可靠性、延迟、成本和用户体验之间权衡。论文提示未来研究应更系统地报告计算成本、调用次数、人工需求和部署限制,而不是只给出准确率提升。

可解释性与责任边界

随着大模型进入医疗、法律、教育和科研场景,幻觉问题不只是技术指标,也涉及责任边界。系统需要说明答案来源、证据强弱、不确定性和适用范围。可解释机制不是为了“解释得漂亮”,而是为了让用户和开发者能判断何时信任、何时复核、何时拒绝自动化决策。

9 Conclusion | 结论

这篇综述的核心贡献,是把大语言模型幻觉从单点输出错误重新组织为生命周期问题。幻觉可能源于数据、训练或推理阶段;对应的治理也应覆盖成因分析、检测、缓解和预防。这个框架让不同研究之间有了更清晰的映射关系,也提醒工程实践不要把所有希望都寄托在最终答案检查上。 面向未来,可靠大模型系统需要更高质量的数据治理、更可解释的训练诊断、更稳健的推理控制,以及能反映真实风险的基准体系。只有当模型知道证据在哪里、系统知道风险从何而来、评测知道错误为何发生,幻觉治理才可能从经验修补走向可复用、可验证的工程方法。 论文链接:https://arxiv.org/abs/2608.26168

成为VIP会员查看完整内容
4

相关内容

大语言模型与视觉模型中的幻觉现象理解综述
专知会员服务
21+阅读 · 2025年10月2日
360视角:大模型幻觉问题及其解决方案的深度探索与实践
《多模态大型语言模型的幻觉现象》综述
专知会员服务
46+阅读 · 2024年4月30日
《大型视觉语言模型中的幻觉现象》综述
专知会员服务
57+阅读 · 2024年2月2日
大型语言模型幻觉缓解技术的全面综述
专知会员服务
72+阅读 · 2024年1月3日
大模型的幻觉现象介绍
专知会员服务
67+阅读 · 2023年10月27日
多模态大模型的幻觉问题与评估
专知会员服务
57+阅读 · 2023年7月28日
绝对干货!NLP预训练模型:从transformer到albert
新智元
14+阅读 · 2019年11月10日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
6+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
23+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
Arxiv
24+阅读 · 2024年2月23日
VIP会员
最新内容
受限仓库多智能体取送中的动态安全等待点选择
《国防技术管理》印度智库报告最新45页
专知会员服务
3+阅读 · 8月28日
《美陆军最新条令:保障行动》
专知会员服务
4+阅读 · 8月28日
算法战场:人工智能如何重新定义军事力量
专知会员服务
5+阅读 · 8月28日
《北约联邦式电子战云架构》
专知会员服务
6+阅读 · 8月27日
《美陆军野战手册:空域管理战术》
专知会员服务
9+阅读 · 8月27日
相关VIP内容
大语言模型与视觉模型中的幻觉现象理解综述
专知会员服务
21+阅读 · 2025年10月2日
360视角:大模型幻觉问题及其解决方案的深度探索与实践
《多模态大型语言模型的幻觉现象》综述
专知会员服务
46+阅读 · 2024年4月30日
《大型视觉语言模型中的幻觉现象》综述
专知会员服务
57+阅读 · 2024年2月2日
大型语言模型幻觉缓解技术的全面综述
专知会员服务
72+阅读 · 2024年1月3日
大模型的幻觉现象介绍
专知会员服务
67+阅读 · 2023年10月27日
多模态大模型的幻觉问题与评估
专知会员服务
57+阅读 · 2023年7月28日
相关基金
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
6+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
23+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
微信扫码咨询专知VIP会员