论文:Hallucination Across the Reasoning Lifecycle: Interface Visibility, Causal Evidence, and Release Control in Large Reasoning Models 作者:Zhe Yu、Mohan Li、Lei Yu、Ka-Ho Chow、Chengwei Qin、Xingyu Wu、Wenpeng Xing、Shuguang Xiong、Meng Han 机构:浙江大学及浙江大学滨江研究院、广州大学、伦斯勒理工学院、香港大学、香港科技大学(广州)、香港理工大学、之江实验室 版本与状态:arXiv:2610.05472v1,2026 年 10 月 4 日提交,共35页、8幅图、9张表;正文明确为拟投 ACM Computing Surveys 的未发表稿件,不是已被该期刊接收的论文。 原文链接:论文页面与补充材料|完整 PDF
导读:同样一个错误答案,可能来自错误前提、无效推断、旧错误被后续步骤复用,也可能是最终答案与自己的推理相矛盾。只给答案判对错,无法决定该补查资料、重算一步、重启依赖分支,还是暂缓发布。更重要的是,答案还会进入记忆、工具执行和训练反馈,成为下一轮的前提。 这篇综述以312篇论文和第一方报告为分析资料,将推理幻觉拆为三个问题:**什么证据可观察,什么研究设计能够支持结论,什么纠正动作能由这些证据正当化。**作者提出 UIPCA 诊断记录,把前提、推断、依赖复用、可见一致性和行动策略分开审计,并讨论如何把检测信号转化为验证、修复、澄清、暂不作答和升级审核。 一个值得谨慎理解的结论是:在专门审查的58项来源中,没有比较满足本文规定的严格配对标准,证明某项干预同时提升推理能力、降低事实可靠性。这不是证明权衡不存在,也不是证明“思考越多越安全”,而是指出现有证据的因果识别与报告缺口。
下文沿原文七节结构展开。采用六张原图,内部文字保留原貌,另附中文图注。原文以文本推理为主,多模态与代码是迁移检验案例,不是同等全面的领域综述;实验观察、假设和部署建议分别表述。
推理模型可能从不受支持的前提出发,也可能在正确前提上犯算术或逻辑错误。纠错位置不同,需要的工具就不同。答案正确率能够评价结果,却无法单独选择修复方案;一个正确答案,也可能配有不受支持的解释。 推理系统还存在不同实现方式:提示生成中间步骤、多路径采样和答案聚合、推理后训练、工具调用或隐藏的计算预算。训练配方与推理时设置不能混为一个原因。供应商可能展示完整轨迹、摘要,或完全不展示;流畅解释始终是待检查的生成文本,不是内部计算的自动证明。 与按错误类型、模型生命周期或轨迹长度组织的相邻综述相比,本文把局部错误与下游使用、可见性和行动联系起来。其贡献包括 UIPCA 记录、推理与事实可靠性关系的研究设计审查,以及跨界面的验证、修复、选择性发布和持久写入控制。
图1|综述阅读路线:从范围与可观察性,进入诊断、研究证据、检测干预、评测及持久状态控制。图中推理能力与事实可靠性是独立测量对象,假设之间的虚线不是已证实的因果关系。来源:原论文图2,PDF 第3页。 原文围绕四个研究问题:怎样诊断并修复;当前证据如何描述推理与事实可靠性;不同界面允许哪些检测和干预;基准及发布策略如何评价重要输出与持久状态。这条路线的终点不是一个更高的检测分数,而是更有依据的实际决策。
本文将大型推理模型理解为超出直接生成、分配或监督多步计算的系统,涵盖可见草稿、隐藏思考、多路径搜索、工具使用和推理后训练。强化学习、监督微调和蒸馏经常同时改变数据、奖励、优化及轨迹保留方式,标签本身不能隔离单一原因。 “幻觉”依据任务声明的参考框架判断:事实性问陈述是否正确,来源忠实性问指定材料是否支持它。某个外部事实即使真实,在要求只依据指定文档作答时,也可能缺少任务所需的支持。 另有三项独立目标。过程忠实性问展示的推理是否反映真正决定答案的过程,需要因果干预而非文字对照;校准问概率或分数是否对应实际正确率;可纠正性问有效反馈是否修复后续推理及结果。它们都不能替代行动质量:知道自己不确定,不代表会恰当地验证或暂不发布。
错误、持久或自相矛盾的陈述,不足以证明欺骗意图。欺骗需要目标驱动的隐瞒或策略性误述证据,例如对激励和信息访问的控制实验。 UIPCA 记录可观察的支持、依赖、一致性和策略失效,不推断心理状态。同一记录可能由知识不足、推断失误或奖励压力产生;即便事实完全正确,违反预先规定的发布要求,也可能构成行动策略失败。
完整轨迹暴露有序步骤,摘要只暴露选定陈述,隐藏界面没有过程记录。比较时仍可用的问题、指定证据、答案和已记录动作,不应因过程隐藏而被忽略。 证据状态应分为支持、不支持和未知。指定文档中缺少必需依据,可以确认来源落地失败;开放世界检索找不到来源,却不能直接证明陈述为假。缺失过程保持未知,不因模型自信、样本一致或结果正确而补成“无错误”。 此外,给同一次运行展示不同视图,与改变模型如何生成或压缩推理,是两个不同实验。披露本身可能改变行为,不能将界面可见性与生成机制的作用混淆。
原文描述的分析资料为截至2026年8月30日可获得的312篇论文及第一方报告,通过 OpenAlex、arXiv、引文追踪和不足主题的定向检查收集。作者明确这是策划式集合,不是领域穷尽普查;年份计数不能当作全部论文产量。 推理与可靠性专项审查包括语料内34项来源,以及外部跟进中取得原始文本的24项,共58项来源,不是额外58次独立实验。补充材料保存检索、筛选、证据审查、编码和图表资料。 作者区分单场景的直接证据、兼容研究形成的综合支持、有限或混合证据,以及尚无结果的拟议测试。语言模型辅助文字起草,但协议、资料选择和结论由作者负责。
要证明某项干预使推理提升却损害事实可靠性,需要在同一比较中同时测量两者,预先规定有意义的增益与损失阈值,并要求联合置信区域支持两个方向。观察到两个分数反向变化,尚不足以证明该效应。 推理时实验要固定检查点和非目标设置;训练实验要从共同基础模型出发,控制非目标训练选择;两者都需匹配题目与评价器。轨迹变长或被称为“推理模型”不能替代能力测量。未达到标准,结论是未解决,而不是没有损害。
UIPCA 的五个字段不是模型内部机制,也不是每次运行必经的五个阶段:
原文以1表示确认失败,0表示已排除该失败,未知符号表示证据不足。最早错误标记只定位最早被确认的前提或推断失败;更早步骤未决时,它不等于真实的第一处错误。
图2|前提和推断定位错误起点,依赖字段记录后续复用,一致性字段检查可见矛盾,行动字段单独审计固定策略。完整、摘要和隐藏界面允许不同检查;证据不可用时保留未知。来源:原论文图3,PDF 第4页。
案例一计算 (1024 × 1047 × 1050 × 1053) mod 33。第3步把1024除以33的余数写为29,正确值是1;其他余数错误又被后续乘积复用,最终输出27,而参考结果是3。因此存在局部推断错误与依赖复用,但答案跟随错误轨迹,没有可见矛盾。一致性通过,不代表算对了。 案例二判断哪些条件能确定一个两位数。前面正确得到两组条件均可确定43,第8步却把仅重复“十位减个位等于1”的另一组也当作充分条件。该错误没有后续复用;另一个独立问题是最终选项与前面有效结果矛盾。!
图3|两个原始案例都答错,但修复不同:上例要重算错误余数与依赖乘积,下例要检查充分条件和选项映射。两例都未提供发布策略,行动字段因此未知,而非认定合规。来源:原论文图5,PDF 第9页。 答案评分无法选出这些修复点。这些是案例诊断,不是故障发生频率估计;作者也没有把后补的假设策略追溯为原案例已声明的政策。
文本需要来源与时间标记;视觉陈述需要对象、区域或帧;代码可用契约、静态检查、沙箱和测试。共用的是诊断问题,不能共用一个不加区分的验证器。 视觉答错可能是漏看对象,也可能看见却未使用;继续纯文本思考不能核验未观察的图像细节。代码测试通过仅证明被覆盖性质,不证明所有需求、安全性或用户未写出的意图。仓库任务还要记录构建环境、快照及补丁相互作用。
前提问题可通过检索、来源核验或输入纠正处理;局部推断问题需要规则、数学或执行检查。若图模型虚构了边,后面的演绎可能对错误输入完全一致,应修输入,而不是只调整推理规则。 复用问题需要证明后续依赖,并检查分支。独立证据可以终止错误影响,自我检查则可能再次采用同一个错误前提。可见一致性需轨迹对照,而过程忠实性仍需改变前提或步骤并观察答案。 行动审计另行衡量错误发布、不必要拒绝、未澄清和未升级,并结合成本及证据要求。口头置信度不是发布策略。
一句话可能适合来源核验,却含有需拆开的多个算术操作;一个精确到词元的警报,也可能不知道该重启哪个分支。定位粒度只有改变可实施修复时才有实际价值。 字段记录位置和关系,不记录严重程度。未使用的错误前提可能很重要,被丢弃的长错误分支却可能无害;严重性和恢复难度须另测。展示的依赖和矛盾也不能直接代表隐藏计算。
合并正确与错误操作,会扩大第一错误范围;把相邻步骤全部当作依赖,会制造传播。缺少前置条件或存在多个推导时,未发现依赖也不能自动排除复用。 作者对48个完整轨迹案例开展独立双人标注,在334个共享来源步骤上,前提、推断和复用的 Cohen’s κ 分别为0.653、0.730、0.858;第一错误位置在41/48例一致。所有行动标签未知,因为没有提供策略。这些结果支持固定分段下的标签一致性,不是对候选依赖图或部署修复效果的全面验证。
在34项语料内来源和24项外部来源中,没有一项满足本文规定的配对联合不利效应标准;仅放宽阈值和不确定性报告要求,也没有阳性来源。 这是来源级的设计与报告结论,不是领域级零效应。候选研究分别讨论完整训练管线差异、自然轨迹关联、总体提升中的单题退化,或可监控性下降;它们并没有回答完全相同的问题。
管线比较:不同后训练方案可在事实问答上提升或下降,但数据、奖励和优化一起变化,不能单独归因于推理。自然轨迹分组:错误事实轨迹对应更低准确率,可能受难度、置信度及其他属性影响,不能证明插入该事实的因果效应。 局部干预:改变步骤、工具可用性或提示,可检验具体机制;接受正确局部编辑与最终结果恢复必须使用各自分母。部署与评价报告:文档集、判分器和协议变化后,分数不能拼成连续排名。事实访问与组合能力、可监控性与事实性也需独立测量。
图4|五项假设分别提出应改变什么、测量什么,并标记当前证据强度。错误复用的直接证据来自一个植入记忆攻击场景,不是日常错误复用率;箭头描述拟议实验,不表示已确立因果效应。来源:原论文图6,PDF 第13页。
输出细节决定可核验陈述数量,作答意愿改变被回答的子集,评价者权限限制可用检查,检查点与训练变化可能压过“思考模式”的作用。因此长短回答、不同预算和不同后训练模型不可直接合并。 综述要求每个结果明确来源、分母和支持的关系。未找到严格阳性结果,只把因果问题保留为开放问题,不取消特定系统中已观察的损害。
重复采样、语义熵和自我一致性可以提供风险信号,但共享错误前提会让多次输出一致。隐藏状态及稀疏特征探针可能更早预警,却依赖模型和训练域,不能补出缺失事实。 FActScore 以事实为单位,MiniCheck 检查文档对陈述的支持,FacTool 与 SAFE 寻找外部证据;步骤与流式检测器则定位生成中的过程问题。单位决定修复能力:句子分数未必定位运算,内部异常未必提供可靠来源。
图5|互补的检测机制:外部来源、采样不确定性、可执行检查、过程监控及模型判分。控制器综合证据与策略选择发布、验证修订、澄清暂不作答或升级;行动字段再审计实际动作。来源:原论文图7,PDF 第15页。 快速监控器的价值在于把适合强检查的案例路由出去,而不只是把难题排在前面。需要测后续错误发布、误报、人工负担和成本。检测器比较与完整系统比较,是两个不同实验。
推理时增加预算、路径或辩论可能扩大召回,也可能共享来源错误,应报告作答率、选择性准确率、路径多样性及延迟。轨迹长度不能独自证明修复或浪费。 检索、工具批评和独立验证比单纯重新思考提供更强依据,但弱检索或不可用工具也会引入故障。早期检查可以在复用前拒绝步骤,生成后的批评重写则可能改善答案却留下原错误轨迹;两者都需独立最终检查。 过程监督把检查移入训练:来源支持定位前提,规则与执行定位推断,依赖感知奖励还要证明后续引用了已确认错误。事实验证器可能漏逻辑,步骤奖励可能漏假前提,没有一种验证器覆盖全部字段。 自动标签可继承判分偏差,优化也可能迎合措辞或分数。知识编辑、激活引导与解码干预应检查关联事实、多跳回答和无关能力;编辑后的单题变好,不证明整个依赖链修复。多模态与代码干预同样需要与其证据单位匹配。
把案例一显示为完整轨迹、示意摘要和仅答案,是同一次已完成运行的三种视图,不是三次新生成。完整轨迹能定位第3步和后续复用;摘要省略运算时无法定位,隐藏视图也无法检查答案与轨迹一致性。 但三种视图都能从题目独立计算出3。如果事先规定数值发布前必须独立验证,都应阻止27;验证不完整则暂不作答。这是示范策略,原案例的行动字段仍未知。更多可见性改善定位,却不自动保证其收益超过成本。
先拆分可见答案及推理中的陈述,判断支持、不支持和未知;能定位时进行组件级修复,未知则转检索、澄清、暂不作答或升级,不能算作已支持。 快速筛查选择强验证,事实争议交给来源,算术争议交给重算,重要争议可送专家。每层单独的高分都不足够:筛查改变验证器接到的样本,保守控制器也可能靠大量升级制造高可靠性外观。 完整系统应同时报告修复成功、选择性风险、覆盖、工作量与成本。行动审计只检查策略是否遵守,不把一次合规动作反向改写为证据充分。
事实问答与来源基准主要测答案或陈述;过程基准提供步骤和扰动;校准与可回答性基准测概率及作答动作。长上下文还需检索和证据绑定,视觉需区域覆盖,代码需环境与测试覆盖。 长期记忆基准补充跨会话召回、知识更新和选择性遗忘。HaluMem 分开评价提取、更新及记忆问答,MemoryData 比较组件、检索和成本;共享记忆治理另测授权、可见版本及冲突处理。操作标签或检索来源编号,不足以证明后续推理依赖了错误。
第一,终点评分隐藏路径,不能说明正确答案是否来自错误轨迹。第二,模型判分器受提示、少样本范例和模型家族影响;生成与判分共享偏差时,一致不等于独立确认,评价器升级也可能改变分数而非系统能力。 第三,动作覆盖不足。澄清、检索、工具验证、专家升级、拒绝写入与回滚很少被共同测量。需要外部核验的标签、完整动作及成本记录,而不只是扩充错误答案数量。
基准应把同一错误、可用证据和实际动作连接起来,用同一运行的不同视图测试可见性损失,再控制改变前提或推断,检验防护是否真的防止损害。 还要区分排序、概率校准和决策:AUROC 衡量排序,不是概率准确;Brier 分数与期望校准误差测概率的不同性质。发现来源支持某步骤,不等于证明它影响答案。 VeriFY 的模型相对召回包含不必要暂不作答,依赖协议如何判定基础模型已有知识,不能直接当作客观可回答性的普通召回。错误定位的部署价值,应由改善修复和动作来检验,而非仅由标签吻合证明。
发布策略在回答、搜证、修订、澄清、暂不作答和升级之间选择。全部拒绝可以避免错误发布,却没有服务覆盖;全部回答则可能超过允许风险。风险与覆盖阈值必须事前声明。 原文举例:一万次请求发布六千次,其中30次错误,选择性风险为0.5%、覆盖60%。这满足风险不超过0.6%且覆盖至少55%的示例约束,却不满足0.2%的风险上限。这是说明性数字,不是部署实验,且仍需考虑抽样不确定性和分布变化。
图6|证据和可见诊断进入固定策略控制器;改变状态前还需检查证据、写权限及版本。记忆、工具状态和训练反馈是并列目的地,保存内容将来可能复用,但复用并非必然。来源:原论文图8,PDF 第19页。 完整轨迹可支持过程检查,摘要只能检查披露内容,缺失过程不能记为零错误。如果在现有证据与资源下无法同时达到风险和覆盖要求,策略就是不可行。相同警报在可逆写作错误和高后果建议中也应导致不同动作,不能把口头不确定性当作风险控制。
答案可以进入私人或共享记忆、工具效果及训练反馈。文本修改、外部动作回滚和参数纠正是不同恢复操作;自我反馈和迭代本身不证明修复。 A-MAC 在准入时按效用、重叠置信等评分,但与对话片段的字面重叠不等于语义蕴含。TrustMem 对旧记忆到新记忆的转换检查覆盖、保持和支持,仍受评价器及已有错误记忆限制。准入与整理分别要问能否进入、改动是否保留有效信息。 共享状态增加写者权限、并发、可见版本和撤销问题。原文转述 MemClaw/ArgusFleet 的单服务观察:近重复门禁可能在异步冲突检测前拒绝矛盾写入,从而挡住合法纠正。这说明控制顺序也需验证,不能外推为普遍记忆幻觉率。 来源记录证明谁写或派生,不证明内容真实;其他智能体可见,也不证明依赖复用。阻止写入或替换版本,并不修复已有摘要、工具效果及训练反馈,应追踪受影响消费者。 作者建议统计固定观察期内、独立修复前实际复用错误的预期消费者数。示例中三名消费者各有50%选择概率、选择后20%先修复,预期未修复使用数为1.2;修复概率提高至60%则为0.6。数字是假设演示,不是实测扩散率或通用传播阈值。
首先,用配对设计区分验证带来的收益与单纯减少回答,并联合测推理和事实性。其次,在同案例上比较错误定位与普通回答级警告,检验定位是否真正改善修复,而非只提高标注一致性。 最后,评估迁移与恢复时机:翻译可能改变实体、否定及单位,视觉证据与上下文位置可能改变信息使用,代码成功依赖具体需求与测试。早期前提纠正、分支中断和晚期答案修订应在共同预算下比较,并纳入对抗证据、工具不可用和分布变化。
可靠性不能由一个总分概括。UIPCA 分离前提、推断、错误依赖复用、可见一致性与行动策略失效;未知保留为未知,不推断欺骗,也不将文本轨迹自动视为真实计算机制。 对58项来源的专项审查没有确立本文严格定义的“推理增益伴随事实可靠性损失”,但特定管线差异和错误轨迹仍然值得研究。五项假设提供的是后续实验路线,不是统一因果定律。 实际系统应联合测答案质量、过程支持、置信、动作、覆盖和成本;重要陈述在进入记忆、工具及训练反馈前,也需要证据、权限和版本检查。治理目标既是减少当前错误发布,也是让下一轮继承有依据、可纠正的状态。 论文与补充材料:完整 PDF|论文页面及附属文件。本文为综述解读,研究结果和适用条件以原论文及所引研究为准。