VISTA: Verification In Sequential Turn-based Assessment - 专知论文

会员服务 ·

0

回合 · 一致 · 系统 · 声明 · 分解 ·

VISTA: Verification In Sequential Turn-based Assessment

翻译：VISTA：基于顺序回合的验证评估

Ashley Lewis,Andrew Perrault,Eric Fosler-Lussier,Michael White

Hallucination--defined here as generating statements unsupported or contradicted by available evidence or conversational context--remains a major obstacle to deploying conversational AI systems in settings that demand factual reliability. Existing metrics either evaluate isolated responses or treat unverifiable content as errors, limiting their use for multi-turn dialogue. We introduce VISTA (Verification In Sequential Turn-based Assessment), a framework for evaluating conversational factuality through claim-level verification and sequential consistency tracking. VISTA decomposes each assistant turn into atomic factual claims, verifies them against trusted sources and dialogue history, and categorizes unverifiable statements (subjective, contradicted, lacking evidence, or abstaining). Across eight large language models and four dialogue factuality benchmarks (AIS, BEGIN, FAITHDIAL, and FADE), VISTA substantially improves hallucination detection over FACTSCORE and LLM-as-Judge baselines. Human evaluation confirms that VISTA's decomposition improves annotator agreement and reveals inconsistencies in existing benchmarks. By modeling factuality as a dynamic property of conversation, VISTA offers a more transparent, human-aligned measure of truthfulness in dialogue systems.

翻译：幻觉（此处定义为生成缺乏可用证据或对话上下文支持、或与之相矛盾的陈述）仍然是对话式人工智能系统在要求事实可靠性的场景中部署的主要障碍。现有评估指标要么评估孤立响应，要么将无法验证的内容视为错误，限制了其在多轮对话中的应用。我们提出了VISTA（基于顺序回合的验证评估），这是一个通过声明级验证和顺序一致性跟踪来评估对话事实性的框架。VISTA将每个助手回合分解为原子事实声明，根据可信来源和对话历史对其进行验证，并对无法验证的陈述（主观的、矛盾的、缺乏证据的或弃权的）进行分类。在八个大型语言模型和四个对话事实性基准（AIS、BEGIN、FAITHDIAL和FADE）上，VISTA在幻觉检测方面显著优于FACTSCORE和LLM-as-Judge基线方法。人工评估证实，VISTA的分解方法提高了标注者间一致性，并揭示了现有基准中的不一致性。通过将事实性建模为对话的动态属性，VISTA为对话系统提供了一种更透明、更符合人类认知的真实性度量标准。

0

相关内容

扭曲还是编造？视频大语言模型幻觉研究综述

扭曲还是编造？视频大语言模型幻觉研究综述

专知会员服务

14+阅读 · 4月15日

《深度伪造防御系统评估的系统性方法》

《深度伪造防御系统评估的系统性方法》

专知会员服务

14+阅读 · 3月16日

通用智能体评估的逻辑架构

通用智能体评估的逻辑架构

专知会员服务

22+阅读 · 2月28日

《缓解大语言模型（LLMs）幻觉：面向应用的检索增强生成（RAG）、推理与智能体系统综述》

《缓解大语言模型（LLMs）幻觉：面向应用的检索增强生成（RAG）、推理与智能体系统综述》

专知会员服务

24+阅读 · 2025年10月29日

通用人工智能：是什么？如何测试？如何实现？

通用人工智能：是什么？如何测试？如何实现？

专知会员服务

27+阅读 · 2024年6月19日

大型语言模型幻觉缓解技术的全面综述

大型语言模型幻觉缓解技术的全面综述

专知会员服务

72+阅读 · 2024年1月3日

UTC: 用于视觉对话的任务间对比学习的统一Transformer

UTC: 用于视觉对话的任务间对比学习的统一Transformer

专知会员服务

14+阅读 · 2022年5月4日

【TPAMI】从人机对抗提出视觉跟踪智能评估新方法，Global Instance Tracking: Locating Target More Like Humans

【TPAMI】从人机对抗提出视觉跟踪智能评估新方法，Global Instance Tracking: Locating Target More Like Humans

专知会员服务

22+阅读 · 2022年3月29日

语音识别:不同深度学习方法的综述，Speech Recognition: a review of the different deep learning approaches

语音识别:不同深度学习方法的综述，Speech Recognition: a review of the different deep learning approaches

专知会员服务

33+阅读 · 2022年3月13日

[SIGIR2021]可复现推荐系统评估的全面和严谨的框架

[SIGIR2021]可复现推荐系统评估的全面和严谨的框架

专知会员服务

22+阅读 · 2021年4月30日

异常检测（Anomaly Detection）综述

异常检测（Anomaly Detection）综述

极市平台

20+阅读 · 2020年10月24日

异常检测怎么做，试试孤立随机森林算法（附代码）

异常检测怎么做，试试孤立随机森林算法（附代码）

机器之心

16+阅读 · 2020年3月15日

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

专知

20+阅读 · 2019年11月24日

基于深度学习的序列推荐系统：概念，算法与评估

基于深度学习的序列推荐系统：概念，算法与评估

专知

24+阅读 · 2019年6月6日

北大、清华、微软联合提出RepPoints，比边界框更好用的目标检测方法

北大、清华、微软联合提出RepPoints，比边界框更好用的目标检测方法

全球人工智能

13+阅读 · 2019年4月30日

对话系统近期进展

对话系统近期进展

专知

37+阅读 · 2019年3月23日

深度 | 推荐系统评估

深度 | 推荐系统评估

AI100

24+阅读 · 2019年3月16日

最新人机对话系统简略综述

最新人机对话系统简略综述

专知

26+阅读 · 2018年3月10日

赛尔原创 | 对话系统评价方法综述

赛尔原创 | 对话系统评价方法综述

哈工大SCIR

11+阅读 · 2017年11月13日

知识图谱 vs. 对话系统专题讨论 - PaperWeekly 社区

知识图谱 vs. 对话系统专题讨论 - PaperWeekly 社区

PaperWeekly

10+阅读 · 2017年10月18日

面向逆反射体检测的特征显著性研究

国家自然科学基金

0+阅读 · 2015年12月31日

网络本体质量及适应性的评估研究

国家自然科学基金

0+阅读 · 2015年12月31日

广义双随机相位编码系统中以QR码为载体的信息加密及无损恢复

国家自然科学基金

0+阅读 · 2015年12月31日

非确定型Web服务流程重组的可靠性验证技术

国家自然科学基金

1+阅读 · 2015年12月31日

基于数据挖掘和感知分析的非对称失真视觉质量评价模型研究

国家自然科学基金

0+阅读 · 2015年12月31日

移动社会网络中情境感知的多维个性化信任评价研究

国家自然科学基金

2+阅读 · 2015年12月31日

面向交互式问答的省略恢复技术研究

国家自然科学基金

5+阅读 · 2015年12月31日

支持软件可信演化的故障定位研究

国家自然科学基金

0+阅读 · 2014年12月31日

多语言大数据环境下的复杂网络行为分析、预测和干预

国家自然科学基金

4+阅读 · 2014年12月31日

具有可靠性增长的系统可靠性试验鉴定方法研究

国家自然科学基金

10+阅读 · 2013年12月31日

Principled Detection of Hallucinations in Large Language Models via Multiple Testing

Arxiv

0+阅读 · 4月28日

Hallucination Detection and Evaluation of Large Language Model

Arxiv

0+阅读 · 4月9日

FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification

Arxiv

0+阅读 · 4月7日

Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation

Arxiv

0+阅读 · 4月7日

VISTA: Visualization of Token Attribution via Efficient Analysis

Arxiv

0+阅读 · 4月2日

TRACE: Transparent Web Reliability Assessment with Contextual Explanations

Arxiv

0+阅读 · 4月2日

CoDeTT: A Context-Aware Decision Benchmark for Turn-Taking Evaluation

Arxiv

0+阅读 · 4月1日

MARCH: Multi-Agent Reinforced Self-Check for LLM Hallucination

Arxiv

0+阅读 · 3月25日

Multi-Agent Reasoning with Consistency Verification Improves Uncertainty Calibration in Medical MCQA

Arxiv

0+阅读 · 3月25日

A Hybrid Knowledge-Grounded Framework for Safety and Traceability in Prescription Verification

Arxiv

0+阅读 · 3月11日

VIP会员

文章信息

相关主题

最新内容

KDD 2026 | MixRAGRec：面向LLM推荐的混合专家KG-RAG框架

KDD 2026 | MixRAGRec：面向LLM推荐的混合专家KG-RAG框架

专知会员服务

1+阅读 · 55分钟前

综述 | 推理时控制：可信大语言模型的运行时治理全景

综述 | 推理时控制：可信大语言模型的运行时治理全景

专知会员服务

0+阅读 · 56分钟前

BES：让语言模型通过双向进化搜索自我改进

BES：让语言模型通过双向进化搜索自我改进

专知会员服务

3+阅读 · 5月30日

ICML 2026 | 揭开视觉语言模型计数瓶颈：看得到，却说不出

ICML 2026 | 揭开视觉语言模型计数瓶颈：看得到，却说不出

专知会员服务

4+阅读 · 5月30日

以色列-美国-伊朗战争中的无人机：关键要点

以色列-美国-伊朗战争中的无人机：关键要点

专知会员服务

4+阅读 · 5月30日

美以伊战争：首次人工智能战争——军事自主性困境

美以伊战争：首次人工智能战争——军事自主性困境

专知会员服务

5+阅读 · 5月30日

《Palantir任务保障性软件安全标准（MA-S2）》

《Palantir任务保障性软件安全标准（MA-S2）》

专知会员服务

14+阅读 · 5月30日

《美海军利用扩展现实增强知识流动研究》300页报告

《美海军利用扩展现实增强知识流动研究》300页报告

专知会员服务

7+阅读 · 5月30日

基于声学的无人机检测技术综述

基于声学的无人机检测技术综述

专知会员服务

8+阅读 · 5月30日

《当代混合战争分析框架：俄乌战争经验教训》

《当代混合战争分析框架：俄乌战争经验教训》

专知会员服务

8+阅读 · 5月30日

生成式AI基础小册子绪论解读：一条数学地基路线，178页pdf

生成式AI基础小册子绪论解读：一条数学地基路线，178页pdf

专知会员服务

11+阅读 · 5月29日

AutoScientists：自组织智能体团队驱动长期科学实验

AutoScientists：自组织智能体团队驱动长期科学实验

专知会员服务

6+阅读 · 5月29日

《阿利·伯克级驱逐舰的战损修理：桌面推演结果》报告

《阿利·伯克级驱逐舰的战损修理：桌面推演结果》报告

专知会员服务

6+阅读 · 5月29日

战略前沿人工智能的再思考（中文）

战略前沿人工智能的再思考（中文）

专知会员服务

8+阅读 · 5月29日

《量化地基防空系统间接效应的博弈论方法》

《量化地基防空系统间接效应的博弈论方法》

专知会员服务

6+阅读 · 5月29日

相关VIP内容

扭曲还是编造？视频大语言模型幻觉研究综述

扭曲还是编造？视频大语言模型幻觉研究综述

专知会员服务

14+阅读 · 4月15日

《深度伪造防御系统评估的系统性方法》

《深度伪造防御系统评估的系统性方法》

专知会员服务

14+阅读 · 3月16日

通用智能体评估的逻辑架构

通用智能体评估的逻辑架构

专知会员服务

22+阅读 · 2月28日

《缓解大语言模型（LLMs）幻觉：面向应用的检索增强生成（RAG）、推理与智能体系统综述》

《缓解大语言模型（LLMs）幻觉：面向应用的检索增强生成（RAG）、推理与智能体系统综述》

专知会员服务

24+阅读 · 2025年10月29日

通用人工智能：是什么？如何测试？如何实现？

通用人工智能：是什么？如何测试？如何实现？

专知会员服务

27+阅读 · 2024年6月19日

大型语言模型幻觉缓解技术的全面综述

大型语言模型幻觉缓解技术的全面综述

专知会员服务

72+阅读 · 2024年1月3日

UTC: 用于视觉对话的任务间对比学习的统一Transformer

UTC: 用于视觉对话的任务间对比学习的统一Transformer

专知会员服务

14+阅读 · 2022年5月4日

【TPAMI】从人机对抗提出视觉跟踪智能评估新方法，Global Instance Tracking: Locating Target More Like Humans

【TPAMI】从人机对抗提出视觉跟踪智能评估新方法，Global Instance Tracking: Locating Target More Like Humans

专知会员服务

22+阅读 · 2022年3月29日

语音识别:不同深度学习方法的综述，Speech Recognition: a review of the different deep learning approaches

语音识别:不同深度学习方法的综述，Speech Recognition: a review of the different deep learning approaches

专知会员服务

33+阅读 · 2022年3月13日

[SIGIR2021]可复现推荐系统评估的全面和严谨的框架

[SIGIR2021]可复现推荐系统评估的全面和严谨的框架

专知会员服务

22+阅读 · 2021年4月30日

热门VIP内容

开通专知VIP会员享更多权益服务

综述 | 推理时控制：可信大语言模型的运行时治理全景

ICML 2026 | 揭开视觉语言模型计数瓶颈：看得到，却说不出

KDD 2026 | MixRAGRec：面向LLM推荐的混合专家KG-RAG框架

BES：让语言模型通过双向进化搜索自我改进

相关资讯

异常检测（Anomaly Detection）综述

异常检测（Anomaly Detection）综述

极市平台

20+阅读 · 2020年10月24日

异常检测怎么做，试试孤立随机森林算法（附代码）

异常检测怎么做，试试孤立随机森林算法（附代码）

机器之心

16+阅读 · 2020年3月15日

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

专知

20+阅读 · 2019年11月24日

基于深度学习的序列推荐系统：概念，算法与评估

基于深度学习的序列推荐系统：概念，算法与评估

专知

24+阅读 · 2019年6月6日

北大、清华、微软联合提出RepPoints，比边界框更好用的目标检测方法

北大、清华、微软联合提出RepPoints，比边界框更好用的目标检测方法

全球人工智能

13+阅读 · 2019年4月30日

对话系统近期进展

对话系统近期进展

专知

37+阅读 · 2019年3月23日

深度 | 推荐系统评估

深度 | 推荐系统评估

AI100

24+阅读 · 2019年3月16日

最新人机对话系统简略综述

最新人机对话系统简略综述

专知

26+阅读 · 2018年3月10日

赛尔原创 | 对话系统评价方法综述

赛尔原创 | 对话系统评价方法综述

哈工大SCIR

11+阅读 · 2017年11月13日

知识图谱 vs. 对话系统专题讨论 - PaperWeekly 社区

知识图谱 vs. 对话系统专题讨论 - PaperWeekly 社区

PaperWeekly

10+阅读 · 2017年10月18日

相关论文

Principled Detection of Hallucinations in Large Language Models via Multiple Testing

Arxiv

0+阅读 · 4月28日

Hallucination Detection and Evaluation of Large Language Model

Arxiv

0+阅读 · 4月9日

FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification

Arxiv

0+阅读 · 4月7日

Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation

Arxiv

0+阅读 · 4月7日

VISTA: Visualization of Token Attribution via Efficient Analysis

Arxiv

0+阅读 · 4月2日

TRACE: Transparent Web Reliability Assessment with Contextual Explanations

Arxiv

0+阅读 · 4月2日

CoDeTT: A Context-Aware Decision Benchmark for Turn-Taking Evaluation

Arxiv

0+阅读 · 4月1日

MARCH: Multi-Agent Reinforced Self-Check for LLM Hallucination

Arxiv

0+阅读 · 3月25日

Multi-Agent Reasoning with Consistency Verification Improves Uncertainty Calibration in Medical MCQA

Arxiv

0+阅读 · 3月25日

A Hybrid Knowledge-Grounded Framework for Safety and Traceability in Prescription Verification

Arxiv

0+阅读 · 3月11日

相关基金

面向逆反射体检测的特征显著性研究

国家自然科学基金

0+阅读 · 2015年12月31日

网络本体质量及适应性的评估研究

国家自然科学基金

0+阅读 · 2015年12月31日

广义双随机相位编码系统中以QR码为载体的信息加密及无损恢复

国家自然科学基金

0+阅读 · 2015年12月31日

非确定型Web服务流程重组的可靠性验证技术

国家自然科学基金

1+阅读 · 2015年12月31日

基于数据挖掘和感知分析的非对称失真视觉质量评价模型研究

国家自然科学基金

0+阅读 · 2015年12月31日

移动社会网络中情境感知的多维个性化信任评价研究

国家自然科学基金

2+阅读 · 2015年12月31日

面向交互式问答的省略恢复技术研究

国家自然科学基金

5+阅读 · 2015年12月31日

支持软件可信演化的故障定位研究

国家自然科学基金

0+阅读 · 2014年12月31日

多语言大数据环境下的复杂网络行为分析、预测和干预

国家自然科学基金

4+阅读 · 2014年12月31日

具有可靠性增长的系统可靠性试验鉴定方法研究

国家自然科学基金

10+阅读 · 2013年12月31日

微信扫码咨询专知VIP会员