MindZero: Learning Online Mental Reasoning With Zero Annotations - 专知论文

会员服务 ·

0

标注 · 在线 · AI · 鲁棒 · 监督 ·

MindZero: Learning Online Mental Reasoning With Zero Annotations

翻译：MindZero: 零标注在线心智推理学习

Shunchi Zhang,Jin Lu,Chuanyang Jin,Yichao Zhou,Zhining Zhang,Tianmin Shu

from arxiv, ICML 2026. Website: https://scai.cs.jhu.edu/MindZero

Effective real-world assistance requires AI agents with robust Theory of Mind (ToM): inferring human mental states from their behavior. Despite recent advances, several key challenges remain, including (1) online inference with robust uncertainty updates over multiple hypotheses; (2) efficient reasoning suitable for real-time assistance; and (3) the lack of ground-truth mental state annotations in real-world domains. We address these challenges by introducing MindZero, a self-supervised reinforcement learning framework that trains multimodal large language models (MLLMs) for efficient and robust online mental reasoning. During training, the model is rewarded for generating mental state hypotheses that maximize the likelihood of observed actions estimated by a planner, similar to model-based ToM reasoning. This method thus eliminates the need for explicit mental state annotations. After training, MindZero internalizes model-based reasoning into fast single-pass inference. We evaluate MindZero against baselines across challenging mental reasoning and AI assistance tasks in gridworld and household domains. We found that LLMs alone are insufficient; model-based methods improve accuracy but are slow, costly, and limited by backbone MLLM capacity. In contrast, MindZero enhances MLLMs' intrinsic ToM ability and significantly outperforms model-based methods in both accuracy and efficiency, showing that mental reasoning can be effectively learned as a self-supervised skill.

翻译：有效的现实世界辅助需要具备强大心智理论（ToM）的AI智能体：即从人类行为中推断其心理状态的能力。尽管近期有所进展，但仍面临若干关键挑战，包括（1）对多种假设进行鲁棒不确定性更新的在线推理；（2）适用于实时辅助的高效推理；以及（3）现实领域中心智状态真实标注的缺失。我们通过引入MindZero应对这些挑战，这是一种自监督强化学习框架，用于训练多模态大语言模型（MLLMs）以实现高效且鲁棒的在线心智推理。训练过程中，模型因生成的心智状态假设能使规划器估计的观察动作似然最大化而获得奖励——这与基于模型的ToM推理类似。该方法因此消除了对显式心智状态标注的需求。训练完成后，MindZero将基于模型的推理内化为快速的单次前向推理。我们在网格世界和家庭领域的多项挑战性心智推理与AI辅助任务中，将MindZero与基线方法进行了对比评估。我们发现，仅靠LLM并不足够；基于模型的方法虽能提升准确率，但速度慢、成本高且受限于骨干MLLM的容量。相比之下，MindZero增强了MLLMs的固有ToM能力，在准确率和效率上均显著优于基于模型的方法，表明心智推理可作为一种自监督技能被有效习得。

0

相关内容

AI4Math？IJCAI2023最新《数学推理中的深度学习》教程，详述深度学习数学推理最新进展与未来展望，243页ppt

AI4Math？IJCAI2023最新《数学推理中的深度学习》教程，详述深度学习数学推理最新进展与未来展望，243页ppt

专知会员服务

57+阅读 · 2023年8月28日

知识推理如何做？GMU最新《知识增强的神经机器推理》综述，详述线性与隐形知识推理技术方法

知识推理如何做？GMU最新《知识增强的神经机器推理》综述，详述线性与隐形知识推理技术方法

专知会员服务

48+阅读 · 2023年2月8日

「可解释知识图谱推理」最新方法综述

「可解释知识图谱推理」最新方法综述

专知会员服务

89+阅读 · 2022年12月17日

推荐！《综述：人工智能的心智理论和元推理》美国陆军研究实验室2022最新21页报告

推荐！《综述：人工智能的心智理论和元推理》美国陆军研究实验室2022最新21页报告

专知会员服务

66+阅读 · 2022年9月26日

【佐治亚理工学院博士论文】《基于图神经网络的知识推理》

【佐治亚理工学院博士论文】《基于图神经网络的知识推理》

专知会员服务

89+阅读 · 2022年8月31日

《类比推理在视觉知识提取中的应用》美国空军研究实验室最新220页论文

《类比推理在视觉知识提取中的应用》美国空军研究实验室最新220页论文

专知会员服务

35+阅读 · 2022年8月26日

集大成者！经典书《知识表示学习》，1035页pdf系统性讲解人工智能知识表示与推理基础、算法与应用

集大成者！经典书《知识表示学习》，1035页pdf系统性讲解人工智能知识表示与推理基础、算法与应用

专知会员服务

156+阅读 · 2020年11月20日

【论文】用于推理的概率逻辑神经网络（Probabilistic Logic Neural Networks for Reasoning）

【论文】用于推理的概率逻辑神经网络（Probabilistic Logic Neural Networks for Reasoning）

专知会员服务

104+阅读 · 2019年12月30日

【华盛顿大学】知识建模+生成式推理，60页ppt，Cracking Commonsense Intelligence with Knowledge Modeling + Generative Reasoning

【华盛顿大学】知识建模+生成式推理，60页ppt，Cracking Commonsense Intelligence with Knowledge Modeling + Generative Reasoning

专知会员服务

54+阅读 · 2019年12月27日

【IJCAI 2019】人工智能中的认知推理（Epistemic reasoning in AI），法国雷恩François Schwarzentruber，Tristan Charrier

【IJCAI 2019】人工智能中的认知推理（Epistemic reasoning in AI），法国雷恩François Schwarzentruber，Tristan Charrier

专知会员服务

23+阅读 · 2019年8月10日

推荐！《用于兵棋推演和建模的人工智能》兰德、耶鲁大学2022最新16页论文

推荐！《用于兵棋推演和建模的人工智能》兰德、耶鲁大学2022最新16页论文

专知

54+阅读 · 2022年11月14日

会议交流 | 盘点知识图谱的10大热点趋势与实践探索——DataFunSummit 2022 知识图谱在线峰会

会议交流 | 盘点知识图谱的10大热点趋势与实践探索——DataFunSummit 2022 知识图谱在线峰会

开放知识图谱

13+阅读 · 2022年3月8日

基于知识图谱的问答系统

基于知识图谱的问答系统

PaperWeekly

21+阅读 · 2021年2月8日

【论文笔记】用于推荐的知识图注意力网络—KGAT

【论文笔记】用于推荐的知识图注意力网络—KGAT

专知

55+阅读 · 2019年10月21日

ADL108《知识图谱》开始报名了

ADL108《知识图谱》开始报名了

中国计算机学会

14+阅读 · 2019年10月8日

让智能体主动交互，DeepMind提出用元强化学习实现因果推理

让智能体主动交互，DeepMind提出用元强化学习实现因果推理

机器之心

17+阅读 · 2019年2月11日

图神经网络最近这么火，不妨看看我们精选的这七篇

图神经网络最近这么火，不妨看看我们精选的这七篇

人工智能前沿讲习班

37+阅读 · 2018年12月10日

DeepMind无监督表示学习重大突破：语音、图像、文本、强化学习全能冠军！

DeepMind无监督表示学习重大突破：语音、图像、文本、强化学习全能冠军！

新智元

12+阅读 · 2018年7月13日

推荐几个权威且免费的人工智能学习资源

推荐几个权威且免费的人工智能学习资源

深度学习世界

10+阅读 · 2018年5月2日

【论文推荐】最新6篇视觉问答（VQA）相关论文—目标推理、深度循环模型、可解释性、数据可视化、Triplet学习、基准

【论文推荐】最新6篇视觉问答（VQA）相关论文—目标推理、深度循环模型、可解释性、数据可视化、Triplet学习、基准

专知

15+阅读 · 2018年2月3日

基于虚拟现实的认知负荷与情绪干扰交互性分析关键技术研究

国家自然科学基金

1+阅读 · 2017年12月31日

面向海量高维数据的可深度结合的贝叶斯网学习与推理新方法研究

国家自然科学基金

6+阅读 · 2015年12月31日

主被动视角联合的细粒度行为识别

国家自然科学基金

1+阅读 · 2015年12月31日

逻辑等价算子在不确定性推理中的应用

国家自然科学基金

1+阅读 · 2015年12月31日

面向多用户行为的无线识别关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

心理与教育测量中项目反应时间数据的统计建模及其应用

国家自然科学基金

0+阅读 · 2015年12月31日

面向社交大数据的热点事件预测

国家自然科学基金

11+阅读 · 2015年12月31日

面向大数据的知识表示、推理、在线学习理论及应用研究

国家自然科学基金

12+阅读 · 2014年12月31日

线性时序关系下推理的概率计量化模型

国家自然科学基金

0+阅读 · 2014年12月31日

不确定性推理与语义网中知识表示的数学基础

国家自然科学基金

18+阅读 · 2012年12月31日

Learning to Decide with AI Assistance under Human-Alignment

Arxiv

0+阅读 · 6月16日

FinAcumen: Financial Multimodal Reasoning via Self-Evolving Experience Memory Harness

Arxiv

0+阅读 · 6月16日

A Causal Model of Theory of Mind in Conflict for Artificial Intelligence

Arxiv

0+阅读 · 6月15日

LectūraAgents: A Multi-Agent Framework for Adaptive Personalized AI-Assisted Learning and Embodied Teaching

Arxiv

0+阅读 · 6月15日

GroupToM-Bench: Benchmarking Group Theory of Mind and Nonlinear Social Emergence in MLLMs

Arxiv

0+阅读 · 6月15日

Claw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to User's Digital World

Arxiv

0+阅读 · 5月25日

MAS-Orchestra: Understanding and Improving Multi-Agent Reasoning Through Holistic Orchestration and Controlled Benchmarks

Arxiv

0+阅读 · 5月21日

Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks

Arxiv

0+阅读 · 5月18日

EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents

Arxiv

0+阅读 · 5月15日

Asynchronous Reasoning: Training-Free Interactive Thinking LLMs

Arxiv

0+阅读 · 5月13日

VIP会员

文章信息

相关主题

最新内容

《曝光下的战争：战场过滤与乌克兰军事选择的窄化》

《曝光下的战争：战场过滤与乌克兰军事选择的窄化》

专知会员服务

2+阅读 · 今天7:13

俄乌无人机战争的六大启示

俄乌无人机战争的六大启示

专知会员服务

4+阅读 · 今天7:07

《无人机空中监控：通信实验洞察》

《无人机空中监控：通信实验洞察》

专知会员服务

3+阅读 · 今天7:05

《无全球定位系统及通信拒止环境下用于地面目标防护的分布式无人机蜂群》（含代码）

《无全球定位系统及通信拒止环境下用于地面目标防护的分布式无人机蜂群》（含代码）

专知会员服务

3+阅读 · 今天6:59

从采集到决策：美军视角下的战术情报范式重构

从采集到决策：美军视角下的战术情报范式重构

专知会员服务

12+阅读 · 8月2日

乌克兰“德尔塔”系统揭示无人机、数据与领导力如何重塑现代安全格局

乌克兰“德尔塔”系统揭示无人机、数据与领导力如何重塑现代安全格局

专知会员服务

5+阅读 · 8月2日

大规模作战中的参谋流程：作为联合兵种作战组成部分的目标锁定

大规模作战中的参谋流程：作为联合兵种作战组成部分的目标锁定

专知会员服务

10+阅读 · 8月2日

《北约概念开发与实验（CD&E）手册：概念开发者工具箱》100页手册

《北约概念开发与实验（CD&E）手册：概念开发者工具箱》100页手册

专知会员服务

12+阅读 · 8月2日

《履带式无人地面战车技术发展现状》

《履带式无人地面战车技术发展现状》

专知会员服务

6+阅读 · 8月2日

《美国空军B-2“幽灵”隐身轰炸机系统工程案例研究》117页

《美国空军B-2“幽灵”隐身轰炸机系统工程案例研究》117页

专知会员服务

10+阅读 · 8月1日

隐身技术前沿综述：物理机理、工程实践与战略展望

隐身技术前沿综述：物理机理、工程实践与战略展望

专知会员服务

8+阅读 · 8月1日

《多变海洋环境下无人水面艇与自主水下机器人对接的最优路径规划》

《多变海洋环境下无人水面艇与自主水下机器人对接的最优路径规划》

专知会员服务

9+阅读 · 8月1日

《以机反机：基于无人机载麦克风的空中周界入侵检测》

《以机反机：基于无人机载麦克风的空中周界入侵检测》

专知会员服务

8+阅读 · 8月1日

《无人机脆弱性利用：网络空间力量的新域》

《无人机脆弱性利用：网络空间力量的新域》

专知会员服务

6+阅读 · 8月1日

美空军如何将人工智能从战场部署至后方机关

美空军如何将人工智能从战场部署至后方机关

专知会员服务

13+阅读 · 7月31日

相关VIP内容

AI4Math？IJCAI2023最新《数学推理中的深度学习》教程，详述深度学习数学推理最新进展与未来展望，243页ppt

AI4Math？IJCAI2023最新《数学推理中的深度学习》教程，详述深度学习数学推理最新进展与未来展望，243页ppt

专知会员服务

57+阅读 · 2023年8月28日

知识推理如何做？GMU最新《知识增强的神经机器推理》综述，详述线性与隐形知识推理技术方法

知识推理如何做？GMU最新《知识增强的神经机器推理》综述，详述线性与隐形知识推理技术方法

专知会员服务

48+阅读 · 2023年2月8日

「可解释知识图谱推理」最新方法综述

「可解释知识图谱推理」最新方法综述

专知会员服务

89+阅读 · 2022年12月17日

推荐！《综述：人工智能的心智理论和元推理》美国陆军研究实验室2022最新21页报告

推荐！《综述：人工智能的心智理论和元推理》美国陆军研究实验室2022最新21页报告

专知会员服务

66+阅读 · 2022年9月26日

【佐治亚理工学院博士论文】《基于图神经网络的知识推理》

【佐治亚理工学院博士论文】《基于图神经网络的知识推理》

专知会员服务

89+阅读 · 2022年8月31日

《类比推理在视觉知识提取中的应用》美国空军研究实验室最新220页论文

《类比推理在视觉知识提取中的应用》美国空军研究实验室最新220页论文

专知会员服务

35+阅读 · 2022年8月26日

集大成者！经典书《知识表示学习》，1035页pdf系统性讲解人工智能知识表示与推理基础、算法与应用

集大成者！经典书《知识表示学习》，1035页pdf系统性讲解人工智能知识表示与推理基础、算法与应用

专知会员服务

156+阅读 · 2020年11月20日

【论文】用于推理的概率逻辑神经网络（Probabilistic Logic Neural Networks for Reasoning）

【论文】用于推理的概率逻辑神经网络（Probabilistic Logic Neural Networks for Reasoning）

专知会员服务

104+阅读 · 2019年12月30日

【华盛顿大学】知识建模+生成式推理，60页ppt，Cracking Commonsense Intelligence with Knowledge Modeling + Generative Reasoning

【华盛顿大学】知识建模+生成式推理，60页ppt，Cracking Commonsense Intelligence with Knowledge Modeling + Generative Reasoning

专知会员服务

54+阅读 · 2019年12月27日

【IJCAI 2019】人工智能中的认知推理（Epistemic reasoning in AI），法国雷恩François Schwarzentruber，Tristan Charrier

【IJCAI 2019】人工智能中的认知推理（Epistemic reasoning in AI），法国雷恩François Schwarzentruber，Tristan Charrier

专知会员服务

23+阅读 · 2019年8月10日

热门VIP内容

开通专知VIP会员享更多权益服务

俄乌无人机战争的六大启示

《无全球定位系统及通信拒止环境下用于地面目标防护的分布式无人机蜂群》（含代码）

《曝光下的战争：战场过滤与乌克兰军事选择的窄化》

《无人机空中监控：通信实验洞察》

相关资讯

推荐！《用于兵棋推演和建模的人工智能》兰德、耶鲁大学2022最新16页论文

推荐！《用于兵棋推演和建模的人工智能》兰德、耶鲁大学2022最新16页论文

专知

54+阅读 · 2022年11月14日

会议交流 | 盘点知识图谱的10大热点趋势与实践探索——DataFunSummit 2022 知识图谱在线峰会

会议交流 | 盘点知识图谱的10大热点趋势与实践探索——DataFunSummit 2022 知识图谱在线峰会

开放知识图谱

13+阅读 · 2022年3月8日

基于知识图谱的问答系统

基于知识图谱的问答系统

PaperWeekly

21+阅读 · 2021年2月8日

【论文笔记】用于推荐的知识图注意力网络—KGAT

【论文笔记】用于推荐的知识图注意力网络—KGAT

专知

55+阅读 · 2019年10月21日

ADL108《知识图谱》开始报名了

ADL108《知识图谱》开始报名了

中国计算机学会

14+阅读 · 2019年10月8日

让智能体主动交互，DeepMind提出用元强化学习实现因果推理

让智能体主动交互，DeepMind提出用元强化学习实现因果推理

机器之心

17+阅读 · 2019年2月11日

图神经网络最近这么火，不妨看看我们精选的这七篇

图神经网络最近这么火，不妨看看我们精选的这七篇

人工智能前沿讲习班

37+阅读 · 2018年12月10日

DeepMind无监督表示学习重大突破：语音、图像、文本、强化学习全能冠军！

DeepMind无监督表示学习重大突破：语音、图像、文本、强化学习全能冠军！

新智元

12+阅读 · 2018年7月13日

推荐几个权威且免费的人工智能学习资源

推荐几个权威且免费的人工智能学习资源

深度学习世界

10+阅读 · 2018年5月2日

【论文推荐】最新6篇视觉问答（VQA）相关论文—目标推理、深度循环模型、可解释性、数据可视化、Triplet学习、基准

【论文推荐】最新6篇视觉问答（VQA）相关论文—目标推理、深度循环模型、可解释性、数据可视化、Triplet学习、基准

专知

15+阅读 · 2018年2月3日

相关论文

Learning to Decide with AI Assistance under Human-Alignment

Arxiv

0+阅读 · 6月16日

FinAcumen: Financial Multimodal Reasoning via Self-Evolving Experience Memory Harness

Arxiv

0+阅读 · 6月16日

A Causal Model of Theory of Mind in Conflict for Artificial Intelligence

Arxiv

0+阅读 · 6月15日

LectūraAgents: A Multi-Agent Framework for Adaptive Personalized AI-Assisted Learning and Embodied Teaching

Arxiv

0+阅读 · 6月15日

GroupToM-Bench: Benchmarking Group Theory of Mind and Nonlinear Social Emergence in MLLMs

Arxiv

0+阅读 · 6月15日

Claw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to User's Digital World

Arxiv

0+阅读 · 5月25日

MAS-Orchestra: Understanding and Improving Multi-Agent Reasoning Through Holistic Orchestration and Controlled Benchmarks

Arxiv

0+阅读 · 5月21日

Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks

Arxiv

0+阅读 · 5月18日

EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents

Arxiv

0+阅读 · 5月15日

Asynchronous Reasoning: Training-Free Interactive Thinking LLMs

Arxiv

0+阅读 · 5月13日

相关基金

基于虚拟现实的认知负荷与情绪干扰交互性分析关键技术研究

国家自然科学基金

1+阅读 · 2017年12月31日

面向海量高维数据的可深度结合的贝叶斯网学习与推理新方法研究

国家自然科学基金

6+阅读 · 2015年12月31日

主被动视角联合的细粒度行为识别

国家自然科学基金

1+阅读 · 2015年12月31日

逻辑等价算子在不确定性推理中的应用

国家自然科学基金

1+阅读 · 2015年12月31日

面向多用户行为的无线识别关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

心理与教育测量中项目反应时间数据的统计建模及其应用

国家自然科学基金

0+阅读 · 2015年12月31日

面向社交大数据的热点事件预测

国家自然科学基金

11+阅读 · 2015年12月31日

面向大数据的知识表示、推理、在线学习理论及应用研究

国家自然科学基金

12+阅读 · 2014年12月31日

线性时序关系下推理的概率计量化模型

国家自然科学基金

0+阅读 · 2014年12月31日

不确定性推理与语义网中知识表示的数学基础

国家自然科学基金

18+阅读 · 2012年12月31日

微信扫码咨询专知VIP会员