AutoToM: Scaling Model-based Mental Inference via Automated Agent Modeling - 专知论文

会员服务 ·

0

推断 · 自动化 · 智能体 · 体模 · 稳健 ·

AutoToM: Scaling Model-based Mental Inference via Automated Agent Modeling

翻译：AutoToM：通过自动化智能体建模实现基于模型的心理推断规模化

Zhining Zhang,Chuanyang Jin,Mung Yao Jia,Shunchi Zhang,Tianmin Shu

from arxiv, NeurIPS 2025 (Spotlight). 42 pages, 11 figures, 15 tables. Website at https://chuanyangjin.com/AutoToM/

Theory of Mind (ToM), the ability to understand people's minds based on their behavior, is key to developing socially intelligent agents. Current approaches to ToM reasoning either rely on prompting Large Language Models (LLMs), which are prone to systematic errors, or use handcrafted, rigid agent models for model-based inference, which are more robust but fail to generalize across domains. In this work, we introduce AutoToM, an automated agent modeling method for scalable, robust, and interpretable mental inference. Given a ToM problem, AutoToM first proposes an initial agent model and then performs automated Bayesian inverse planning based on this model, leveraging an LLM backend. Guided by inference uncertainty, it iteratively refines the model by introducing additional mental variables and/or incorporating more timesteps in the context. Across five diverse benchmarks, AutoToM outperforms existing ToM methods and even large reasoning models. Additionally, we show that AutoToM can produce human-like confidence estimates and enable online mental inference for embodied decision-making.

翻译：心理理论（Theory of Mind，ToM）——即通过观察行为理解他人心理状态的能力——是发展社会智能体的关键。当前的心理理论推理方法要么依赖于提示大型语言模型（LLMs），这类方法容易产生系统性错误；要么采用手工构建的、僵化的智能体模型进行基于模型的推断，这类方法虽然更稳健但难以跨领域泛化。本研究提出了AutoToM，一种用于实现可扩展、稳健且可解释的心理推断的自动化智能体建模方法。给定一个心理理论问题，AutoToM首先提出一个初始智能体模型，然后基于该模型并利用大型语言模型后端进行自动化贝叶斯逆向规划。在推断不确定性的指导下，该方法通过引入额外的心理变量和/或在上下文中纳入更多时间步长来迭代优化模型。在五个多样化的基准测试中，AutoToM的表现超越了现有的心理理论方法，甚至优于大型推理模型。此外，我们展示了AutoToM能够生成类人的置信度估计，并能为具身决策实现在线心理推断。

0

相关内容

迈向个性化大语言模型驱动的智能体：基础、评估与未来方向

迈向个性化大语言模型驱动的智能体：基础、评估与未来方向

专知会员服务

26+阅读 · 2月27日

基于大语言模型智能体的社会认知模拟

基于大语言模型智能体的社会认知模拟

专知会员服务

17+阅读 · 2月22日

大语言模型的智能体化推理

大语言模型的智能体化推理

专知会员服务

33+阅读 · 1月21日

具身智能中的心理世界建模：深度综述

具身智能中的心理世界建模：深度综述

专知会员服务

33+阅读 · 1月10日

迈向智能体系统规模化的科学

迈向智能体系统规模化的科学

专知会员服务

21+阅读 · 2025年12月12日

基于大语言模型的智能体易产生幻觉：分类体系、方法与未来方向综述

基于大语言模型的智能体易产生幻觉：分类体系、方法与未来方向综述

专知会员服务

31+阅读 · 2025年9月27日

基于大模型的智能体中由自主性引发的安全风险综述

基于大模型的智能体中由自主性引发的安全风险综述

专知会员服务

18+阅读 · 2025年7月1日

大语言模型推理前沿综述：推理扩展、推理学习与智能体系统

大语言模型推理前沿综述：推理扩展、推理学习与智能体系统

专知会员服务

38+阅读 · 2025年4月20日

大型语言模型推理前沿综述：推理扩展、学习推理与自主智能系统

大型语言模型推理前沿综述：推理扩展、学习推理与自主智能系统

专知会员服务

37+阅读 · 2025年4月7日

推荐！《综述：人工智能的心智理论和元推理》美国陆军研究实验室2022最新21页报告

推荐！《综述：人工智能的心智理论和元推理》美国陆军研究实验室2022最新21页报告

专知会员服务

65+阅读 · 2022年9月26日

ChatGPT大模型如何做科学研究? CMU提出《大模型智能体系统》，高推理展现出大型语言模型的新兴自主科学研究能力

ChatGPT大模型如何做科学研究? CMU提出《大模型智能体系统》，高推理展现出大型语言模型的新兴自主科学研究能力

专知

17+阅读 · 2023年4月12日

面向多智能体博弈对抗的对手建模框架

面向多智能体博弈对抗的对手建模框架

专知

18+阅读 · 2022年9月28日

数据驱动的态势认知技术及发展思考

数据驱动的态势认知技术及发展思考

专知

18+阅读 · 2022年7月12日

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

专知

20+阅读 · 2019年11月24日

让人工智能有情感的秘诀！清华权威报告看透情感计算【附下载】

让人工智能有情感的秘诀！清华权威报告看透情感计算【附下载】

人工智能学家

21+阅读 · 2019年10月7日

MSRA开源基于注意力机制的全新推荐模型，融合用户长短期偏好

MSRA开源基于注意力机制的全新推荐模型，融合用户长短期偏好

AI前线

15+阅读 · 2019年9月22日

让智能体主动交互，DeepMind提出用元强化学习实现因果推理

让智能体主动交互，DeepMind提出用元强化学习实现因果推理

机器之心

17+阅读 · 2019年2月11日

入门 | 什么是自注意力机制？

入门 | 什么是自注意力机制？

机器之心

17+阅读 · 2018年8月19日

自然语言处理中的自注意力机制（Self-Attention Mechanism）

自然语言处理中的自注意力机制（Self-Attention Mechanism）

PaperWeekly

22+阅读 · 2018年3月28日

群体智能：新一代人工智能的重要方向

群体智能：新一代人工智能的重要方向

走向智能论坛

12+阅读 · 2017年8月16日

动态社会网络中异质交互观点演化动力学建模及分析研究

国家自然科学基金

1+阅读 · 2016年12月31日

顿悟体验的心理机制和动态神经基础

国家自然科学基金

0+阅读 · 2015年12月31日

人体行为识别的时空耦合随机图模型及其高效推理算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于人脸表情、身体姿态和语音的多模态情感识别方法研究

国家自然科学基金

10+阅读 · 2015年12月31日

心理与教育测量中项目反应时间数据的统计建模及其应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于多通道深度卷积神经网络的人体行为分析研究

国家自然科学基金

6+阅读 · 2015年12月31日

融合认知机理的概率图模型表情识别方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

线性时序关系下推理的概率计量化模型

国家自然科学基金

0+阅读 · 2014年12月31日

新型统计模型在精神疾病的基因、脑影像和行为数据整合中的应用

国家自然科学基金

0+阅读 · 2014年12月31日

大脑影像标准化的优化模型与算法研究

国家自然科学基金

0+阅读 · 2014年12月31日

AdaptEvolve: Improving Efficiency of Evolutionary AI Agents through Adaptive Model Selection

Arxiv

0+阅读 · 2月12日

Situated, Dynamic, and Subjective: Envisioning the Design of Theory-of-Mind-Enabled Everyday AI with Industry Practitioners

Arxiv

0+阅读 · 2月11日

To Think or Not To Think, That is The Question for Large Reasoning Models in Theory of Mind Tasks

Arxiv

0+阅读 · 2月11日

A Behavioural and Representational Evaluation of Goal-Directedness in Language Model Agents

Arxiv

0+阅读 · 2月9日

PhysicsAgentABM: Physics-Guided Generative Agent-Based Modeling

Arxiv

0+阅读 · 2月6日

PhysicsAgentABM: Physics-Guided Generative Agent-Based Modeling

Arxiv

0+阅读 · 2月5日

Self-Consolidation for Self-Evolving Agents

Arxiv

0+阅读 · 2月2日

Spatial-Agent: Agentic Geo-spatial Reasoning with Scientific Core Concepts

Arxiv

0+阅读 · 1月23日

Agentic Artificial Intelligence (AI): Architectures, Taxonomies, and Evaluation of Large Language Model Agents

Arxiv

0+阅读 · 1月18日

Inferring Latent Intentions: Attributional Natural Language Inference in LLM Agents

Arxiv

0+阅读 · 1月13日

VIP会员

文章信息

相关主题

最新内容

《高超音速武器：一项再度兴起的技术》120页slides

《高超音速武器：一项再度兴起的技术》120页slides

专知会员服务

1+阅读 · 13分钟前

无人机蜂群建模与仿真方法

无人机蜂群建模与仿真方法

专知会员服务

1+阅读 · 38分钟前

《重建美国空中力量：为应对同级冲突平衡空军战斗力量》美智库报告

《重建美国空中力量：为应对同级冲突平衡空军战斗力量》美智库报告

专知会员服务

1+阅读 · 51分钟前

《量化反无人机系统对抗无人机蜂群效能的创新方法》

《量化反无人机系统对抗无人机蜂群效能的创新方法》

专知会员服务

2+阅读 · 53分钟前

澳大利亚发布《国防战略（2026年）》

澳大利亚发布《国防战略（2026年）》

专知会员服务

0+阅读 · 今天13:42

【CMU博士论文】迈向基于基础先验的 4D 感知研究

【CMU博士论文】迈向基于基础先验的 4D 感知研究

专知会员服务

0+阅读 · 刚刚

大语言模型智能体中的外显化机制：记忆、技能、协议与评测基准工程综述

大语言模型智能体中的外显化机制：记忆、技能、协议与评测基准工程综述

专知会员服务

0+阅读 · 今天13:43

全球高超音速武器最新发展趋势

全球高超音速武器最新发展趋势

专知会员服务

1+阅读 · 今天13:17

《利用大语言模型增强多域作战兵棋推演》（报告）

《利用大语言模型增强多域作战兵棋推演》（报告）

专知会员服务

10+阅读 · 4月18日

《增强准备状态与战备水平：态势感知与数据驱动决策》报告

《增强准备状态与战备水平：态势感知与数据驱动决策》报告

专知会员服务

9+阅读 · 4月18日

中文版《可靠定位、导航与授时 (APNT)：美军相关研发项目》报告

中文版《可靠定位、导航与授时 (APNT)：美军相关研发项目》报告

专知会员服务

8+阅读 · 4月18日

《自主武器系统人类-AI指挥控制中的动态管理》（2026最新450页）

《自主武器系统人类-AI指挥控制中的动态管理》（2026最新450页）

专知会员服务

14+阅读 · 4月18日

美智库《实现空军战斗出动架次生成能力：对目标、差距、障碍与解决方案的审视》（报告）

美智库《实现空军战斗出动架次生成能力：对目标、差距、障碍与解决方案的审视》（报告）

专知会员服务

7+阅读 · 4月18日

《大规模作战行动中争夺情报优势：情报与电子战营-下一代角色探析》（报告）

《大规模作战行动中争夺情报优势：情报与电子战营-下一代角色探析》（报告）

专知会员服务

9+阅读 · 4月18日

人工智能在战场行动中的演进及伊朗案例

人工智能在战场行动中的演进及伊朗案例

专知会员服务

7+阅读 · 4月18日

相关VIP内容

迈向个性化大语言模型驱动的智能体：基础、评估与未来方向

迈向个性化大语言模型驱动的智能体：基础、评估与未来方向

专知会员服务

26+阅读 · 2月27日

基于大语言模型智能体的社会认知模拟

基于大语言模型智能体的社会认知模拟

专知会员服务

17+阅读 · 2月22日

大语言模型的智能体化推理

大语言模型的智能体化推理

专知会员服务

33+阅读 · 1月21日

具身智能中的心理世界建模：深度综述

具身智能中的心理世界建模：深度综述

专知会员服务

33+阅读 · 1月10日

迈向智能体系统规模化的科学

迈向智能体系统规模化的科学

专知会员服务

21+阅读 · 2025年12月12日

基于大语言模型的智能体易产生幻觉：分类体系、方法与未来方向综述

基于大语言模型的智能体易产生幻觉：分类体系、方法与未来方向综述

专知会员服务

31+阅读 · 2025年9月27日

基于大模型的智能体中由自主性引发的安全风险综述

基于大模型的智能体中由自主性引发的安全风险综述

专知会员服务

18+阅读 · 2025年7月1日

大语言模型推理前沿综述：推理扩展、推理学习与智能体系统

大语言模型推理前沿综述：推理扩展、推理学习与智能体系统

专知会员服务

38+阅读 · 2025年4月20日

大型语言模型推理前沿综述：推理扩展、学习推理与自主智能系统

大型语言模型推理前沿综述：推理扩展、学习推理与自主智能系统

专知会员服务

37+阅读 · 2025年4月7日

推荐！《综述：人工智能的心智理论和元推理》美国陆军研究实验室2022最新21页报告

推荐！《综述：人工智能的心智理论和元推理》美国陆军研究实验室2022最新21页报告

专知会员服务

65+阅读 · 2022年9月26日

热门VIP内容

开通专知VIP会员享更多权益服务

无人机蜂群建模与仿真方法

《量化反无人机系统对抗无人机蜂群效能的创新方法》

《高超音速武器：一项再度兴起的技术》120页slides

《重建美国空中力量：为应对同级冲突平衡空军战斗力量》美智库报告

相关资讯

ChatGPT大模型如何做科学研究? CMU提出《大模型智能体系统》，高推理展现出大型语言模型的新兴自主科学研究能力

ChatGPT大模型如何做科学研究? CMU提出《大模型智能体系统》，高推理展现出大型语言模型的新兴自主科学研究能力

专知

17+阅读 · 2023年4月12日

面向多智能体博弈对抗的对手建模框架

面向多智能体博弈对抗的对手建模框架

专知

18+阅读 · 2022年9月28日

数据驱动的态势认知技术及发展思考

数据驱动的态势认知技术及发展思考

专知

18+阅读 · 2022年7月12日

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

专知

20+阅读 · 2019年11月24日

让人工智能有情感的秘诀！清华权威报告看透情感计算【附下载】

让人工智能有情感的秘诀！清华权威报告看透情感计算【附下载】

人工智能学家

21+阅读 · 2019年10月7日

MSRA开源基于注意力机制的全新推荐模型，融合用户长短期偏好

MSRA开源基于注意力机制的全新推荐模型，融合用户长短期偏好

AI前线

15+阅读 · 2019年9月22日

让智能体主动交互，DeepMind提出用元强化学习实现因果推理

让智能体主动交互，DeepMind提出用元强化学习实现因果推理

机器之心

17+阅读 · 2019年2月11日

入门 | 什么是自注意力机制？

入门 | 什么是自注意力机制？

机器之心

17+阅读 · 2018年8月19日

自然语言处理中的自注意力机制（Self-Attention Mechanism）

自然语言处理中的自注意力机制（Self-Attention Mechanism）

PaperWeekly

22+阅读 · 2018年3月28日

群体智能：新一代人工智能的重要方向

群体智能：新一代人工智能的重要方向

走向智能论坛

12+阅读 · 2017年8月16日

相关论文

AdaptEvolve: Improving Efficiency of Evolutionary AI Agents through Adaptive Model Selection

Arxiv

0+阅读 · 2月12日

Situated, Dynamic, and Subjective: Envisioning the Design of Theory-of-Mind-Enabled Everyday AI with Industry Practitioners

Arxiv

0+阅读 · 2月11日

To Think or Not To Think, That is The Question for Large Reasoning Models in Theory of Mind Tasks

Arxiv

0+阅读 · 2月11日

A Behavioural and Representational Evaluation of Goal-Directedness in Language Model Agents

Arxiv

0+阅读 · 2月9日

PhysicsAgentABM: Physics-Guided Generative Agent-Based Modeling

Arxiv

0+阅读 · 2月6日

PhysicsAgentABM: Physics-Guided Generative Agent-Based Modeling

Arxiv

0+阅读 · 2月5日

Self-Consolidation for Self-Evolving Agents

Arxiv

0+阅读 · 2月2日

Spatial-Agent: Agentic Geo-spatial Reasoning with Scientific Core Concepts

Arxiv

0+阅读 · 1月23日

Agentic Artificial Intelligence (AI): Architectures, Taxonomies, and Evaluation of Large Language Model Agents

Arxiv

0+阅读 · 1月18日

Inferring Latent Intentions: Attributional Natural Language Inference in LLM Agents

Arxiv

0+阅读 · 1月13日

相关基金

动态社会网络中异质交互观点演化动力学建模及分析研究

国家自然科学基金

1+阅读 · 2016年12月31日

顿悟体验的心理机制和动态神经基础

国家自然科学基金

0+阅读 · 2015年12月31日

人体行为识别的时空耦合随机图模型及其高效推理算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于人脸表情、身体姿态和语音的多模态情感识别方法研究

国家自然科学基金

10+阅读 · 2015年12月31日

心理与教育测量中项目反应时间数据的统计建模及其应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于多通道深度卷积神经网络的人体行为分析研究

国家自然科学基金

6+阅读 · 2015年12月31日

融合认知机理的概率图模型表情识别方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

线性时序关系下推理的概率计量化模型

国家自然科学基金

0+阅读 · 2014年12月31日

新型统计模型在精神疾病的基因、脑影像和行为数据整合中的应用

国家自然科学基金

0+阅读 · 2014年12月31日

大脑影像标准化的优化模型与算法研究

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员