【CVPR2026教程】从感知到模拟：多模态推理中世界模型的涌现 - 专知VIP

会员服务 ·

4

CVPR 2026 · 多模态推理 · 世界模型 ·

【CVPR2026教程】从感知到模拟：多模态推理中世界模型的涌现

专知会员服务

专知，提供专业可信的知识分发服务，让认知协作更快更好！

世界模型正在迅速重塑人工智能，从被动感知世界的系统演变为能够在其内部进行模拟、推理和规划的引擎。本教程将探讨生成建模、自监督学习及多模态架构的最新进展如何使机器超越识别与预测，迈向心理模拟、反事实推理和决策制定。我们将剖析世界模型的基础原理，从视觉与多模态数据中学习动态的方法，以及规划与推理的整合机制。教程重点阐述视频生成、扩散模型、离散表示和具身智能之间的关联，同时讨论基础构建、因果性、物理一致性及评估等关键挑战。本教程面向研究人员、从业者和学生，旨在为构建对环境进行推理而非仅仅解释环境的人工智能系统提供概念性洞见与实践视角。我们的线下教程吸引了超过300名参与者。 14:00 - 14:10

开幕致辞：动机与概述 蔡宇钧 (Yujun Cai) 14:10 - 14:40

特邀报告：从思维链到状态链——为何有能力的模型必须反向预测世界 丹·孔德拉图克 (Dan Kondratyuk) 14:40 - 15:10

特邀报告：Genie 3 —— 生成交互式逼真世界 齐航 (Hang Qi) 15:10 - 15:50

特邀报告：面向物理一致的高效视觉世界模型 蔡剑飞 (Jianfei Cai) 15:50 - 16:20

特邀报告：VideoPhy —— 视频生成中的物理常识评估 张凯崴 (Kai-Wei Chang) 16:20 - 16:50

特邀报告：Cosmos 3 —— 面向物理AI的全能世界基础模型 刘明宇 (Ming-Yu Liu) 16:50 - 17:25

特邀报告：走向世界模型 —— 几何、视图合成与视觉推理 杨明轩 (Ming-Hsuan Yang)

成为VIP会员查看完整内容

7

相关内容

CVPR 2026

CVPR 2026教程：统一多模态模型走向收敛之路

CVPR 2026教程：统一多模态模型走向收敛之路

专知会员服务

10+阅读 · 6月8日

【综述】世界模型：架构、方法、推理与应用全景

【综述】世界模型：架构、方法、推理与应用全景

专知会员服务

23+阅读 · 6月2日

从感知到认知：多模态大语言模型中视觉-语言交互推理综述

从感知到认知：多模态大语言模型中视觉-语言交互推理综述

专知会员服务

31+阅读 · 2025年10月1日

从二维到三维认知：通用世界模型简要综述

从二维到三维认知：通用世界模型简要综述

专知会员服务

30+阅读 · 2025年6月26日

感知、推理、思考与规划：大型多模态推理模型综述

感知、推理、思考与规划：大型多模态推理模型综述

专知会员服务

40+阅读 · 2025年5月10日

【CVPR2024教程】从多模态大语言模型到人类水平的AI：模态、指令、推理、效率及其他，200多页ppt

【CVPR2024教程】从多模态大语言模型到人类水平的AI：模态、指令、推理、效率及其他，200多页ppt

专知会员服务

60+阅读 · 2024年6月21日

CVPR2024最新《从高维数据中学习深度低维模型：从理论到实践》教程

CVPR2024最新《从高维数据中学习深度低维模型：从理论到实践》教程

专知会员服务

45+阅读 · 2024年6月19日

【剑桥大学博士论文】面向计算机视觉的神经世界模型，211页pdf

【剑桥大学博士论文】面向计算机视觉的神经世界模型，211页pdf

专知会员服务

64+阅读 · 2023年2月5日

【CVPR2022】以人为中心感知的多模态预训练

【CVPR2022】以人为中心感知的多模态预训练

专知会员服务

30+阅读 · 2022年3月28日

【NLPCC2020】多模态知识图谱构建、推理与挑战，东南大学王萌博士

专知会员服务

149+阅读 · 2020年10月21日

【ChatGPT系列报告】人工智能行业专题报告：多模态AI研究框架，17页ppt

【ChatGPT系列报告】人工智能行业专题报告：多模态AI研究框架，17页ppt

专知

23+阅读 · 2023年4月8日

超50篇论文串联起从VQA到多模态预训练大模型的前世今生—Part 1

超50篇论文串联起从VQA到多模态预训练大模型的前世今生—Part 1

PaperWeekly

16+阅读 · 2022年4月29日

多模态深度学习综述，18页pdf

多模态深度学习综述，18页pdf

专知

51+阅读 · 2020年3月29日

【IEEE Fellow何晓东&邓力】多模态智能论文综述：表示学习，信息融合与应用，259篇文献带你了解AI热点技

【IEEE Fellow何晓东&邓力】多模态智能论文综述：表示学习，信息融合与应用，259篇文献带你了解AI热点技

专知

53+阅读 · 2019年12月1日

【CMU教程】高效大规模机器学习训练，198页PDF带你概览领域前沿进展

【CMU教程】高效大规模机器学习训练，198页PDF带你概览领域前沿进展

专知

14+阅读 · 2019年10月9日

专访俞栋：多模态是迈向通用人工智能的重要方向

专访俞栋：多模态是迈向通用人工智能的重要方向

AI科技评论

27+阅读 · 2019年9月9日

【CVPR2019教程】视频理解中的图表示学习

【CVPR2019教程】视频理解中的图表示学习

专知

43+阅读 · 2019年6月20日

152页简明《计算机视觉》入门教程，带你回顾CV发展脉络（附下载）

152页简明《计算机视觉》入门教程，带你回顾CV发展脉络（附下载）

专知

32+阅读 · 2019年1月6日

这可能是「多模态机器学习」最通俗易懂的介绍

这可能是「多模态机器学习」最通俗易懂的介绍

计算机视觉life

113+阅读 · 2018年12月20日

【CVPR2018】如何增强Attention Model的推理能力

【CVPR2018】如何增强Attention Model的推理能力

专知

15+阅读 · 2018年7月2日

循环神经网络多模态深度模型联想记忆功能研究

国家自然科学基金

6+阅读 · 2017年12月31日

多层动态网络的建模、群体动力学分析与控制

国家自然科学基金

3+阅读 · 2015年12月31日

基于人脸表情、身体姿态和语音的多模态情感识别方法研究

国家自然科学基金

10+阅读 · 2015年12月31日

基于多模态信息集成的组合预测模型及其应用研究

国家自然科学基金

6+阅读 · 2015年12月31日

基于极限学习单元的多生物特征图像深度学习建模与识别研究

国家自然科学基金

2+阅读 · 2015年12月31日

神经形态多核处理器的架构模型研究

国家自然科学基金

3+阅读 · 2015年12月31日

工业过程动态数据的多模型在线重构研究

国家自然科学基金

1+阅读 · 2015年12月31日

面向多源遥感图像的深度学习技术与系统研究

国家自然科学基金

17+阅读 · 2014年12月31日

超光谱、全偏振、立体形貌的多模态成像研究

国家自然科学基金

0+阅读 · 2014年12月31日

网络化环境下面向态势感知的多无人机协同控制与管理方法

国家自然科学基金

24+阅读 · 2011年12月31日

Physically Native World Models: A Hamiltonian Perspective on Generative World Modeling

Arxiv

0+阅读 · 5月1日

HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation

Arxiv

0+阅读 · 4月30日

Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling

Arxiv

0+阅读 · 4月30日

Multimodal Remote Inference

Arxiv

0+阅读 · 4月25日

Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond

Arxiv

0+阅读 · 4月24日

Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation

Arxiv

0+阅读 · 4月23日

Geography According to ChatGPT -- How Generative AI Represents and Reasons about Geography

Arxiv

0+阅读 · 3月19日

Imagine-then-Plan: Agent Learning from Adaptive Lookahead with World Models

Arxiv

0+阅读 · 3月16日

Audio-Visual World Models: Towards Multisensory Imagination in Sight and Sound

Arxiv

0+阅读 · 3月10日

Recent Advances in Multi-modal 3D Scene Understanding: A Comprehensive Survey and Evaluation

Arxiv

27+阅读 · 2023年10月24日

VIP会员

相关主题

多模态推理

最新内容

CVPR 2026教程｜扩散模型原理：连续、离散与实时生成

CVPR 2026教程｜扩散模型原理：连续、离散与实时生成

专知会员服务

1+阅读 · 今天13:30

重磅综述｜大模型智能体环境工程：建模、合成、评估与协同演化

重磅综述｜大模型智能体环境工程：建模、合成、评估与协同演化

专知会员服务

1+阅读 · 今天13:28

面向特种部队的、以操作员为中心的人工智能决策支持系统框架

面向特种部队的、以操作员为中心的人工智能决策支持系统框架

专知会员服务

5+阅读 · 今天7:54

《多域战场上反制小型无人机系统》150页

《多域战场上反制小型无人机系统》150页

专知会员服务

14+阅读 · 今天7:47

《基于成果军事教育框架下的军官联合职业军事教育认证程序》2026最新170页

《基于成果军事教育框架下的军官联合职业军事教育认证程序》2026最新170页

专知会员服务

5+阅读 · 今天7:43

战场人工智能：增强陆地作战能力的发现与要求

战场人工智能：增强陆地作战能力的发现与要求

专知会员服务

3+阅读 · 今天7:37

人工智能赋能指挥所：以人工智能为中心的指挥控制的核心要素

人工智能赋能指挥所：以人工智能为中心的指挥控制的核心要素

专知会员服务

7+阅读 · 今天7:33

以人工智能为中心的指挥控制

以人工智能为中心的指挥控制

专知会员服务

3+阅读 · 今天7:14

《通过适应复杂环境与特殊作战行动动态来变革情报周期》

《通过适应复杂环境与特殊作战行动动态来变革情报周期》

专知会员服务

4+阅读 · 今天4:15

俄乌冲突背景下军事特种公路运输日益增长的重要性

俄乌冲突背景下军事特种公路运输日益增长的重要性

专知会员服务

4+阅读 · 今天3:44

速度优先于谨慎：NSPM-11意味着什么（将人工智能融入美国国防和情报行动最全面的声明）

速度优先于谨慎：NSPM-11意味着什么（将人工智能融入美国国防和情报行动最全面的声明）

专知会员服务

9+阅读 · 6月10日

《基于深度强化学习的反无人机技术研究》178页

《基于深度强化学习的反无人机技术研究》178页

专知会员服务

13+阅读 · 6月10日

技术突破与战略优势竞争：美军人工智能技术运用阶段分析

技术突破与战略优势竞争：美军人工智能技术运用阶段分析

专知会员服务

8+阅读 · 6月10日

“史诗怒火”行动与“AI中心战”模式的浮现

“史诗怒火”行动与“AI中心战”模式的浮现

专知会员服务

14+阅读 · 6月10日

【CVPR2026教程】扩散模型的解析理解

【CVPR2026教程】扩散模型的解析理解

专知会员服务

6+阅读 · 6月10日

相关VIP内容

CVPR 2026教程：统一多模态模型走向收敛之路

CVPR 2026教程：统一多模态模型走向收敛之路

专知会员服务

10+阅读 · 6月8日

【综述】世界模型：架构、方法、推理与应用全景

【综述】世界模型：架构、方法、推理与应用全景

专知会员服务

23+阅读 · 6月2日

从感知到认知：多模态大语言模型中视觉-语言交互推理综述

从感知到认知：多模态大语言模型中视觉-语言交互推理综述

专知会员服务

31+阅读 · 2025年10月1日

从二维到三维认知：通用世界模型简要综述

从二维到三维认知：通用世界模型简要综述

专知会员服务

30+阅读 · 2025年6月26日

感知、推理、思考与规划：大型多模态推理模型综述

感知、推理、思考与规划：大型多模态推理模型综述

专知会员服务

40+阅读 · 2025年5月10日

【CVPR2024教程】从多模态大语言模型到人类水平的AI：模态、指令、推理、效率及其他，200多页ppt

【CVPR2024教程】从多模态大语言模型到人类水平的AI：模态、指令、推理、效率及其他，200多页ppt

专知会员服务

60+阅读 · 2024年6月21日

CVPR2024最新《从高维数据中学习深度低维模型：从理论到实践》教程

CVPR2024最新《从高维数据中学习深度低维模型：从理论到实践》教程

专知会员服务

45+阅读 · 2024年6月19日

【剑桥大学博士论文】面向计算机视觉的神经世界模型，211页pdf

【剑桥大学博士论文】面向计算机视觉的神经世界模型，211页pdf

专知会员服务

64+阅读 · 2023年2月5日

【CVPR2022】以人为中心感知的多模态预训练

【CVPR2022】以人为中心感知的多模态预训练

专知会员服务

30+阅读 · 2022年3月28日

【NLPCC2020】多模态知识图谱构建、推理与挑战，东南大学王萌博士

专知会员服务

149+阅读 · 2020年10月21日

热门VIP内容

开通专知VIP会员享更多权益服务

重磅综述｜大模型智能体环境工程：建模、合成、评估与协同演化

《多域战场上反制小型无人机系统》150页

CVPR 2026教程｜扩散模型原理：连续、离散与实时生成

面向特种部队的、以操作员为中心的人工智能决策支持系统框架

相关资讯

【ChatGPT系列报告】人工智能行业专题报告：多模态AI研究框架，17页ppt

【ChatGPT系列报告】人工智能行业专题报告：多模态AI研究框架，17页ppt

专知

23+阅读 · 2023年4月8日

超50篇论文串联起从VQA到多模态预训练大模型的前世今生—Part 1

超50篇论文串联起从VQA到多模态预训练大模型的前世今生—Part 1

PaperWeekly

16+阅读 · 2022年4月29日

多模态深度学习综述，18页pdf

多模态深度学习综述，18页pdf

专知

51+阅读 · 2020年3月29日

【IEEE Fellow何晓东&邓力】多模态智能论文综述：表示学习，信息融合与应用，259篇文献带你了解AI热点技

【IEEE Fellow何晓东&邓力】多模态智能论文综述：表示学习，信息融合与应用，259篇文献带你了解AI热点技

专知

53+阅读 · 2019年12月1日

【CMU教程】高效大规模机器学习训练，198页PDF带你概览领域前沿进展

【CMU教程】高效大规模机器学习训练，198页PDF带你概览领域前沿进展

专知

14+阅读 · 2019年10月9日

专访俞栋：多模态是迈向通用人工智能的重要方向

专访俞栋：多模态是迈向通用人工智能的重要方向

AI科技评论

27+阅读 · 2019年9月9日

【CVPR2019教程】视频理解中的图表示学习

【CVPR2019教程】视频理解中的图表示学习

专知

43+阅读 · 2019年6月20日

152页简明《计算机视觉》入门教程，带你回顾CV发展脉络（附下载）

152页简明《计算机视觉》入门教程，带你回顾CV发展脉络（附下载）

专知

32+阅读 · 2019年1月6日

这可能是「多模态机器学习」最通俗易懂的介绍

这可能是「多模态机器学习」最通俗易懂的介绍

计算机视觉life

113+阅读 · 2018年12月20日

【CVPR2018】如何增强Attention Model的推理能力

【CVPR2018】如何增强Attention Model的推理能力

专知

15+阅读 · 2018年7月2日

相关基金

循环神经网络多模态深度模型联想记忆功能研究

国家自然科学基金

6+阅读 · 2017年12月31日

多层动态网络的建模、群体动力学分析与控制

国家自然科学基金

3+阅读 · 2015年12月31日

基于人脸表情、身体姿态和语音的多模态情感识别方法研究

国家自然科学基金

10+阅读 · 2015年12月31日

基于多模态信息集成的组合预测模型及其应用研究

国家自然科学基金

6+阅读 · 2015年12月31日

基于极限学习单元的多生物特征图像深度学习建模与识别研究

国家自然科学基金

2+阅读 · 2015年12月31日

神经形态多核处理器的架构模型研究

国家自然科学基金

3+阅读 · 2015年12月31日

工业过程动态数据的多模型在线重构研究

国家自然科学基金

1+阅读 · 2015年12月31日

面向多源遥感图像的深度学习技术与系统研究

国家自然科学基金

17+阅读 · 2014年12月31日

超光谱、全偏振、立体形貌的多模态成像研究

国家自然科学基金

0+阅读 · 2014年12月31日

网络化环境下面向态势感知的多无人机协同控制与管理方法

国家自然科学基金

24+阅读 · 2011年12月31日

相关论文

Physically Native World Models: A Hamiltonian Perspective on Generative World Modeling

Arxiv

0+阅读 · 5月1日

HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation

Arxiv

0+阅读 · 4月30日

Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling

Arxiv

0+阅读 · 4月30日

Multimodal Remote Inference

Arxiv

0+阅读 · 4月25日

Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond

Arxiv

0+阅读 · 4月24日

Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation

Arxiv

0+阅读 · 4月23日

Geography According to ChatGPT -- How Generative AI Represents and Reasons about Geography

Arxiv

0+阅读 · 3月19日

Imagine-then-Plan: Agent Learning from Adaptive Lookahead with World Models

Arxiv

0+阅读 · 3月16日

Audio-Visual World Models: Towards Multisensory Imagination in Sight and Sound

Arxiv

0+阅读 · 3月10日

Recent Advances in Multi-modal 3D Scene Understanding: A Comprehensive Survey and Evaluation

Arxiv

27+阅读 · 2023年10月24日

微信扫码咨询专知VIP会员