课程 | 宾大世界模型课程:从动力学预测到机器人与智能体

宾夕法尼亚大学 CIS 6280《World Models》课程主图。课程面向 2026 年秋季,主题是用于感知、规划、控制和决策的环境动力学表征与预测模型。

导读

世界模型正在成为人工智能从“识别和生成”走向“理解、预测和行动”的关键接口。无论是强化学习中的想象展开、视频生成中的未来帧预测、三维空间中的动态建模,还是机器人和数字智能体中的规划与反馈,本质上都离不开一个问题:系统能否在内部形成一个关于外部世界如何变化的模型。 宾夕法尼亚大学 2026 年秋季课程 CIS 6280《World Models》正是围绕这一主题组织。课程由 Jiatao Gu 主讲,目标不是只讲某一个模型家族,而是把世界模型放在更大的技术谱系里:从状态空间模型、表征学习和生成模型基础出发,进入序列生成、模型式强化学习、视频世界模型、三维与四维动态、神经物理、机器人学习、语言模型和数字智能体。 这门课适合已经具备机器学习基础、希望系统理解“世界模型”概念的研究者和高年级学生。它的亮点在于跨越多个社区:强化学习、生成式建模、空间智能、具身智能和大模型智能体被放在同一条学习路线上,而不是彼此割裂地学习。

Course Overview | 课程概览

课程定位

课程页面将世界模型定义为“环境动力学的学习型表征与预测器”,服务于感知、规划和决策。换句话说,世界模型不是单纯的视频生成器,也不是传统意义上的强化学习动力学模型,而是一类能把观察、状态、动作、记忆、预测、模拟、规划和推理连接起来的通用建模框架。 课程开设于宾夕法尼亚大学计算机与信息科学系,编号为 CIS 6280,时间为 2026 年秋季。上课时间为每周二、周四 12:00-1:29 PM,地点为 Amy Gutmann Hall 105A 与 105B。课程办公室时间为周四 4:30-5:30 PM,地点为 AGH 423。

学习背景

课程建议先修背景为 CIS 5190、CIS 5200 或等价的研究生机器学习经验。这意味着它并不是入门机器学习课,而是默认读者已经理解监督学习、概率建模、优化、神经网络和基础强化学习概念。课程本身会讲必要的强化学习与控制工具,但重点是世界模型如何支撑决策,而不是把它定位成一门传统强化学习课。 课程地址: https://www.cis.upenn.edu/~cis6280/

Staff | 课程团队

课程团队。课程由 Jiatao Gu 主讲,Mutian Tong、Yong-Hyun Park、Enxin Song 和 Xinyue Ai 担任助教。

主讲与助教

课程主讲人为 Jiatao Gu。课程团队还包括四位助教:Mutian Tong、Yong-Hyun Park、Enxin Song 和 Xinyue Ai。课程页面提供了主讲教师和助教的个人主页链接,便于学生了解各自研究方向。 从课程主题看,这支团队覆盖的方向明显偏向大模型、生成建模、多模态和具身智能交叉。世界模型本身也是一个高度交叉主题:既需要概率建模和表示学习,也需要生成模型、强化学习、机器人和系统评估视角。

Tentative Schedule | 课程安排

七个学习模块

课程共有 25 个课堂节点,其中包括 23 次讲座、1 次期末项目展示和 1 次期末考试。按照主题脉络,可以整理为七个模块。 第一个模块是建模基础,包括世界模型概览、历史与概率表述、环境和模拟器接口、状态空间模型。这里建立“观察、状态、转移、动作、反馈、轨迹”的基本语言。 第二个模块是表征学习,讨论模型应保留什么信息、如何检验表征、重构、掩码预测、自回归预测、对比学习,以及联合嵌入预测等路线。 第三个模块是生成模型基础,覆盖潜变量模型、对抗模型、自回归模型、扩散、流匹配、正规化流和自回归流。这一部分把现代生成模型与世界模型中的 rollout、预测和采样连接起来。 第四个模块是序列与控制,进入序列生成式世界模型、模型式强化学习、规划与控制,讨论想象轨迹、模型偏差、不确定性、模型预测控制、交叉熵方法和轨迹优化。 第五个模块是视频与空间世界模型,包括视频生成架构、交互、记忆、效率、三维几何表征和四维动态建模。 第六个模块是物理与机器人,覆盖神经物理、学习型物理动力学、机器人仿真、控制、仿真到现实,以及视觉语言动作模型和世界动作模型。 第七个模块是智能体与评估,讨论大语言模型作为世界模型、状态跟踪、具身落地、推理模型、测试时计算、数字智能体,以及世界模型的效用、鲁棒性、校准、分布外行为、延迟和开放问题。 课程学习路线图。课程从环境动力学、表征学习和生成模型出发,逐步进入视频、三维、机器人、数字智能体和世界模型评估。

讲座日程

课程从 8 月 25 日开始,以“世界模型概览”开篇;8 月底到 9 月初完成历史、概率建模、环境接口、状态空间模型和表征学习;9 月中下旬集中讲生成模型基础;10 月转向序列生成、模型式强化学习、视频和空间世界模型;11 月进入神经物理、机器人学习、语言模型、推理模型和数字智能体;12 月 1 日进行期末项目展示,12 月 3 日进行期末考试。 课程页面也标注了临时日程变化:9 月 15 日和 9 月 22 日暂定改为 Zoom 线上课,9 月 17 日因教师出差暂定停课;10 月 1 日为秋季假期,10 月 6 日和 10 月 8 日因 COLM 2026 停课,11 月 26 日为感恩节假期。 课程日程概览。课程共 25 个课堂节点,覆盖 23 次讲座、项目展示和期末考试。

Resources | 学习资源

阅读与综述

课程资源部分将材料分为几类。第一类是核心论文与文章,包括 Ha 和 Schmidhuber 的 World Models、Yann LeCun 关于自主机器智能路径的文章、李飞飞关于空间智能的文章、World Labs 的世界模型功能分类、Google DeepMind 关于想象与规划智能体的文章,以及 Richard Sutton 关于智能决策者通用模型的思考。 第二类是教程、综述和课程材料,包括 CVPR 2025 “从视频生成到世界模型”教程、Mila 2026 世界模型研讨会、Awesome World Models 列表、世界模型到世界动作模型综述、CMU 生成式人工智能课程中的世界模型讲义,以及 Stanford CS234 中关于世界建模的讲义。

演讲、系统与演示

课程还列出了若干演讲资源,例如 Ilya Sutskever 与 Jensen Huang 的炉边谈话、Jitendra Malik 关于通往人工智能的感知运动道路、李飞飞关于空间智能的 TED 演讲,以及 Yann LeCun 关于自主机器智能路径的演讲。 系统与演示资源则包括 DreamerV3、Meta 的 V-JEPA 2、Google DeepMind 的 Genie、World Labs 的 Marble、Wayve 的 GAIA-4、GenBio AI 的 AIDO Cell Simulator、DayDreamer 以及 DINO-WM。这些资源覆盖从强化学习、视频预测、空间建模、自动驾驶、生物模拟到机器人学习的不同世界模型形态。

Coursework | 作业与项目

作业与项目节点。课程包含三次作业和一个期末项目,项目要求学生明确建模状态、转移、动作接口和评估准则。

三次作业

课程设置三次作业。作业一于 9 月 10 日发布,9 月 24 日截止;作业二于 9 月 30 日发布,10 月 19 日截止;作业三于 10 月 21 日发布,11 月 18 日截止。课程页面说明,具体说明和评分权重会在每次作业发布前公布。 这三次作业很可能对应课程前中期的核心技术训练:从环境和状态空间模型,到表征学习、生成模型和序列建模,再到控制、视频、空间或机器人相关实验。

期末项目

期末项目要求学生在一个应用领域中探索世界建模方法,并明确说明被建模的状态、转移、动作接口和评估标准。课程给出的应用方向包括物理系统、视频与空间世界、机器人学习、语言与数字智能体。 项目节点包括:10 月 14 日提交提案,说明问题、领域、方法和评估计划;11 月 16 日提交检查点,展示可运行系统、早期证据和风险;12 月 1 日进行期末项目展示,报告结果、失败分析和讨论;12 月 14 日提交最终报告和代码。

Logistics | 后勤信息

上课与沟通

课程的官方信息、临时会议链接和课程问题会通过 Canvas 发布。课程页面提供了官方课程列表、宾大学术诚信政策和无障碍服务链接。页面还说明,评分、迟交政策和人工智能使用规则将另行公布。

课程边界

课程页面特别说明,这不是一门纯强化学习课程。它会讲理解世界模型所需的强化学习和控制工具,但覆盖范围还包括表征学习、生成建模、视频与三维、机器人、语言和数字智能体。换言之,这门课真正关注的是“学习到的世界表示和预测器如何服务决策”,而不是某一类算法的窄门派训练。

Why It Matters | 为什么值得关注

世界模型正在汇合多个研究方向

过去几年,世界模型这个词在不同社区中同时升温。在强化学习中,它意味着让智能体在想象中试错;在视频生成中,它意味着对未来视觉世界进行连续预测;在空间智能中,它意味着理解三维结构和物理变化;在机器人中,它意味着把感知、动作和反馈放进可规划的动态系统;在大模型智能体中,它又意味着对任务状态、工具反馈和环境变化进行长期跟踪。 这门课的价值在于把这些分散方向放在一个统一框架下。它不把世界模型等同于“更强的视频生成”,也不把它缩小为“模型式强化学习”,而是把世界模型理解为面向决策的环境建模基础设施。

学习这门课应抓住三条主线

第一条主线是状态。世界模型必须回答系统内部到底表示什么:像素、潜变量、对象、几何、物理量、语言状态、任务进度,还是多层级记忆。 第二条主线是转移。世界模型的核心能力是预测变化:动作之后会发生什么,环境如何演化,长期 rollout 会如何漂移,模型不确定性如何积累。 第三条主线是使用。一个世界模型的价值最终不在于生成得多漂亮,而在于能否支持规划、控制、评估、数据生成、机器人学习和智能体决策。课程的期末项目也围绕这点设计:必须显式说明状态、转移、动作接口和评估标准。 对关注具身智能、空间智能、视频生成、自动驾驶、机器人基础模型和大模型智能体的读者来说,这门课程提供了一条很好的系统化路线:从“模型如何预测世界”走向“模型如何帮助智能体在世界中行动”。

成为VIP会员查看完整内容
1
VIP会员
最新内容
失去控制的指挥:人工智能时代的任务式指挥
专知会员服务
6+阅读 · 9月11日
美国的新国家安全科技战略思考
专知会员服务
3+阅读 · 9月11日
综述 | 面向大模型智能体的图结构个性化记忆
专知会员服务
6+阅读 · 9月10日
微信扫码咨询专知VIP会员