综述 | 基础模型时代的人本智能:从可观察主体到具身智能体

论文题目:Human-Centric Intelligence in the Era of Foundation Models: A Survey 作者:Yang Chen、Tianqi Wang、Xiaorui Jiang、Yilei Man、Yihua Shao、Mengyuan Liu、Zhi Chen、Xiaofeng Cao、Qibin Zhao、Chi Harold Liu、Albert Y. Zomaya、Nicu Sebe、Jingren Zhou、Dacheng Tao、Song Guo、Jingcai Guo

机构:香港理工大学、北京大学、南昆士兰大学、同济大学、RIKEN、北京理工大学、悉尼大学、特伦托大学、阿里巴巴集团、南洋理工大学、香港科技大学 论文链接:https://arxiv.org/abs/2608.18184

导读

基础模型正在重塑人本智能研究。过去,人本视觉、人类动作、人体三维重建、人机交互、具身机器人等方向往往被分散在不同任务和社区中:有人关注人“长什么样”,有人关注身体结构,有人关注运动生成,有人关注人-物、人-场景、人-人交互,也有人试图把人类经验迁移到机器人或具身智能体。但在大模型时代,单一任务视角已经不足以解释这些研究之间的共同趋势。 这篇 67 页综述提出一个“全谱系人类上下文分类”。作者将人类建模划分为六个相互连接的层次:视觉外观、空间几何、运动动力学、交互建模、世界仿真和具身行动。进一步看,这六层又对应三种理解人类的方式:人是可观察主体,人是动态行动者,人也是处在世界中、能够影响环境并执行动作的情境化智能体。 论文的价值在于,它不是简单罗列任务,而是尝试回答一个更基础的问题:在基础模型时代,人本智能如何从感知、生成和重建走向统一表征、可迁移能力、物理约束和可部署系统?围绕这一问题,作者系统梳理了数据模态、计算架构、训练与推理优化策略,随后分别讨论六类人类上下文任务,并进一步整理数据集、基准和评测指标,最后给出未来方向。

Introduction:引言

人本智能指围绕人类及其所处情境构建计算能力。它既包括对人的外观、身份和身体结构的理解,也包括对动作、交互、环境变化和可执行行为的建模。随着基础模型发展,这一领域正在从手工特征和任务专用深度模型,转向大规模预训练、可复用骨干、多模态接口和跨任务适配。 作者指出,现有综述多聚焦单个方向,例如姿态估计、动作识别、人体运动生成、人-物交互或人本基础模型本身。这些综述能够深入分析具体任务,却较少解释不同人类上下文之间的内在联系。尤其是在基础模型时代,人本智能的关键不只是模型变大,而是数据规模、可迁移人类先验、多模态条件、统一接口和可执行行动之间开始互相连接。 因此,论文的主要贡献包括四点:第一,提出覆盖六层上下文的人本智能分类体系;第二,总结人本智能的方法基础,包括数据族、架构范式和优化策略;第三,系统整理代表性方法、数据集、基准和指标;第四,讨论可扩展、可信、物理扎根和可部署的人本智能未来方向。

Human Context Taxonomy:人类上下文分类

三种视角

论文将“人类上下文”定义为人本能力发展的主要建模范围。作者不再按照单个任务或应用分类,而是从表征范围逐步扩展的角度组织文献。 第一,人是可观察主体。这一视角关注直接从视觉证据中看到的人,或者可显式恢复的人体结构,对应视觉外观和空间几何两层。第二,人是动态行动者。这一视角从静态状态扩展到时间演化和关系行为,对应运动动力学和交互建模。第三,人是情境化智能体。这一视角进一步把人放入变化的世界和可执行行动中,对应世界仿真和具身行动。

六个层次

视觉外观关注人看起来是什么样,包括多任务人体感知、身份识别和可控人物生成。空间几何关注身体是什么,包括 2D/3D 姿态、SMPL、人体网格、神经人体渲染和可动画化数字人。二者共同构成人本智能的感知和结构基础。 运动动力学关注人如何随时间运动,包括人体运动理解、动作生成、视频动画和跨模态运动控制。交互建模关注人如何与外部实体共同演化,包括人-物交互、人-场景交互和社会交互。二者将建模目标从单个人体状态扩展到行为关系。 世界仿真关注以人为中心的世界如何变化,例如第一视角世界模型、人体条件视频生成和可行动世界规划。具身行动则关注如何把人类经验转化为可执行控制,例如通用类人控制、人到智能体技能迁移和机器人策略学习。到这一层,人本智能不再只是理解人,而是开始服务于物理执行和智能体决策。

Preliminary:预备知识

数据与信号

基础模型时代的人本智能依赖多样化数据。论文将数据族划分为视觉成像信号、空间结构信号、传感运动信号、无线与测距信号、语言与声学信号等。视觉信号提供 RGB、深度、热成像、事件相机等观测;空间结构信号提供关键点、网格、骨架、点云和辐射场;传感运动信号则包括惯性、力、触觉、关节状态和机器人执行数据。 这些信号的意义不只是“输入更多模态”。对于人本智能而言,不同信号对应不同层次的人类上下文:视觉信号适合外观与身份,空间结构适合几何恢复,传感运动适合动作与执行,语言和声学则提供高层语义、沟通意图和任务条件。

架构范式

论文将基础模型时代的人本计算架构归纳为四类。单步映射架构通过一次前向计算从输入得到目标表示或输出,适合高效感知、重建和表征对齐。序列分解架构将输出建模为有序序列,常见于 LLM、MLLM、动作 token 和结构化预测。迭代生成架构通过扩散、流匹配或逐步优化逐渐生成目标状态,适合高质量图像、视频、运动和三维生成。混合架构则将多种机制组合,用于复杂人本任务。

优化策略

训练阶段,相关方法包括从头训练、全参数微调、参数高效微调、冻结骨干训练、蒸馏、对齐和强化学习等。推理阶段,常见策略包括提示工程、检索增强、测试时优化、代理式工具调用、约束解码和规划式推理。 论文强调,人本智能的优化不能只追求单项指标,还要关注跨上下文迁移。例如,一个在人像生成上强大的模型,如果无法保持身份一致、空间结构稳定或动作物理合理,就很难成为真正可复用的人本基础模型。

Human Visual Appearance and Spatial Geometry:视觉外观与空间几何

视觉外观

视觉外观关注模型如何感知、区分和合成可见人体属性。论文将其分为三类:通用人体感知、判别式身份理解和可控人物生成。通用人体感知尝试用一个模型覆盖姿态、解析、深度、法线等密集预测任务;身份理解关注跨视角、跨模态、跨场景的人物一致性;可控人物生成则面向虚拟试衣、人物编辑、身份保持和姿态控制等任务。 基础模型在这一层带来的变化是从任务共享走向人类专用通用性。仅仅扩大模型规模并不够,人本视觉仍需要高分辨率、身体区域细节、身份一致性和结构约束。许多方法开始将视觉扩散、视觉语言模型和人体先验结合起来,使人物生成和人物理解不再是割裂任务。

空间几何

空间几何关注人体结构如何从图像空间转化为显式或可渲染的身体表示。结构化几何建模包括姿态估计、人体网格恢复、身体形状估计、多视角重建等;可渲染 avatar 建模则进一步生成可动画、可重光照、可交互的 3D 人体资产。 这一方向的趋势是从单帧、单人、封闭场景,走向开放环境中的高保真、动态、多主体重建。基础模型可以提供语言接口、视觉先验和生成能力,但几何任务依然强依赖物理一致性、相机约束、时序稳定和细节保真。论文因此把空间几何视为从“看见人”到“构造可操作人体资产”的关键过渡。

Human Kinematic Dynamics and Interaction Modeling:运动动力学与交互建模

运动动力学

运动动力学关注人体状态如何随时间演化。论文将这一层分为可扩展运动建模和人体视频动画。可扩展运动建模把动作看作时序信号,通过文本、音频、轨迹、可穿戴传感器或第一视角视频进行理解与生成。人体视频动画则将身体动力学转化为逼真视频,关注音频驱动、姿态驱动、身份保持和长时一致性。 基础模型时代的运动研究正在从“动作 token 化”走向“可迁移时序智能”。大规模运动语料有助于泛化,但人体运动并非普通序列:它受骨骼结构、动力学约束、接触关系和节奏同步影响。未来模型需要同时处理语言语义、连续运动、物理有效性和跨域观测差异。

交互建模

交互建模将人放入对象、场景和他人关系中。人-物交互关注接触、可供性、操作动作和物体状态;人-场景交互关注人在三维场景中的位置、行为可行性和功能关系;社会交互关注多人之间的时序协调、沟通、身份归因和群体行为。 这一层的核心挑战是,行为不再只由人体自身决定。模型必须理解外部实体如何限制或诱发人的动作。基础模型带来了语言条件、多模态对齐和开放词汇能力,但也带来新的问题:如果模型只学到场景语义而缺少几何和功能细节,生成的人-场景交互可能看似合理却物理不可行。

Human World Simulation and Embodied Agency:世界仿真与具身行动

世界仿真

世界仿真进一步把人的行为与环境变化联系起来。人本世界生成关注从人体姿态、动作意图或第一视角观测出发,生成以人为中心的未来视频或环境状态。可行动世界规划则不只预测视觉未来,还要预测候选动作会带来什么后果。 论文指出,视觉逼真并不等同于可行动。一个世界模型即使能生成合理视频,也未必学到了动作与结果之间的因果关系。面向具身智能,世界模型必须支持干预、规划和闭环反馈,并区分真正由动作导致的变化与偶然的视觉变化。

具身行动

具身行动关注将人类经验转化为物理可执行能力。论文将其分为通用类人控制和人到智能体技能迁移。前者尝试让类人机器人或数字人通过视觉语言接口、动作先验和控制策略完成复杂行为;后者利用人类视频、手套数据、远程操作数据和机器人数据,将人类活动作为可扩展监督信号。 这一方向把基础模型原则引入控制:模型不仅要理解人,还要在物理世界中执行动作。关键挑战包括 embodiment gap、运动稳定性、反馈闭环、长期任务规划和人类意图保持。可扩展人类数据能提供丰富经验,但机器人能否可靠复现这些经验,仍取决于控制表示和物理约束。

Datasets, Benchmarks, and Metrics:数据集、基准与指标

数据资源

论文将人本智能资源分为四类:人类主体资源、人类动态资源、人类交互资源和人类具身资源。人类主体资源支持感知、身份理解和空间建模;动态资源捕捉随时间变化的动作和外观;交互资源覆盖程序性活动、物理关系、环境关系和社会行为;具身资源则连接人类经验与机器人或智能体执行。

评测指标

评测方面,论文整理了重建中心、语义中心、生成中心、交互中心和效率中心五类指标。重建指标关注几何误差、关键点误差和姿态误差;语义指标关注身份、属性、文本图像一致性和任务语义;生成指标关注视觉质量、多样性、运动自然性和分布距离;交互指标关注接触、碰撞、可行性和社会一致性;效率指标关注计算量、显存、延迟和部署成本。 作者强调,当前评测的最大问题不是缺少指标,而是缺少把指标连接起来的协议。单个任务高分并不说明模型能跨上下文迁移,也不说明模型能同时保持身份、几何、运动、交互和物理一致性。未来更需要结构化评测画像,而不是单一综合分。

Open Challenges and Future Directions:开放挑战与未来方向

六个方向

论文提出六个未来方向。第一是可扩展且可信的人类数据。真实人类数据采集成本高、隐私敏感,合成数据可扩展但可能放大生成器偏差,因此需要数据质量、真实合成混合比例、来源追踪和同意机制。 第二是统一的人本基础模型。未来模型应在完整人类上下文谱系上学习共享表示,使视觉外观、几何、运动、交互和具身行动能够相互迁移,同时避免负迁移和灾难性遗忘。 第三是面向下一代人体表征学习的物理扎根。人类行为受身体结构、接触、力学和环境约束影响,模型不能只依赖视觉与语言统计规律。第四是人本世界模型与具身行动智能,需要将世界预测、动作选择、物理结果和人类反馈统一到闭环系统中。 第五是面向泛化和集成能力的评测。未来基准应同时评估任务局部准确性、跨上下文迁移、一致性和闭环表现。第六是高效、模块化和可部署系统。单一巨型模型难以满足真实应用中的延迟、隐私和维护要求,代理式和工具增强系统可能成为重要路径。

Conclusion:结论

这篇综述给基础模型时代的人本智能提供了一个清晰的全谱系框架。它将视觉外观、空间几何、运动动力学、交互建模、世界仿真和具身行动串联起来,并用“可观察主体、动态行动者、情境化智能体”三种视角解释它们之间的递进关系。 更重要的是,论文指出人本智能的发展并不只是模型规模扩张,而是从分散任务走向可复用人类先验、多模态接口、跨上下文迁移、物理约束和可执行行动的系统性转变。未来真正有价值的人本基础模型,需要同时具备可扩展数据、统一表征、物理一致性、评测可靠性和部署可行性。对于关注多模态大模型、数字人、人体生成、世界模型和具身智能的研究者来说,这篇综述提供了一张很完整的路线图。

成为VIP会员查看完整内容
0

相关内容

VIP会员
最新内容
综述 | 自我中心视频中的视觉语言模型
专知会员服务
0+阅读 · 51分钟前
综述 | 基础模型时代的人本智能全景
专知会员服务
0+阅读 · 55分钟前
综述 | 多模态大模型的不确定性感知决策
专知会员服务
2+阅读 · 8月19日
综述 | Deep Academic Survey:有状态闭环综述自动化
综述 | 触觉与力觉感知机器人学习
专知会员服务
7+阅读 · 8月18日
综述 | AI科学家的过去与未来
专知会员服务
7+阅读 · 8月18日
论文 | OmniScientist:全模态全学科AI科学家
专知会员服务
11+阅读 · 8月16日
无人机已改变战场,但并未解决指挥问题
专知会员服务
11+阅读 · 8月14日
微信扫码咨询专知VIP会员