KineVLA：面向具有双层动作分解的感知运动学的视觉-语言-动作模型 (KineVLA: Towards Kinematics-Aware Vision-Language-Action Models with Bi-Level Action Decomposition) - 专知论文

会员服务 ·

0

分解 · 分解的 · 操作 · 不变 · 数据集 ·

KineVLA: Towards Kinematics-Aware Vision-Language-Action Models with Bi-Level Action Decomposition

翻译：KineVLA：面向具有双层动作分解的感知运动学的视觉-语言-动作模型

Gaoge Han,Zhengqing Gao,Ziwen Li,Jiaxin Huang,Shaoli Huang,Fakhri Karray,Mingming Gong,Tongliang Liu

In this paper, we introduce a novel kinematics-rich vision-language-action (VLA) task, in which language commands densely encode diverse kinematic attributes (such as direction, trajectory, orientation, and relative displacement) from initiation through completion, at key moments, unlike existing action instructions that capture kinematics only coarsely or partially, thereby supporting fine-grained and personalized manipulation. In this setting, where task goals remain invariant while execution trajectories must adapt to instruction-level kinematic specifications. To address this challenge, we propose KineVLA, a vision-language-action framework that explicitly decouples goal-level invariance from kinematics-level variability through a bi-level action representation and bi-level reasoning tokens to serve as explicit, supervised intermediate variables that align language and action. To support this task, we construct the kinematics-aware VLA datasets spanning both simulation and real-world robotic platforms, featuring instruction-level kinematic variations and bi-level annotations. Extensive experiments on LIBERO and a Realman-75 robot demonstrate that KineVLA consistently outperforms strong VLA baselines on kinematics-sensitive benchmarks, achieving more precise, controllable, and generalizable manipulation behaviors.

翻译：本文提出了一种新颖的、富含运动学信息的视觉-语言-动作任务。与现有仅粗略或部分捕捉运动学特征的动作指令不同，该任务中的语言指令从起始到完成，在关键时间点密集编码了多样的运动学属性（如方向、轨迹、朝向和相对位移），从而支持细粒度和个性化的操作。在此设定下，任务目标保持不变，而执行轨迹必须适应指令级别的运动学规范。为应对这一挑战，我们提出了KineVLA，这是一个视觉-语言-动作框架，它通过双层动作表示和双层推理标记，明确地将目标层面的不变性与运动学层面的可变性解耦。这些推理标记作为显式的、受监督的中间变量，用以对齐语言和动作。为支持此任务，我们构建了涵盖仿真和真实机器人平台的感知运动学VLA数据集，该数据集具有指令级别的运动学变化和双层标注。在LIBERO和Realman-75机器人上进行的大量实验表明，KineVLA在运动学敏感基准测试中始终优于强大的VLA基线，实现了更精确、可控和可泛化的操作行为。

0

相关内容

视觉-语言-动作（VLA）模型的前世今生

视觉-语言-动作（VLA）模型的前世今生

专知会员服务

20+阅读 · 2025年8月29日

面向具身操作的视觉-语言-动作模型综述

面向具身操作的视觉-语言-动作模型综述

专知会员服务

28+阅读 · 2025年8月23日

面向机器人操作的基于大型视觉‑语言模型（VLM）的视觉‑语言‑动作（VLA）模型综述

面向机器人操作的基于大型视觉‑语言模型（VLM）的视觉‑语言‑动作（VLA）模型综述

专知会员服务

34+阅读 · 2025年8月19日

视觉语言动作模型：概念、进展、应用与挑战

视觉语言动作模型：概念、进展、应用与挑战

专知会员服务

19+阅读 · 2025年5月18日

【CVPR2025】CrayonRobo：面向机器人操作的以对象为中心的提示驱动视觉-语言-动作模型

【CVPR2025】CrayonRobo：面向机器人操作的以对象为中心的提示驱动视觉-语言-动作模型

专知会员服务

10+阅读 · 2025年5月6日

《面向无人机实时认知任务解决的视觉-语言-动作（VLA）模型与评估基准》

《面向无人机实时认知任务解决的视觉-语言-动作（VLA）模型与评估基准》

专知会员服务

41+阅读 · 2025年3月9日

【博士论文】学习视觉-语言表示以实现多模态理解

【博士论文】学习视觉-语言表示以实现多模态理解

专知会员服务

28+阅读 · 2025年2月8日

【NeurIPS2023】PAXION：在视频-语言基础模型中修补动作知识

【NeurIPS2023】PAXION：在视频-语言基础模型中修补动作知识

专知会员服务

18+阅读 · 2023年9月24日

【华盛顿大学】用于视觉和语言导航的多视图学习，Multi-View Learning for Vision-and-Language Navigation

【华盛顿大学】用于视觉和语言导航的多视图学习，Multi-View Learning for Vision-and-Language Navigation

专知会员服务

31+阅读 · 2020年3月11日

斯坦福大学李飞飞组发布Action Genome:一种新的表达形式，新的数据集，以及将动作分解成时空场景图的新模型

斯坦福大学李飞飞组发布Action Genome:一种新的表达形式，新的数据集，以及将动作分解成时空场景图的新模型

专知会员服务

40+阅读 · 2020年1月12日

多模态视觉语言表征学习研究综述

多模态视觉语言表征学习研究综述

专知

27+阅读 · 2020年12月3日

【ACMMM2020-北航】KBGN:用于视觉对话中自适应视觉-文本推理的知识桥图网络

【ACMMM2020-北航】KBGN:用于视觉对话中自适应视觉-文本推理的知识桥图网络

专知

10+阅读 · 2020年8月12日

【CVPR2020-牛津-谷歌】语音到动作:动作识别的跨模态监督，Cross-modal Supervision

【CVPR2020-牛津-谷歌】语音到动作:动作识别的跨模态监督，Cross-modal Supervision

专知

10+阅读 · 2020年3月31日

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

专知

20+阅读 · 2019年11月24日

NLP+CV《桥接视觉与语言的研究综述》，带你全面了解视觉+语言最新应用和方法

NLP+CV《桥接视觉与语言的研究综述》，带你全面了解视觉+语言最新应用和方法

中国人工智能学会

27+阅读 · 2019年7月24日

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

AI科技评论

12+阅读 · 2019年5月2日

一文看懂如何将深度学习应用于视频动作识别

一文看懂如何将深度学习应用于视频动作识别

AI前线

11+阅读 · 2018年7月15日

从NLP到CV+NLP: 计算机视觉和自然语言处理结合介绍 | 公开课

从NLP到CV+NLP: 计算机视觉和自然语言处理结合介绍 | 公开课

AI研习社

14+阅读 · 2018年1月28日

【计算机视觉必读干货】图像分类、定位、检测，语义分割和实例分割方法梳理

【计算机视觉必读干货】图像分类、定位、检测，语义分割和实例分割方法梳理

新智元

35+阅读 · 2018年1月24日

干货｜基于双流递归神经网络的人体骨架行为识别！

干货｜基于双流递归神经网络的人体骨架行为识别！

全球人工智能

13+阅读 · 2017年12月15日

人类视空间分类的神经机制

国家自然科学基金

1+阅读 · 2015年12月31日

彩色/多光谱异源双目视频运动目标分割方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

视知觉学习中的脑功能网络变化及其与学习效果的关系

国家自然科学基金

0+阅读 · 2015年12月31日

儿童手写运动促进中英文感知的认知神经机制

国家自然科学基金

0+阅读 · 2015年12月31日

强调与对比影响语篇理解的认知过程及其神经机制

国家自然科学基金

4+阅读 · 2015年12月31日

深度学习框架下基于情境线索的视觉注意研究

国家自然科学基金

2+阅读 · 2015年12月31日

维吾尔语韵律结构的分析与预测模型的研究

国家自然科学基金

0+阅读 · 2014年12月31日

数据驱动的人体图像语义分割研究

国家自然科学基金

5+阅读 · 2014年12月31日

基于集成流形学习的监控视频中人体行为识别研究

国家自然科学基金

3+阅读 · 2014年12月31日

运动目标间语义关系的时空建模及可视化研究

国家自然科学基金

1+阅读 · 2014年12月31日

FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model

Arxiv

0+阅读 · 3月11日

NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models

Arxiv

0+阅读 · 3月10日

KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models

Arxiv

0+阅读 · 3月2日

Recursive Belief Vision Language Action Models

Arxiv

0+阅读 · 2月25日

PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding

Arxiv

0+阅读 · 2月25日

ForeAct: Steering Your VLA with Efficient Visual Foresight Planning

Arxiv

0+阅读 · 2月12日

VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model

Arxiv

0+阅读 · 2月12日

ST4VLA: Spatially Guided Training for Vision-Language-Action Models

Arxiv

0+阅读 · 2月10日

VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model

Arxiv

0+阅读 · 2月10日

Efficient Long-Horizon Vision-Language-Action Models via Static-Dynamic Disentanglement

Arxiv

0+阅读 · 2月3日

VIP会员

文章信息

相关主题

最新内容

【剑桥博士论文】迈向高效、科学且普适的小语言模型开发之道

【剑桥博士论文】迈向高效、科学且普适的小语言模型开发之道

专知会员服务

0+阅读 · 今天14:26

从预训练模型到大语言模型：人工智能驱动的心理计算综述

从预训练模型到大语言模型：人工智能驱动的心理计算综述

专知会员服务

0+阅读 · 今天14:22

乌克兰-委内瑞拉-伊朗冲突：人工智能在现代军事行动中的飞速演进

乌克兰-委内瑞拉-伊朗冲突：人工智能在现代军事行动中的飞速演进

专知会员服务

3+阅读 · 今天12:11

《对信息环境分析实现人工智能预测冲突》96页

《对信息环境分析实现人工智能预测冲突》96页

专知会员服务

3+阅读 · 今天9:59

《面向海军应用的无人机网络安全仿真环境》

《面向海军应用的无人机网络安全仿真环境》

专知会员服务

4+阅读 · 今天9:41

乌克兰部署新型拦截型无人机应对“沙希德”式威胁

乌克兰部署新型拦截型无人机应对“沙希德”式威胁

专知会员服务

4+阅读 · 今天9:17

无人机与僵局：俄乌战争难以突破

无人机与僵局：俄乌战争难以突破

专知会员服务

3+阅读 · 今天9:02

《美国海岸警卫队研发中心2026财年研究项目计划》40页slides

《美国海岸警卫队研发中心2026财年研究项目计划》40页slides

专知会员服务

6+阅读 · 今天8:55

《控制对手感知：电子战愿景与赋能技术》

《控制对手感知：电子战愿景与赋能技术》

专知会员服务

5+阅读 · 今天8:51

【NTU博士论文】缓解视觉及视觉-语言模型中的捷径学习并提升分布外泛化能力

【NTU博士论文】缓解视觉及视觉-语言模型中的捷径学习并提升分布外泛化能力

专知会员服务

4+阅读 · 4月6日

大语言模型智能体（LLM Agents）工具调用的演进：从单工具调用到多工具协同编排

大语言模型智能体（LLM Agents）工具调用的演进：从单工具调用到多工具协同编排

专知会员服务

9+阅读 · 4月6日

《评估杀伤力：陆军战斗力与兵力设计》最新45页报告

《评估杀伤力：陆军战斗力与兵力设计》最新45页报告

专知会员服务

13+阅读 · 4月6日

自主、人工智能与可消耗集群时代的海军情报

自主、人工智能与可消耗集群时代的海军情报

专知会员服务

8+阅读 · 4月6日

“史诗狂怒行动”中的海军动态

“史诗狂怒行动”中的海军动态

专知会员服务

10+阅读 · 4月5日

【博士论文】预训练语言模型中结构化叙事表示的解释性研究

【博士论文】预训练语言模型中结构化叙事表示的解释性研究

专知会员服务

11+阅读 · 4月5日

相关VIP内容

视觉-语言-动作（VLA）模型的前世今生

视觉-语言-动作（VLA）模型的前世今生

专知会员服务

20+阅读 · 2025年8月29日

面向具身操作的视觉-语言-动作模型综述

面向具身操作的视觉-语言-动作模型综述

专知会员服务

28+阅读 · 2025年8月23日

面向机器人操作的基于大型视觉‑语言模型（VLM）的视觉‑语言‑动作（VLA）模型综述

面向机器人操作的基于大型视觉‑语言模型（VLM）的视觉‑语言‑动作（VLA）模型综述

专知会员服务

34+阅读 · 2025年8月19日

视觉语言动作模型：概念、进展、应用与挑战

视觉语言动作模型：概念、进展、应用与挑战

专知会员服务

19+阅读 · 2025年5月18日

【CVPR2025】CrayonRobo：面向机器人操作的以对象为中心的提示驱动视觉-语言-动作模型

【CVPR2025】CrayonRobo：面向机器人操作的以对象为中心的提示驱动视觉-语言-动作模型

专知会员服务

10+阅读 · 2025年5月6日

《面向无人机实时认知任务解决的视觉-语言-动作（VLA）模型与评估基准》

《面向无人机实时认知任务解决的视觉-语言-动作（VLA）模型与评估基准》

专知会员服务

41+阅读 · 2025年3月9日

【博士论文】学习视觉-语言表示以实现多模态理解

【博士论文】学习视觉-语言表示以实现多模态理解

专知会员服务

28+阅读 · 2025年2月8日

【NeurIPS2023】PAXION：在视频-语言基础模型中修补动作知识

【NeurIPS2023】PAXION：在视频-语言基础模型中修补动作知识

专知会员服务

18+阅读 · 2023年9月24日

【华盛顿大学】用于视觉和语言导航的多视图学习，Multi-View Learning for Vision-and-Language Navigation

【华盛顿大学】用于视觉和语言导航的多视图学习，Multi-View Learning for Vision-and-Language Navigation

专知会员服务

31+阅读 · 2020年3月11日

斯坦福大学李飞飞组发布Action Genome:一种新的表达形式，新的数据集，以及将动作分解成时空场景图的新模型

斯坦福大学李飞飞组发布Action Genome:一种新的表达形式，新的数据集，以及将动作分解成时空场景图的新模型

专知会员服务

40+阅读 · 2020年1月12日

热门VIP内容

开通专知VIP会员享更多权益服务

从预训练模型到大语言模型：人工智能驱动的心理计算综述

《对信息环境分析实现人工智能预测冲突》96页

【剑桥博士论文】迈向高效、科学且普适的小语言模型开发之道

乌克兰-委内瑞拉-伊朗冲突：人工智能在现代军事行动中的飞速演进

相关资讯

多模态视觉语言表征学习研究综述

多模态视觉语言表征学习研究综述

专知

27+阅读 · 2020年12月3日

【ACMMM2020-北航】KBGN:用于视觉对话中自适应视觉-文本推理的知识桥图网络

【ACMMM2020-北航】KBGN:用于视觉对话中自适应视觉-文本推理的知识桥图网络

专知

10+阅读 · 2020年8月12日

【CVPR2020-牛津-谷歌】语音到动作:动作识别的跨模态监督，Cross-modal Supervision

【CVPR2020-牛津-谷歌】语音到动作:动作识别的跨模态监督，Cross-modal Supervision

专知

10+阅读 · 2020年3月31日

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

专知

20+阅读 · 2019年11月24日

NLP+CV《桥接视觉与语言的研究综述》，带你全面了解视觉+语言最新应用和方法

NLP+CV《桥接视觉与语言的研究综述》，带你全面了解视觉+语言最新应用和方法

中国人工智能学会

27+阅读 · 2019年7月24日

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

AI科技评论

12+阅读 · 2019年5月2日

一文看懂如何将深度学习应用于视频动作识别

一文看懂如何将深度学习应用于视频动作识别

AI前线

11+阅读 · 2018年7月15日

从NLP到CV+NLP: 计算机视觉和自然语言处理结合介绍 | 公开课

从NLP到CV+NLP: 计算机视觉和自然语言处理结合介绍 | 公开课

AI研习社

14+阅读 · 2018年1月28日

【计算机视觉必读干货】图像分类、定位、检测，语义分割和实例分割方法梳理

【计算机视觉必读干货】图像分类、定位、检测，语义分割和实例分割方法梳理

新智元

35+阅读 · 2018年1月24日

干货｜基于双流递归神经网络的人体骨架行为识别！

干货｜基于双流递归神经网络的人体骨架行为识别！

全球人工智能

13+阅读 · 2017年12月15日

相关论文

FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model

Arxiv

0+阅读 · 3月11日

NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models

Arxiv

0+阅读 · 3月10日

KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models

Arxiv

0+阅读 · 3月2日

Recursive Belief Vision Language Action Models

Arxiv

0+阅读 · 2月25日

PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding

Arxiv

0+阅读 · 2月25日

ForeAct: Steering Your VLA with Efficient Visual Foresight Planning

Arxiv

0+阅读 · 2月12日

VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model

Arxiv

0+阅读 · 2月12日

ST4VLA: Spatially Guided Training for Vision-Language-Action Models

Arxiv

0+阅读 · 2月10日

VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model

Arxiv

0+阅读 · 2月10日

Efficient Long-Horizon Vision-Language-Action Models via Static-Dynamic Disentanglement

Arxiv

0+阅读 · 2月3日

相关基金

人类视空间分类的神经机制

国家自然科学基金

1+阅读 · 2015年12月31日

彩色/多光谱异源双目视频运动目标分割方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

视知觉学习中的脑功能网络变化及其与学习效果的关系

国家自然科学基金

0+阅读 · 2015年12月31日

儿童手写运动促进中英文感知的认知神经机制

国家自然科学基金

0+阅读 · 2015年12月31日

强调与对比影响语篇理解的认知过程及其神经机制

国家自然科学基金

4+阅读 · 2015年12月31日

深度学习框架下基于情境线索的视觉注意研究

国家自然科学基金

2+阅读 · 2015年12月31日

维吾尔语韵律结构的分析与预测模型的研究

国家自然科学基金

0+阅读 · 2014年12月31日

数据驱动的人体图像语义分割研究

国家自然科学基金

5+阅读 · 2014年12月31日

基于集成流形学习的监控视频中人体行为识别研究

国家自然科学基金

3+阅读 · 2014年12月31日

运动目标间语义关系的时空建模及可视化研究

国家自然科学基金

1+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员