Instruction-Following Agents with Multimodal Transformer - 专知论文

会员服务 ·

0

多模态Transformer · 多模 · 模态 · 多模态 · Transformer ·

2023 年 3 月 25 日

Instruction-Following Agents with Multimodal Transformer

翻译：指令遵循智能体与多模态Transformer

Hao Liu,Lisa Lee,Kimin Lee,Pieter Abbeel

from arxiv, fixed a typo in affiliation

Humans are excellent at understanding language and vision to accomplish a wide range of tasks. In contrast, creating general instruction-following embodied agents remains a difficult challenge. Prior work that uses pure language-only models lack visual grounding, making it difficult to connect language instructions with visual observations. On the other hand, methods that use pre-trained multimodal models typically come with divided language and visual representations, requiring designing specialized network architecture to fuse them together. We propose a simple yet effective model for robots to solve instruction-following tasks in vision-based environments. Our \ours method consists of a multimodal transformer that encodes visual observations and language instructions, and a transformer-based policy that predicts actions based on encoded representations. The multimodal transformer is pre-trained on millions of image-text pairs and natural language text, thereby producing generic cross-modal representations of observations and instructions. The transformer-based policy keeps track of the full history of observations and actions, and predicts actions autoregressively. Despite its simplicity, we show that this unified transformer model outperforms all state-of-the-art pre-trained or trained-from-scratch methods in both single-task and multi-task settings. Our model also shows better model scalability and generalization ability than prior work.

翻译：人类在理解语言和视觉以完成广泛任务方面表现出色。相比之下，构建通用的指令遵循具身智能体仍是一项艰巨挑战。先前使用纯语言模型的方法缺乏视觉基础，难以将语言指令与视觉观察联系起来。另一方面，使用预训练多模态模型的方法通常具有分离的语言和视觉表征，需要设计专门的网络架构进行融合。我们提出了一种简单而有效的机器人视觉环境指令遵循任务模型。所提方法包含一个编码视觉观察和语言指令的多模态Transformer，以及一个基于编码表征预测动作的Transformer策略。该多模态Transformer通过数百万图像-文本对和自然语言文本进行预训练，从而生成观察与指令的通用跨模态表征。基于Transformer的策略会跟踪完整的观察与动作历史，并以自回归方式预测动作。尽管模型结构简洁，但实验表明，这种统一的Transformer模型在单任务和多任务设置下均优于所有最先进的预训练或从头训练方法。该模型在可扩展性和泛化能力方面也优于先前工作。

0

相关内容

多模态Transformer

多模态Transformer

【CVPR2023】Mask3D:通过学习掩码3D先验对2D视觉transformer进行预训练

【CVPR2023】Mask3D:通过学习掩码3D先验对2D视觉transformer进行预训练

专知会员服务

24+阅读 · 2023年4月9日

【CMU博士论文】多语言视觉-语言模型研究，190页pdf

【CMU博士论文】多语言视觉-语言模型研究，190页pdf

专知会员服务

36+阅读 · 2023年2月15日

【MIT博士论文】多模态模型学习语言，138页pdf

【MIT博士论文】多模态模型学习语言，138页pdf

专知会员服务

58+阅读 · 2022年12月23日

【NUS博士论文】学习视觉场景的结构化表示，137页pdf

【NUS博士论文】学习视觉场景的结构化表示，137页pdf

专知会员服务

38+阅读 · 2022年7月15日

【AAAI2022】用于视觉常识推理的场景图增强图像-文本学习

【AAAI2022】用于视觉常识推理的场景图增强图像-文本学习

专知会员服务

50+阅读 · 2021年12月20日

【NeurIPS 2021 】MST: 用于Transformer视觉表征的Masked自监督解读

【NeurIPS 2021 】MST: 用于Transformer视觉表征的Masked自监督解读

专知会员服务

42+阅读 · 2021年12月11日

【斯坦福博士论文】视觉语言的多模态表示，102页pdf

专知会员服务

73+阅读 · 2021年7月29日

【EMNLP2020】自然语言分类任务的自监督元学习

专知会员服务

30+阅读 · 2020年9月18日

【CVPR2020-牛津-谷歌】语音到动作:动作识别的跨模态监督，Cross-modal Supervision

【CVPR2020-牛津-谷歌】语音到动作:动作识别的跨模态监督，Cross-modal Supervision

专知会员服务

24+阅读 · 2020年3月31日

如何构建多模态BERT? 这份UNC76页《LXMERT: 从Transformer学习跨模态编码表示》PPT告诉您，附论文代码

如何构建多模态BERT? 这份UNC76页《LXMERT: 从Transformer学习跨模态编码表示》PPT告诉您，附论文代码

专知会员服务

85+阅读 · 2020年2月27日

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

专知

12+阅读 · 2023年4月4日

GENIUS: 根据草稿进行文本生成的预训练模型，可用于多种NLP任务的数据增强

GENIUS: 根据草稿进行文本生成的预训练模型，可用于多种NLP任务的数据增强

PaperWeekly

1+阅读 · 2022年11月29日

DeepMind提出「算法蒸馏」：可探索的预训练强化学习Transformer

DeepMind提出「算法蒸馏」：可探索的预训练强化学习Transformer

极市平台

2+阅读 · 2022年11月3日

DeepMind新作：无需权重更新、提示和微调，transformer在试错中自主改进

DeepMind新作：无需权重更新、提示和微调，transformer在试错中自主改进

机器之心

1+阅读 · 2022年10月28日

论文浅尝 | 弱监督下极简的视觉语言预训练模型

论文浅尝 | 弱监督下极简的视觉语言预训练模型

开放知识图谱

1+阅读 · 2022年9月26日

强化学习大牛Sergey Levine新作：三个大模型教会机器人认路

强化学习大牛Sergey Levine新作：三个大模型教会机器人认路

机器之心

2+阅读 · 2022年7月24日

【NUS博士论文】学习视觉场景的结构化表示，137页pdf

【NUS博士论文】学习视觉场景的结构化表示，137页pdf

专知

6+阅读 · 2022年7月15日

Gato之后，谷歌也推出「通才型」智能体Multi-Game Decision Transformers

Gato之后，谷歌也推出「通才型」智能体Multi-Game Decision Transformers

机器之心

1+阅读 · 2022年6月12日

星际争霸II协作对抗基准超越SOTA，新型Transformer架构解决多智能体强化学习问题

星际争霸II协作对抗基准超越SOTA，新型Transformer架构解决多智能体强化学习问题

机器之心

0+阅读 · 2022年6月2日

【CVPR2020-牛津-谷歌】语音到动作:动作识别的跨模态监督，Cross-modal Supervision

【CVPR2020-牛津-谷歌】语音到动作:动作识别的跨模态监督，Cross-modal Supervision

专知

10+阅读 · 2020年3月31日

旋转飞行物体的状态估计与轨迹预测

国家自然科学基金

0+阅读 · 2014年12月31日

大型桥梁结构模型修正的RBF响应面与子结构方法

国家自然科学基金

0+阅读 · 2013年12月31日

基于多任务稀疏特征学习的海量图像理解方法研究

国家自然科学基金

2+阅读 · 2013年12月31日

笔+触控界面关键人因问题和交互策略的研究

国家自然科学基金

0+阅读 · 2012年12月31日

脑力工作系统中基于人的行为的多通道工作负荷测量方法研究

国家自然科学基金

0+阅读 · 2012年12月31日

普适环境下基于三维肢体动作理解的助老机器人交互技术研究

国家自然科学基金

0+阅读 · 2012年12月31日

自主虚拟人智能感知决策与真实感交互表现研究

国家自然科学基金

7+阅读 · 2012年12月31日

面向任务约束启发的可重构机械臂模块化协同控制方法研究

国家自然科学基金

0+阅读 · 2012年12月31日

基于在线自适应追踪技术的先进结构损伤识别方法研究

国家自然科学基金

0+阅读 · 2011年12月31日

可学习的脉冲耦合神经网络与基于视-听觉融合的人机交互方法研究

国家自然科学基金

0+阅读 · 2008年12月31日

Accelerating Transformer Inference for Translation via Parallel Decoding

Arxiv

0+阅读 · 2023年5月17日

An Empirical Study on the Language Modal in Visual Question Answering

Arxiv

0+阅读 · 2023年5月17日

SpecInfer: Accelerating Generative LLM Serving with Speculative Inference and Token Tree Verification

Arxiv

0+阅读 · 2023年5月16日

Blind Image Quality Assessment via Transformer Predicted Error Map and Perceptual Quality Token

Arxiv

0+阅读 · 2023年5月16日

A Critical View Of Vision-Based Long-Term Dynamics Prediction Under Environment Misalignment

Arxiv

0+阅读 · 2023年5月12日

Bilaterally Slimmable Transformer for Elastic and Efficient Visual Question Answering

Arxiv

0+阅读 · 2023年5月12日

Versatile Audio-Visual Learning for Handling Single and Multi Modalities in Emotion Regression and Classification Tasks

Arxiv

0+阅读 · 2023年5月12日

Foundations of Spatial Perception for Robotics: Hierarchical Representations and Real-time Systems

Arxiv

0+阅读 · 2023年5月11日

NeuralField-LDM: Scene Generation with Hierarchical Latent Diffusion Models

Arxiv

43+阅读 · 2023年4月19日

Multimodal Prompting with Missing Modalities for Visual Recognition

Arxiv

11+阅读 · 2023年3月6日

VIP会员

文章信息

相关主题

多模态Transformer

最新内容

博士论文 | 面向大模型推理的内存高效算法

博士论文 | 面向大模型推理的内存高效算法

专知会员服务

0+阅读 · 今天15:20

论文解读 | 从预训练到后训练：理解大模型推理能力如何形成

论文解读 | 从预训练到后训练：理解大模型推理能力如何形成

专知会员服务

0+阅读 · 今天15:18

《无人系统互操作性导论——无人系统联合架构（JAUS）》

《无人系统互操作性导论——无人系统联合架构（JAUS）》

专知会员服务

8+阅读 · 今天5:53

美空军新型反无人机部队初探

美空军新型反无人机部队初探

专知会员服务

4+阅读 · 今天5:45

《对抗性电磁环境下远程巡飞弹作战的安全指挥与控制数据链》

《对抗性电磁环境下远程巡飞弹作战的安全指挥与控制数据链》

专知会员服务

2+阅读 · 今天5:23

《北约下一代建模与仿真（NexGen M&S）计划》2026年69页

《北约下一代建模与仿真（NexGen M&S）计划》2026年69页

专知会员服务

2+阅读 · 今天5:11

《防空交战流程的概率建模研究》

《防空交战流程的概率建模研究》

专知会员服务

6+阅读 · 今天5:04

ICML 2026 教程 | 数值优化理论还重要吗？

ICML 2026 教程 | 数值优化理论还重要吗？

专知会员服务

4+阅读 · 7月26日

ICM 2026 | 陶哲轩：人工智能时代的数学

ICM 2026 | 陶哲轩：人工智能时代的数学

专知会员服务

8+阅读 · 7月26日

《面向可扩展高韧性无人机集群网络的速度感知分层通信框架》

《面向可扩展高韧性无人机集群网络的速度感知分层通信框架》

专知会员服务

8+阅读 · 7月26日

《面向概率推理的可定制战术引擎及其在军事任务规划中的应用》

《面向概率推理的可定制战术引擎及其在军事任务规划中的应用》

专知会员服务

10+阅读 · 7月26日

《先进防空系统选型战略框架：基于巴基斯坦的实证启示》

《先进防空系统选型战略框架：基于巴基斯坦的实证启示》

专知会员服务

8+阅读 · 7月26日

《反无人机交战场景下的战斗归零研究》

《反无人机交战场景下的战斗归零研究》

专知会员服务

7+阅读 · 7月26日

霍尔木兹与不对称作战时代：水雷、无人系统与海军力量的重新定义

霍尔木兹与不对称作战时代：水雷、无人系统与海军力量的重新定义

专知会员服务

4+阅读 · 7月26日

博士论文 | 用代码结构感知方法推进代码大模型

博士论文 | 用代码结构感知方法推进代码大模型

专知会员服务

5+阅读 · 7月25日

相关VIP内容

【CVPR2023】Mask3D:通过学习掩码3D先验对2D视觉transformer进行预训练

【CVPR2023】Mask3D:通过学习掩码3D先验对2D视觉transformer进行预训练

专知会员服务

24+阅读 · 2023年4月9日

【CMU博士论文】多语言视觉-语言模型研究，190页pdf

【CMU博士论文】多语言视觉-语言模型研究，190页pdf

专知会员服务

36+阅读 · 2023年2月15日

【MIT博士论文】多模态模型学习语言，138页pdf

【MIT博士论文】多模态模型学习语言，138页pdf

专知会员服务

58+阅读 · 2022年12月23日

【NUS博士论文】学习视觉场景的结构化表示，137页pdf

【NUS博士论文】学习视觉场景的结构化表示，137页pdf

专知会员服务

38+阅读 · 2022年7月15日

【AAAI2022】用于视觉常识推理的场景图增强图像-文本学习

【AAAI2022】用于视觉常识推理的场景图增强图像-文本学习

专知会员服务

50+阅读 · 2021年12月20日

【NeurIPS 2021 】MST: 用于Transformer视觉表征的Masked自监督解读

【NeurIPS 2021 】MST: 用于Transformer视觉表征的Masked自监督解读

专知会员服务

42+阅读 · 2021年12月11日

【斯坦福博士论文】视觉语言的多模态表示，102页pdf

专知会员服务

73+阅读 · 2021年7月29日

【EMNLP2020】自然语言分类任务的自监督元学习

专知会员服务

30+阅读 · 2020年9月18日

【CVPR2020-牛津-谷歌】语音到动作:动作识别的跨模态监督，Cross-modal Supervision

【CVPR2020-牛津-谷歌】语音到动作:动作识别的跨模态监督，Cross-modal Supervision

专知会员服务

24+阅读 · 2020年3月31日

如何构建多模态BERT? 这份UNC76页《LXMERT: 从Transformer学习跨模态编码表示》PPT告诉您，附论文代码

如何构建多模态BERT? 这份UNC76页《LXMERT: 从Transformer学习跨模态编码表示》PPT告诉您，附论文代码

专知会员服务

85+阅读 · 2020年2月27日

热门VIP内容

开通专知VIP会员享更多权益服务

论文解读 | 从预训练到后训练：理解大模型推理能力如何形成

美空军新型反无人机部队初探

博士论文 | 面向大模型推理的内存高效算法

《无人系统互操作性导论——无人系统联合架构（JAUS）》

相关资讯

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

【斯坦福博士论文】将深度学习机器人学习扩展到广泛的现实世界数据，176页pdf

专知

12+阅读 · 2023年4月4日

GENIUS: 根据草稿进行文本生成的预训练模型，可用于多种NLP任务的数据增强

GENIUS: 根据草稿进行文本生成的预训练模型，可用于多种NLP任务的数据增强

PaperWeekly

1+阅读 · 2022年11月29日

DeepMind提出「算法蒸馏」：可探索的预训练强化学习Transformer

DeepMind提出「算法蒸馏」：可探索的预训练强化学习Transformer

极市平台

2+阅读 · 2022年11月3日

DeepMind新作：无需权重更新、提示和微调，transformer在试错中自主改进

DeepMind新作：无需权重更新、提示和微调，transformer在试错中自主改进

机器之心

1+阅读 · 2022年10月28日

论文浅尝 | 弱监督下极简的视觉语言预训练模型

论文浅尝 | 弱监督下极简的视觉语言预训练模型

开放知识图谱

1+阅读 · 2022年9月26日

强化学习大牛Sergey Levine新作：三个大模型教会机器人认路

强化学习大牛Sergey Levine新作：三个大模型教会机器人认路

机器之心

2+阅读 · 2022年7月24日

【NUS博士论文】学习视觉场景的结构化表示，137页pdf

【NUS博士论文】学习视觉场景的结构化表示，137页pdf

专知

6+阅读 · 2022年7月15日

Gato之后，谷歌也推出「通才型」智能体Multi-Game Decision Transformers

Gato之后，谷歌也推出「通才型」智能体Multi-Game Decision Transformers

机器之心

1+阅读 · 2022年6月12日

星际争霸II协作对抗基准超越SOTA，新型Transformer架构解决多智能体强化学习问题

星际争霸II协作对抗基准超越SOTA，新型Transformer架构解决多智能体强化学习问题

机器之心

0+阅读 · 2022年6月2日

【CVPR2020-牛津-谷歌】语音到动作:动作识别的跨模态监督，Cross-modal Supervision

【CVPR2020-牛津-谷歌】语音到动作:动作识别的跨模态监督，Cross-modal Supervision

专知

10+阅读 · 2020年3月31日

相关论文

Accelerating Transformer Inference for Translation via Parallel Decoding

Arxiv

0+阅读 · 2023年5月17日

An Empirical Study on the Language Modal in Visual Question Answering

Arxiv

0+阅读 · 2023年5月17日

SpecInfer: Accelerating Generative LLM Serving with Speculative Inference and Token Tree Verification

Arxiv

0+阅读 · 2023年5月16日

Blind Image Quality Assessment via Transformer Predicted Error Map and Perceptual Quality Token

Arxiv

0+阅读 · 2023年5月16日

A Critical View Of Vision-Based Long-Term Dynamics Prediction Under Environment Misalignment

Arxiv

0+阅读 · 2023年5月12日

Bilaterally Slimmable Transformer for Elastic and Efficient Visual Question Answering

Arxiv

0+阅读 · 2023年5月12日

Versatile Audio-Visual Learning for Handling Single and Multi Modalities in Emotion Regression and Classification Tasks

Arxiv

0+阅读 · 2023年5月12日

Foundations of Spatial Perception for Robotics: Hierarchical Representations and Real-time Systems

Arxiv

0+阅读 · 2023年5月11日

NeuralField-LDM: Scene Generation with Hierarchical Latent Diffusion Models

Arxiv

43+阅读 · 2023年4月19日

Multimodal Prompting with Missing Modalities for Visual Recognition

Arxiv

11+阅读 · 2023年3月6日

相关基金

旋转飞行物体的状态估计与轨迹预测

国家自然科学基金

0+阅读 · 2014年12月31日

大型桥梁结构模型修正的RBF响应面与子结构方法

国家自然科学基金

0+阅读 · 2013年12月31日

基于多任务稀疏特征学习的海量图像理解方法研究

国家自然科学基金

2+阅读 · 2013年12月31日

笔+触控界面关键人因问题和交互策略的研究

国家自然科学基金

0+阅读 · 2012年12月31日

脑力工作系统中基于人的行为的多通道工作负荷测量方法研究

国家自然科学基金

0+阅读 · 2012年12月31日

普适环境下基于三维肢体动作理解的助老机器人交互技术研究

国家自然科学基金

0+阅读 · 2012年12月31日

自主虚拟人智能感知决策与真实感交互表现研究

国家自然科学基金

7+阅读 · 2012年12月31日

面向任务约束启发的可重构机械臂模块化协同控制方法研究

国家自然科学基金

0+阅读 · 2012年12月31日

基于在线自适应追踪技术的先进结构损伤识别方法研究

国家自然科学基金

0+阅读 · 2011年12月31日

可学习的脉冲耦合神经网络与基于视-听觉融合的人机交互方法研究

国家自然科学基金

0+阅读 · 2008年12月31日

微信扫码咨询专知VIP会员