MDE-AgriVLN：基于单目深度估计的农业视觉与语言导航 (MDE-AgriVLN: Agricultural Vision-and-Language Navigation with Monocular Depth Estimation) - 专知论文

会员服务 ·

0

单目深度估计 · 深度估计 · 基准 · 农业机器人 · 机器人 ·

MDE-AgriVLN: Agricultural Vision-and-Language Navigation with Monocular Depth Estimation

翻译：MDE-AgriVLN：基于单目深度估计的农业视觉与语言导航

Xiaobei Zhao,Xingqi Lyu,Xin Chen,Xiang Li

Agricultural robots are serving as powerful assistants across a wide range of agricultural tasks, nevertheless, still heavily relying on manual operations or railway systems for movement. The AgriVLN method and the A2A benchmark pioneeringly extended Vision-and-Language Navigation (VLN) to the agricultural domain, enabling a robot to navigate to a target position following a natural language instruction. Unlike human binocular vision, most agricultural robots are only given a single camera for monocular vision, which results in limited spatial perception. To bridge this gap, we present the method of Agricultural Vision-and-Language Navigation with Monocular Depth Estimation (MDE-AgriVLN), in which we propose the MDE module generating depth features from RGB images, to assist the decision-maker on multimodal reasoning. When evaluated on the A2A benchmark, our MDE-AgriVLN method successfully increases Success Rate from 0.23 to 0.32 and decreases Navigation Error from 4.43m to 4.08m, demonstrating the state-of-the-art performance in the agricultural VLN domain. Code: https://github.com/AlexTraveling/MDE-AgriVLN.

翻译：农业机器人正作为强大的助手服务于广泛的农业任务，然而其移动仍严重依赖人工操作或轨道系统。AgriVLN方法与A2A基准率先将视觉与语言导航（VLN）扩展至农业领域，使机器人能够依据自然语言指令导航至目标位置。与人类的双目视觉不同，大多数农业机器人仅配备单目视觉的单摄像头，导致空间感知能力受限。为弥补这一差距，我们提出了基于单目深度估计的农业视觉与语言导航方法（MDE-AgriVLN），其中我们设计了可从RGB图像生成深度特征的MDE模块，以辅助决策器进行多模态推理。在A2A基准上的评估结果表明，我们的MDE-AgriVLN方法将成功率从0.23提升至0.32，并将导航误差从4.43米降低至4.08米，展现了在农业VLN领域最先进的性能。代码：https://github.com/AlexTraveling/MDE-AgriVLN。

0

相关内容

单目深度估计

单目深度估计

面向机器人操作的基于大型视觉‑语言模型（VLM）的视觉‑语言‑动作（VLA）模型综述

面向机器人操作的基于大型视觉‑语言模型（VLM）的视觉‑语言‑动作（VLA）模型综述

专知会员服务

34+阅读 · 2025年8月19日

基于视觉的无人机定位与导航方法研究综述

基于视觉的无人机定位与导航方法研究综述

专知会员服务

21+阅读 · 2025年5月21日

【ICLR2025】视觉与语言导航的通用场景适应

【ICLR2025】视觉与语言导航的通用场景适应

专知会员服务

9+阅读 · 2025年1月31日

MME-Survey：多模态大型语言模型评估的综合性调查

MME-Survey：多模态大型语言模型评估的综合性调查

专知会员服务

43+阅读 · 2024年12月1日

视觉语言导航：大模型时代的综述

视觉语言导航：大模型时代的综述

专知会员服务

51+阅读 · 2024年7月10日

深度学习在农业领域的研究与应用

深度学习在农业领域的研究与应用

专知会员服务

23+阅读 · 2024年5月3日

【CVPR2024】用于视觉-语言导航的体积环境表示

【CVPR2024】用于视觉-语言导航的体积环境表示

专知会员服务

19+阅读 · 2024年3月24日

【AAAI2024】VLN-VIDEO: 利用驾驶视频进行户外视觉语言导航

【AAAI2024】VLN-VIDEO: 利用驾驶视频进行户外视觉语言导航

专知会员服务

10+阅读 · 2024年2月10日

【CVPR2023】KERM:面向视觉语言导航的知识增强推理

【CVPR2023】KERM:面向视觉语言导航的知识增强推理

专知会员服务

24+阅读 · 2023年3月30日

【视觉和语言导航:任务、方法和未来方向的综述】Vision-and-Language Navigation: A Survey of Tasks, Methods, and Future Directions

【视觉和语言导航:任务、方法和未来方向的综述】Vision-and-Language Navigation: A Survey of Tasks, Methods, and Future Directions

专知会员服务

37+阅读 · 2022年3月25日

从T5到GPT-4最新最全梳理，人大等《大型语言模型综述》，51页pdf详述大模型进展

从T5到GPT-4最新最全梳理，人大等《大型语言模型综述》，51页pdf详述大模型进展

专知

25+阅读 · 2023年4月4日

推荐！【美国陆军战略项目年度报告】《人工智能（AI）用于多域作战（MDO）的指挥和控制（C2）》完整译文，美国陆军研究实验室

推荐！【美国陆军战略项目年度报告】《人工智能（AI）用于多域作战（MDO）的指挥和控制（C2）》完整译文，美国陆军研究实验室

专知

57+阅读 · 2022年9月24日

《通过近似动态规划解决具有动态目标到达的多Agent路由问题》美国空军大学130页学位论文

《通过近似动态规划解决具有动态目标到达的多Agent路由问题》美国空军大学130页学位论文

专知

15+阅读 · 2022年7月22日

蚂蚁金服人工智能部论文《AGL:可扩展工业图机器学习系统》，处理十亿节点千亿边图数据的GNNs训练推理

蚂蚁金服人工智能部论文《AGL:可扩展工业图机器学习系统》，处理十亿节点千亿边图数据的GNNs训练推理

专知

33+阅读 · 2020年3月9日

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

专知

20+阅读 · 2019年11月24日

【泡泡图灵智库】PL-VIO：使用点和线特征的紧耦合单目视觉惯性里程计

【泡泡图灵智库】PL-VIO：使用点和线特征的紧耦合单目视觉惯性里程计

泡泡机器人SLAM

53+阅读 · 2019年7月9日

计算机视觉方向简介 | 基于单目视觉的三维重建算法

计算机视觉方向简介 | 基于单目视觉的三维重建算法

计算机视觉life

32+阅读 · 2019年4月9日

【AGV】仓库内多AGV协作的全局路径规划算法的研究

【AGV】仓库内多AGV协作的全局路径规划算法的研究

产业智能官

28+阅读 · 2018年11月10日

CVPR 2018 | 商汤科技Spotlight论文详解：单目深度估计技术

CVPR 2018 | 商汤科技Spotlight论文详解：单目深度估计技术

商汤科技

14+阅读 · 2018年6月2日

视觉里程计：起源、优势、对比、应用

视觉里程计：起源、优势、对比、应用

计算机视觉life

18+阅读 · 2017年7月17日

基于Petri网的自动化码头多AGV系统的死锁解决策略研究

国家自然科学基金

1+阅读 · 2017年12月31日

未知环境下基于单目视觉的移动平台目标跟踪方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于自动导航的旋翼式微小型无人机农作物遥感信息解析方法

国家自然科学基金

3+阅读 · 2015年12月31日

空地机器人网络的同时视觉目标定位与分布式运动规划

国家自然科学基金

4+阅读 · 2015年12月31日

仿动物大脑网格细胞神经定位机制的同步定位与地图构建方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

面向无人机基于在线场景建模的室外目标检测与跟踪方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

稻油轮作系统农业机械化生产工程模式和管理决策方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于多光谱结构光立体视觉的大田棉花高精度定位与成熟度分级

国家自然科学基金

0+阅读 · 2015年12月31日

抗干扰的农作物种植模式自动提取方法

国家自然科学基金

0+阅读 · 2014年12月31日

基于深度学习的特征融合在移动机器人视觉中的场景理解及研究

国家自然科学基金

12+阅读 · 2014年12月31日

Memory-Maze: Scenario Driven Visual Language Navigation Benchmark for Guiding Blind People

Arxiv

0+阅读 · 1月27日

DV-VLN: Dual Verification for Reliable LLM-Based Vision-and-Language Navigation

Arxiv

0+阅读 · 1月26日

Visual-Language-Guided Task Planning for Horticultural Robots

Arxiv

0+阅读 · 1月17日

AgriAgent: Contract-Driven Planning and Capability-Aware Tool Orchestration in Real-World Agriculture

Arxiv

0+阅读 · 1月13日

ImagineNav++: Prompting Vision-Language Models as Embodied Navigator through Scene Imagination

Arxiv

0+阅读 · 1月8日

Agri-R1: Empowering Generalizable Agricultural Reasoning in Vision-Language Models with Reinforcement Learning

Arxiv

0+阅读 · 1月8日

VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation agents

Arxiv

0+阅读 · 1月6日

AdaVLN: Towards Visual Language Navigation in Continuous Indoor Environments with Moving Humans

Arxiv

0+阅读 · 1月6日

AdaVLN: Towards Visual Language Navigation in Continuous Indoor Environments with Moving Humans

Arxiv

0+阅读 · 1月5日

AINav: Large Language Model-Based Adaptive Interactive Navigation

Arxiv

0+阅读 · 2025年12月31日

VIP会员

文章信息

相关主题

单目深度估计

农业机器人

相关VIP内容

面向机器人操作的基于大型视觉‑语言模型（VLM）的视觉‑语言‑动作（VLA）模型综述

面向机器人操作的基于大型视觉‑语言模型（VLM）的视觉‑语言‑动作（VLA）模型综述

专知会员服务

34+阅读 · 2025年8月19日

基于视觉的无人机定位与导航方法研究综述

基于视觉的无人机定位与导航方法研究综述

专知会员服务

21+阅读 · 2025年5月21日

【ICLR2025】视觉与语言导航的通用场景适应

【ICLR2025】视觉与语言导航的通用场景适应

专知会员服务

9+阅读 · 2025年1月31日

MME-Survey：多模态大型语言模型评估的综合性调查

MME-Survey：多模态大型语言模型评估的综合性调查

专知会员服务

43+阅读 · 2024年12月1日

视觉语言导航：大模型时代的综述

视觉语言导航：大模型时代的综述

专知会员服务

51+阅读 · 2024年7月10日

深度学习在农业领域的研究与应用

深度学习在农业领域的研究与应用

专知会员服务

23+阅读 · 2024年5月3日

【CVPR2024】用于视觉-语言导航的体积环境表示

【CVPR2024】用于视觉-语言导航的体积环境表示

专知会员服务

19+阅读 · 2024年3月24日

【AAAI2024】VLN-VIDEO: 利用驾驶视频进行户外视觉语言导航

【AAAI2024】VLN-VIDEO: 利用驾驶视频进行户外视觉语言导航

专知会员服务

10+阅读 · 2024年2月10日

【CVPR2023】KERM:面向视觉语言导航的知识增强推理

【CVPR2023】KERM:面向视觉语言导航的知识增强推理

专知会员服务

24+阅读 · 2023年3月30日

【视觉和语言导航:任务、方法和未来方向的综述】Vision-and-Language Navigation: A Survey of Tasks, Methods, and Future Directions

【视觉和语言导航:任务、方法和未来方向的综述】Vision-and-Language Navigation: A Survey of Tasks, Methods, and Future Directions

专知会员服务

37+阅读 · 2022年3月25日

热门VIP内容

开通专知VIP会员享更多权益服务

美国防部门开始扩建金穹反导系统基础设施

《基于选择性深度神经网络分类的弹性无线通信》最新报告

《多域作战中融合网络、电子战与动能机动》

《在东欧磨砺反无人机技能》美陆军最新反无人机训练报告

相关资讯

从T5到GPT-4最新最全梳理，人大等《大型语言模型综述》，51页pdf详述大模型进展

从T5到GPT-4最新最全梳理，人大等《大型语言模型综述》，51页pdf详述大模型进展

专知

25+阅读 · 2023年4月4日

推荐！【美国陆军战略项目年度报告】《人工智能（AI）用于多域作战（MDO）的指挥和控制（C2）》完整译文，美国陆军研究实验室

推荐！【美国陆军战略项目年度报告】《人工智能（AI）用于多域作战（MDO）的指挥和控制（C2）》完整译文，美国陆军研究实验室

专知

57+阅读 · 2022年9月24日

《通过近似动态规划解决具有动态目标到达的多Agent路由问题》美国空军大学130页学位论文

《通过近似动态规划解决具有动态目标到达的多Agent路由问题》美国空军大学130页学位论文

专知

15+阅读 · 2022年7月22日

蚂蚁金服人工智能部论文《AGL:可扩展工业图机器学习系统》，处理十亿节点千亿边图数据的GNNs训练推理

蚂蚁金服人工智能部论文《AGL:可扩展工业图机器学习系统》，处理十亿节点千亿边图数据的GNNs训练推理

专知

33+阅读 · 2020年3月9日

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

专知

20+阅读 · 2019年11月24日

【泡泡图灵智库】PL-VIO：使用点和线特征的紧耦合单目视觉惯性里程计

【泡泡图灵智库】PL-VIO：使用点和线特征的紧耦合单目视觉惯性里程计

泡泡机器人SLAM

53+阅读 · 2019年7月9日

计算机视觉方向简介 | 基于单目视觉的三维重建算法

计算机视觉方向简介 | 基于单目视觉的三维重建算法

计算机视觉life

32+阅读 · 2019年4月9日

【AGV】仓库内多AGV协作的全局路径规划算法的研究

【AGV】仓库内多AGV协作的全局路径规划算法的研究

产业智能官

28+阅读 · 2018年11月10日

CVPR 2018 | 商汤科技Spotlight论文详解：单目深度估计技术

CVPR 2018 | 商汤科技Spotlight论文详解：单目深度估计技术

商汤科技

14+阅读 · 2018年6月2日

视觉里程计：起源、优势、对比、应用

视觉里程计：起源、优势、对比、应用

计算机视觉life

18+阅读 · 2017年7月17日

相关论文

Memory-Maze: Scenario Driven Visual Language Navigation Benchmark for Guiding Blind People

Arxiv

0+阅读 · 1月27日

DV-VLN: Dual Verification for Reliable LLM-Based Vision-and-Language Navigation

Arxiv

0+阅读 · 1月26日

Visual-Language-Guided Task Planning for Horticultural Robots

Arxiv

0+阅读 · 1月17日

AgriAgent: Contract-Driven Planning and Capability-Aware Tool Orchestration in Real-World Agriculture

Arxiv

0+阅读 · 1月13日

ImagineNav++: Prompting Vision-Language Models as Embodied Navigator through Scene Imagination

Arxiv

0+阅读 · 1月8日

Agri-R1: Empowering Generalizable Agricultural Reasoning in Vision-Language Models with Reinforcement Learning

Arxiv

0+阅读 · 1月8日

VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation agents

Arxiv

0+阅读 · 1月6日

AdaVLN: Towards Visual Language Navigation in Continuous Indoor Environments with Moving Humans

Arxiv

0+阅读 · 1月6日

AdaVLN: Towards Visual Language Navigation in Continuous Indoor Environments with Moving Humans

Arxiv

0+阅读 · 1月5日

AINav: Large Language Model-Based Adaptive Interactive Navigation

Arxiv

0+阅读 · 2025年12月31日

相关基金

基于Petri网的自动化码头多AGV系统的死锁解决策略研究

国家自然科学基金

1+阅读 · 2017年12月31日

未知环境下基于单目视觉的移动平台目标跟踪方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于自动导航的旋翼式微小型无人机农作物遥感信息解析方法

国家自然科学基金

3+阅读 · 2015年12月31日

空地机器人网络的同时视觉目标定位与分布式运动规划

国家自然科学基金

4+阅读 · 2015年12月31日

仿动物大脑网格细胞神经定位机制的同步定位与地图构建方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

面向无人机基于在线场景建模的室外目标检测与跟踪方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

稻油轮作系统农业机械化生产工程模式和管理决策方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于多光谱结构光立体视觉的大田棉花高精度定位与成熟度分级

国家自然科学基金

0+阅读 · 2015年12月31日

抗干扰的农作物种植模式自动提取方法

国家自然科学基金

0+阅读 · 2014年12月31日

基于深度学习的特征融合在移动机器人视觉中的场景理解及研究

国家自然科学基金

12+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员