基于多层感知机融合搜索的高效精确孪生跟踪 (Search Multilayer Perceptron-Based Fusion for Efficient and Accurate Siamese Tracking) - 专知论文

会员服务 ·

0

融合 · 搜索 · 多层感知机 · 感知机 · 通道 ·

Search Multilayer Perceptron-Based Fusion for Efficient and Accurate Siamese Tracking

翻译：基于多层感知机融合搜索的高效精确孪生跟踪

Tianqi Shen,Huakao Lin,Ning An

from arxiv, 23 pages, 12 figures, 7 tables. This work was completed in 2024 and accepted for publication in IEEE TCDS (2026)

Siamese visual trackers have recently advanced through increasingly sophisticated fusion mechanisms built on convolutional or Transformer architectures. However, both struggle to deliver pixel-level interactions efficiently on resource-constrained hardware, leading to a persistent accuracy-efficiency imbalance. Motivated by this limitation, we redesign the Siamese neck with a simple yet effective Multilayer Perception (MLP)-based fusion module that enables pixel-level interaction with minimal structural overhead. Nevertheless, naively stacking MLP blocks introduces a new challenge: computational cost can scale quadratically with channel width. To overcome this, we construct a hierarchical search space of carefully designed MLP modules and introduce a customized relaxation strategy that enables differentiable neural architecture search (DNAS) to decouple channel-width optimization from other architectural choices. This targeted decoupling automatically balances channel width and depth, yielding a low-complexity architecture. The resulting tracker achieves state-of-the-art accuracy-efficiency trade-offs. It ranks among the top performers on four general-purpose and three aerial tracking benchmarks, while maintaining real-time performance on both resource-constrained Graphics Processing Units (GPUs) and Neural Processing Units (NPUs).

翻译：孪生视觉跟踪器近期通过构建于卷积或Transformer架构上日益复杂的融合机制取得了进展。然而，这两种架构在资源受限的硬件上均难以高效实现像素级交互，导致精度与效率的失衡问题持续存在。受此局限性的启发，我们采用简单而有效的基于多层感知机（MLP）的融合模块重新设计了孪生网络颈部结构，该模块能以极小的结构开销实现像素级交互。然而，简单地堆叠MLP模块会引入新的挑战：计算成本可能随通道宽度呈二次方增长。为解决此问题，我们构建了一个由精心设计的MLP模块组成的层次化搜索空间，并引入定制化的松弛策略，使可微分神经架构搜索（DNAS）能够将通道宽度优化与其他架构选择解耦。这种定向解耦机制能自动平衡通道宽度与网络深度，从而生成低复杂度架构。所得跟踪器实现了最优的精度-效率权衡，在四个通用跟踪基准和三个空中跟踪基准中均位列前茅，同时在资源受限的图形处理器（GPU）和神经处理器（NPU）上均保持实时性能。

0

相关内容

面向具身智能的多传感器融合感知综述：背景、方法、挑战与前景

面向具身智能的多传感器融合感知综述：背景、方法、挑战与前景

专知会员服务

18+阅读 · 2025年6月29日

《边界监视多传感器融合系统中的目标跟踪》

《边界监视多传感器融合系统中的目标跟踪》

专知会员服务

52+阅读 · 2023年6月11日

《多模态传感器融合与深度学习》美海军研究实验室19页报告

《多模态传感器融合与深度学习》美海军研究实验室19页报告

专知会员服务

116+阅读 · 2023年4月1日

面向汽车驾驶感知的多模态传感器融合研究综述：一文详解50多种多模态图像融合方法

面向汽车驾驶感知的多模态传感器融合研究综述：一文详解50多种多模态图像融合方法

专知会员服务

60+阅读 · 2023年1月17日

《基于信息的分布式多传感器多目标跟踪》美国空军研究实验室2022最新报告

《基于信息的分布式多传感器多目标跟踪》美国空军研究实验室2022最新报告

专知会员服务

125+阅读 · 2022年12月1日

【ECCV2022】UniNet:具有卷积、Transformer和MLP的统一架构搜索

【ECCV2022】UniNet:具有卷积、Transformer和MLP的统一架构搜索

专知会员服务

30+阅读 · 2022年7月15日

基于深度学习的视觉多目标跟踪算法综述

专知会员服务

50+阅读 · 2021年4月15日

【CVPR2021】Transformer遇见跟踪器：利用时间上下文进行视觉追踪

【CVPR2021】Transformer遇见跟踪器：利用时间上下文进行视觉追踪

专知会员服务

17+阅读 · 2021年3月24日

【AAAI2021】MVFNet: 用于高效视频识别的多视角融合网络

专知会员服务

11+阅读 · 2021年2月4日

【目标跟踪 | 2019最新综述】多目标追踪综述，附38页PDF，185篇参考文献，Deep Learning in Video Multi-Object Tracking: A Survey

【目标跟踪 | 2019最新综述】多目标追踪综述，附38页PDF，185篇参考文献，Deep Learning in Video Multi-Object Tracking: A Survey

专知会员服务

93+阅读 · 2019年11月15日

重磅！数字孪生技术应用白皮书（2021）

重磅！数字孪生技术应用白皮书（2021）

专知

14+阅读 · 2021年12月8日

专家报告|深度学习+图像多模态融合

专家报告|深度学习+图像多模态融合

中国图象图形学报

12+阅读 · 2019年10月23日

【数字孪生】数字孪生技术发展趋势与安全风险浅析

【数字孪生】数字孪生技术发展趋势与安全风险浅析

产业智能官

54+阅读 · 2019年8月28日

【综述】深度学习在视频多目标跟踪上的应用

【综述】深度学习在视频多目标跟踪上的应用

专知

14+阅读 · 2019年8月8日

计算机视觉方向简介 | 多目标跟踪算法（附源码）

计算机视觉方向简介 | 多目标跟踪算法（附源码）

计算机视觉life

15+阅读 · 2019年6月26日

《视觉跟踪最新方法与趋势》，44页最新综述带你全面了解视觉跟踪领域发展方向

《视觉跟踪最新方法与趋势》，44页最新综述带你全面了解视觉跟踪领域发展方向

专知

32+阅读 · 2019年5月22日

【数字孪生】超棒PPT解读Digital Twin十大领域应用！

【数字孪生】超棒PPT解读Digital Twin十大领域应用！

产业智能官

103+阅读 · 2019年3月26日

CVPR 2019：中科院、牛津等提出SiamMask网络，视频跟踪最高精度

CVPR 2019：中科院、牛津等提出SiamMask网络，视频跟踪最高精度

新智元

11+阅读 · 2019年3月8日

视频中的多目标跟踪【附PPT与视频资料】

视频中的多目标跟踪【附PPT与视频资料】

人工智能前沿讲习班

30+阅读 · 2018年11月29日

【数字孪生】数字孪生系列报道：15家单位22位作者研究成果，数字孪生应用探索

【数字孪生】数字孪生系列报道：15家单位22位作者研究成果，数字孪生应用探索

产业智能官

53+阅读 · 2018年5月17日

基于深度卷积神经网络的多源遥感图像时空融合方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

多特征驱动的彩色多聚焦图像融合理论与方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于多源视频的大范围场景目标跟踪

国家自然科学基金

2+阅读 · 2015年12月31日

移动增强现实中基于视觉—惯性传感器的混合跟踪方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于压缩感知的高精度实时视觉跟踪方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

基于框架提升变换的多源图像融合研究

国家自然科学基金

1+阅读 · 2015年12月31日

稀疏性多维联合优化在线视觉跟踪方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

普适计算对象感知多模态不精确性数据融合算法研究

国家自然科学基金

5+阅读 · 2014年12月31日

基于稀疏表示的多摄像机非重叠视野域运动目标跟踪方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于融合先验知识的机器学习的多传感器融合研究

国家自然科学基金

16+阅读 · 2013年12月31日

TwinTrack: Bridging Vision and Contact Physics for Real-Time Tracking of Unknown Objects in Contact-Rich Scenes

TwinTrack: Bridging Vision and Contact Physics for Real-Time Tracking of Unknown Objects in Contact-Rich Scenes

Arxiv

0+阅读 · 3月18日

Optimizing Reinforcement Learning Training over Digital Twin Enabled Multi-fidelity Networks

Arxiv

0+阅读 · 3月9日

Alignment-Aware and Reliability-Gated Multimodal Fusion for Unmanned Aerial Vehicle Detection Across Heterogeneous Thermal-Visual Sensors

Arxiv

0+阅读 · 3月9日

Joint Multi-User Tracking and Signal Detection in Reconfigurable Intelligent Surface-Assisted Cell-Free ISAC Systems

Arxiv

0+阅读 · 2月20日

SyncTwin: Fast Digital Twin Construction and Synchronization for Safe Robotic Manipulation

Arxiv

0+阅读 · 2月20日

Symmetry-Aware Fusion of Vision and Tactile Sensing via Bilateral Force Priors for Robotic Manipulation

Arxiv

0+阅读 · 2月14日

Hierarchical Audio-Visual-Proprioceptive Fusion for Precise Robotic Manipulation

Arxiv

0+阅读 · 2月14日

MultiGraspNet: A Multitask 3D Vision Model for Multi-gripper Robotic Grasping

Arxiv

0+阅读 · 2月6日

GenTrack2: An Improved Hybrid Approach for Visual Multi-Object Tracking

Arxiv

0+阅读 · 2月2日

Cross-Modal Binary Attention: An Energy-Efficient Fusion Framework for Audio-Visual Learning

Arxiv

0+阅读 · 1月31日

VIP会员

文章信息

相关主题

多层感知机

最新内容

【牛津博士论文】以语言为接口的医学影像表示学习

【牛津博士论文】以语言为接口的医学影像表示学习

专知会员服务

0+阅读 · 今天16:11

基于大语言模型的医疗推理研究：综述与 MR-Bench 基准测试

基于大语言模型的医疗推理研究：综述与 MR-Bench 基准测试

专知会员服务

0+阅读 · 今天16:09

从原型到实战：扩展美陆军下一代指挥控制能力（试验进展）

从原型到实战：扩展美陆军下一代指挥控制能力（试验进展）

专知会员服务

3+阅读 · 今天15:10

技术、多域威慑与海上战争（报告）

技术、多域威慑与海上战争（报告）

专知会员服务

3+阅读 · 今天15:04

随机网络效用最大化在战略排队系统中的博弈论方法

随机网络效用最大化在战略排队系统中的博弈论方法

专知会员服务

2+阅读 · 今天14:56

“在云端防御”：提升北约数据韧性（报告）

“在云端防御”：提升北约数据韧性（报告）

专知会员服务

2+阅读 · 今天14:54

从炒作到现实：人工智能在军事应用中的实战经验与建议（综述）

从炒作到现实：人工智能在军事应用中的实战经验与建议（综述）

专知会员服务

2+阅读 · 今天14:49

2026年伊朗战争对美国通胀的影响：情景分析（报告）

2026年伊朗战争对美国通胀的影响：情景分析（报告）

专知会员服务

1+阅读 · 今天14:47

人工智能及其在海军行动中的整合（综述）

人工智能及其在海军行动中的整合（综述）

专知会员服务

2+阅读 · 今天14:07

美以伊冲突：无人机主导的第三次海湾战争反防空作战

美以伊冲突：无人机主导的第三次海湾战争反防空作战

专知会员服务

1+阅读 · 今天13:56

多模态XR-AI训练系统提升联合作战中的沟通技能（中文万字长文）

多模态XR-AI训练系统提升联合作战中的沟通技能（中文万字长文）

专知会员服务

3+阅读 · 今天13:40

美军MAVEN项目全面解析：算法战架构

美军MAVEN项目全面解析：算法战架构

专知会员服务

16+阅读 · 今天8:36

从俄乌战场看“马赛克战”（万字长文）

从俄乌战场看“马赛克战”（万字长文）

专知会员服务

10+阅读 · 今天8:19

人工智能与机器人自主系统等新兴技术革命将如何影响地面作战的指挥控制？

人工智能与机器人自主系统等新兴技术革命将如何影响地面作战的指挥控制？

专知会员服务

10+阅读 · 4月12日

弹性指挥控制：北约、伊朗与俄罗斯指挥控制架构的比较分析

弹性指挥控制：北约、伊朗与俄罗斯指挥控制架构的比较分析

专知会员服务

9+阅读 · 4月12日

相关VIP内容

面向具身智能的多传感器融合感知综述：背景、方法、挑战与前景

面向具身智能的多传感器融合感知综述：背景、方法、挑战与前景

专知会员服务

18+阅读 · 2025年6月29日

《边界监视多传感器融合系统中的目标跟踪》

《边界监视多传感器融合系统中的目标跟踪》

专知会员服务

52+阅读 · 2023年6月11日

《多模态传感器融合与深度学习》美海军研究实验室19页报告

《多模态传感器融合与深度学习》美海军研究实验室19页报告

专知会员服务

116+阅读 · 2023年4月1日

面向汽车驾驶感知的多模态传感器融合研究综述：一文详解50多种多模态图像融合方法

面向汽车驾驶感知的多模态传感器融合研究综述：一文详解50多种多模态图像融合方法

专知会员服务

60+阅读 · 2023年1月17日

《基于信息的分布式多传感器多目标跟踪》美国空军研究实验室2022最新报告

《基于信息的分布式多传感器多目标跟踪》美国空军研究实验室2022最新报告

专知会员服务

125+阅读 · 2022年12月1日

【ECCV2022】UniNet:具有卷积、Transformer和MLP的统一架构搜索

【ECCV2022】UniNet:具有卷积、Transformer和MLP的统一架构搜索

专知会员服务

30+阅读 · 2022年7月15日

基于深度学习的视觉多目标跟踪算法综述

专知会员服务

50+阅读 · 2021年4月15日

【CVPR2021】Transformer遇见跟踪器：利用时间上下文进行视觉追踪

【CVPR2021】Transformer遇见跟踪器：利用时间上下文进行视觉追踪

专知会员服务

17+阅读 · 2021年3月24日

【AAAI2021】MVFNet: 用于高效视频识别的多视角融合网络

专知会员服务

11+阅读 · 2021年2月4日

【目标跟踪 | 2019最新综述】多目标追踪综述，附38页PDF，185篇参考文献，Deep Learning in Video Multi-Object Tracking: A Survey

【目标跟踪 | 2019最新综述】多目标追踪综述，附38页PDF，185篇参考文献，Deep Learning in Video Multi-Object Tracking: A Survey

专知会员服务

93+阅读 · 2019年11月15日

热门VIP内容

开通专知VIP会员享更多权益服务

基于大语言模型的医疗推理研究：综述与 MR-Bench 基准测试

技术、多域威慑与海上战争（报告）

【牛津博士论文】以语言为接口的医学影像表示学习

从原型到实战：扩展美陆军下一代指挥控制能力（试验进展）

相关资讯

重磅！数字孪生技术应用白皮书（2021）

重磅！数字孪生技术应用白皮书（2021）

专知

14+阅读 · 2021年12月8日

专家报告|深度学习+图像多模态融合

专家报告|深度学习+图像多模态融合

中国图象图形学报

12+阅读 · 2019年10月23日

【数字孪生】数字孪生技术发展趋势与安全风险浅析

【数字孪生】数字孪生技术发展趋势与安全风险浅析

产业智能官

54+阅读 · 2019年8月28日

【综述】深度学习在视频多目标跟踪上的应用

【综述】深度学习在视频多目标跟踪上的应用

专知

14+阅读 · 2019年8月8日

计算机视觉方向简介 | 多目标跟踪算法（附源码）

计算机视觉方向简介 | 多目标跟踪算法（附源码）

计算机视觉life

15+阅读 · 2019年6月26日

《视觉跟踪最新方法与趋势》，44页最新综述带你全面了解视觉跟踪领域发展方向

《视觉跟踪最新方法与趋势》，44页最新综述带你全面了解视觉跟踪领域发展方向

专知

32+阅读 · 2019年5月22日

【数字孪生】超棒PPT解读Digital Twin十大领域应用！

【数字孪生】超棒PPT解读Digital Twin十大领域应用！

产业智能官

103+阅读 · 2019年3月26日

CVPR 2019：中科院、牛津等提出SiamMask网络，视频跟踪最高精度

CVPR 2019：中科院、牛津等提出SiamMask网络，视频跟踪最高精度

新智元

11+阅读 · 2019年3月8日

视频中的多目标跟踪【附PPT与视频资料】

视频中的多目标跟踪【附PPT与视频资料】

人工智能前沿讲习班

30+阅读 · 2018年11月29日

【数字孪生】数字孪生系列报道：15家单位22位作者研究成果，数字孪生应用探索

【数字孪生】数字孪生系列报道：15家单位22位作者研究成果，数字孪生应用探索

产业智能官

53+阅读 · 2018年5月17日

相关论文

TwinTrack: Bridging Vision and Contact Physics for Real-Time Tracking of Unknown Objects in Contact-Rich Scenes

TwinTrack: Bridging Vision and Contact Physics for Real-Time Tracking of Unknown Objects in Contact-Rich Scenes

Arxiv

0+阅读 · 3月18日

Optimizing Reinforcement Learning Training over Digital Twin Enabled Multi-fidelity Networks

Arxiv

0+阅读 · 3月9日

Alignment-Aware and Reliability-Gated Multimodal Fusion for Unmanned Aerial Vehicle Detection Across Heterogeneous Thermal-Visual Sensors

Arxiv

0+阅读 · 3月9日

Joint Multi-User Tracking and Signal Detection in Reconfigurable Intelligent Surface-Assisted Cell-Free ISAC Systems

Arxiv

0+阅读 · 2月20日

SyncTwin: Fast Digital Twin Construction and Synchronization for Safe Robotic Manipulation

Arxiv

0+阅读 · 2月20日

Symmetry-Aware Fusion of Vision and Tactile Sensing via Bilateral Force Priors for Robotic Manipulation

Arxiv

0+阅读 · 2月14日

Hierarchical Audio-Visual-Proprioceptive Fusion for Precise Robotic Manipulation

Arxiv

0+阅读 · 2月14日

MultiGraspNet: A Multitask 3D Vision Model for Multi-gripper Robotic Grasping

Arxiv

0+阅读 · 2月6日

GenTrack2: An Improved Hybrid Approach for Visual Multi-Object Tracking

Arxiv

0+阅读 · 2月2日

Cross-Modal Binary Attention: An Energy-Efficient Fusion Framework for Audio-Visual Learning

Arxiv

0+阅读 · 1月31日

相关基金

基于深度卷积神经网络的多源遥感图像时空融合方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

多特征驱动的彩色多聚焦图像融合理论与方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于多源视频的大范围场景目标跟踪

国家自然科学基金

2+阅读 · 2015年12月31日

移动增强现实中基于视觉—惯性传感器的混合跟踪方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于压缩感知的高精度实时视觉跟踪方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

基于框架提升变换的多源图像融合研究

国家自然科学基金

1+阅读 · 2015年12月31日

稀疏性多维联合优化在线视觉跟踪方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

普适计算对象感知多模态不精确性数据融合算法研究

国家自然科学基金

5+阅读 · 2014年12月31日

基于稀疏表示的多摄像机非重叠视野域运动目标跟踪方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于融合先验知识的机器学习的多传感器融合研究

国家自然科学基金

16+阅读 · 2013年12月31日

微信扫码咨询专知VIP会员