Robustifying Token Attention for Vision Transformers - 专知论文

会员服务 ·

0

Attention · 词元分析器 · 稳健性 · 变换 · INFORMS ·

2023 年 3 月 20 日

Robustifying Token Attention for Vision Transformers

翻译：鲁棒化视觉Transformer的令牌注意力机制

Yong Guo,David Stutz,Bernt Schiele

from arxiv, 7 figures and 5 tables in the main paper

Despite the success of vision transformers (ViTs), they still suffer from significant drops in accuracy in the presence of common corruptions, such as noise or blur. Interestingly, we observe that the attention mechanism of ViTs tends to rely on few important tokens, a phenomenon we call token overfocusing. More critically, these tokens are not robust to corruptions, often leading to highly diverging attention patterns. In this paper, we intend to alleviate this overfocusing issue and make attention more stable through two general techniques: First, our Token-aware Average Pooling (TAP) module encourages the local neighborhood of each token to take part in the attention mechanism. Specifically, TAP learns average pooling schemes for each token such that the information of potentially important tokens in the neighborhood can adaptively be taken into account. Second, we force the output tokens to aggregate information from a diverse set of input tokens rather than focusing on just a few by using our Attention Diversification Loss (ADL). We achieve this by penalizing high cosine similarity between the attention vectors of different tokens. In experiments, we apply our methods to a wide range of transformer architectures and improve robustness significantly. For example, we improve corruption robustness on ImageNet-C by 2.4% while simultaneously improving accuracy by 0.4% based on state-of-the-art robust architecture FAN. Also, when finetuning on semantic segmentation tasks, we improve robustness on CityScapes-C by 2.4% and ACDC by 3.1%.

翻译：尽管视觉Transformer（ViTs）取得了成功，但在噪声或模糊等常见干扰下，其准确率仍会出现显著下降。有趣的是，我们观察到ViTs的注意力机制倾向于依赖少数重要令牌，这一现象我们称为令牌过度聚焦。更关键的是，这些令牌对干扰不具备鲁棒性，常常导致注意力模式高度发散。本文旨在通过两种通用技术缓解这一过度聚焦问题，使注意力更加稳定：第一，我们的令牌感知平均池化（TAP）模块鼓励每个令牌的局部邻域参与注意力机制。具体而言，TAP为每个令牌学习平均池化方案，从而能够自适应地考虑邻域中潜在重要令牌的信息。第二，我们通过注意力多样化损失（ADL）强制输出令牌从多样化的输入令牌集合中聚合信息，而非仅聚焦于少数令牌。具体实现是通过惩罚不同令牌注意力向量之间的高余弦相似度。实验中，我们将方法应用于多种Transformer架构，显著提升了鲁棒性。例如，基于最先进的鲁棒架构FAN，我们在ImageNet-C上提升了2.4%的干扰鲁棒性，同时准确率提升0.4%。此外，在语义分割任务微调时，我们在CityScapes-C上提升了2.4%的鲁棒性，在ACDC上提升了3.1%。

0

相关内容

Attention

【NeurIPS22】大图上线性复杂度的节点级Transformer

【NeurIPS22】大图上线性复杂度的节点级Transformer

专知会员服务

21+阅读 · 2022年11月29日

人大最新《基于Transformer 的视频语言预训练》综述论文

人大最新《基于Transformer 的视频语言预训练》综述论文

专知会员服务

48+阅读 · 2021年9月27日

【ICCV 2021 】Vision Transformer中的相对位置编码

专知会员服务

30+阅读 · 2021年7月30日

【ICLR2021】通过多种自监督方式提升GAT中注意力

【ICLR2021】通过多种自监督方式提升GAT中注意力

专知会员服务

44+阅读 · 2021年2月27日

最新《Transformers模型》教程，64页ppt

最新《Transformers模型》教程，64页ppt

专知会员服务

326+阅读 · 2020年11月26日

自然语言处理中的注意力机制，Attention in Natural Language Processing

自然语言处理中的注意力机制，Attention in Natural Language Processing

专知会员服务

136+阅读 · 2020年5月30日

【CVPR2020-中科院计算所】弱监督语义分割的自监督等价注意力机制，Self-supervised Equivariant Attention Mechanism for Weakly Supervised Semantic Segmentation

【CVPR2020-中科院计算所】弱监督语义分割的自监督等价注意力机制，Self-supervised Equivariant Attention Mechanism for Weakly Supervised Semantic Segmentation

专知会员服务

76+阅读 · 2020年4月10日

100+篇《自监督学习(Self-Supervised Learning)》论文最新合集

100+篇《自监督学习(Self-Supervised Learning)》论文最新合集

专知会员服务

167+阅读 · 2020年3月18日

Transformer文本分类代码

Transformer文本分类代码

专知会员服务

118+阅读 · 2020年2月3日

【芝加哥大学】GRAPH-BERT: Only Attention is Needed for Learning Graph Representations

【芝加哥大学】GRAPH-BERT: Only Attention is Needed for Learning Graph Representations

专知会员服务

85+阅读 · 2020年1月15日

RoBERTa中文预训练模型：RoBERTa for Chinese

RoBERTa中文预训练模型：RoBERTa for Chinese

PaperWeekly

57+阅读 · 2019年9月16日

深度学习的下一步：Transformer和注意力机制

深度学习的下一步：Transformer和注意力机制

云头条

56+阅读 · 2019年9月14日

BERT/Transformer/迁移学习NLP资源大列表

BERT/Transformer/迁移学习NLP资源大列表

专知

19+阅读 · 2019年6月9日

BERT/注意力机制/Transformer/迁移学习NLP资源大列表：awesome-bert-nlp

BERT/注意力机制/Transformer/迁移学习NLP资源大列表：awesome-bert-nlp

AINLP

40+阅读 · 2019年6月9日

从Seq2seq到Attention模型到Self Attention（二）

从Seq2seq到Attention模型到Self Attention（二）

量化投资与机器学习

23+阅读 · 2018年10月9日

【论文推荐】最新八篇情感分析相关论文—Pair-wise判别器、多模态情感分析、上下文语境、Gated 卷积网络

【论文推荐】最新八篇情感分析相关论文—Pair-wise判别器、多模态情感分析、上下文语境、Gated 卷积网络

专知

20+阅读 · 2018年6月29日

【论文推荐】最新四篇CVPR2018 视频描述生成相关论文—双向注意力、Transformer、重构网络、层次强化学习

【论文推荐】最新四篇CVPR2018 视频描述生成相关论文—双向注意力、Transformer、重构网络、层次强化学习

专知

31+阅读 · 2018年6月4日

跨越注意力：Cross-Attention

跨越注意力：Cross-Attention

我爱读PAMI

172+阅读 · 2018年6月2日

【论文推荐】最新十篇机器翻译相关论文—自然语言推理、无监督神经机器翻译、多任务学习、局部卷积、图卷积、多语种机器翻译

【论文推荐】最新十篇机器翻译相关论文—自然语言推理、无监督神经机器翻译、多任务学习、局部卷积、图卷积、多语种机器翻译

专知

15+阅读 · 2018年5月1日

【论文推荐】最新七篇自注意力机制(Self-attention)相关论文—结构化自注意力、相对位置、混合、句子表达、文本向量

【论文推荐】最新七篇自注意力机制(Self-attention)相关论文—结构化自注意力、相对位置、混合、句子表达、文本向量

专知

29+阅读 · 2018年3月12日

针状β″相和细小片状η′相协同作用强化Al-Mg-Si-Zn合金及机制

国家自然科学基金

0+阅读 · 2015年12月31日

抑癌基因KLF4失活在幽门螺旋杆菌感染致胃癌发生发展的作用及其分子机制

国家自然科学基金

0+阅读 · 2014年12月31日

蛋白酶体抑制剂Bortezomib对肺动脉平滑肌细胞钙离子通路的作用研究

国家自然科学基金

0+阅读 · 2014年12月31日

热力耦合作用下纳米复合锑化钴基热电材料结构与热-电-力学性能研究

国家自然科学基金

0+阅读 · 2013年12月31日

丹参联合化疗和VEGF靶向药物对结肠癌的协同作用及机制研究

国家自然科学基金

0+阅读 · 2012年12月31日

(In,Ga)2Te3一维纳米结构及其核壳复合材料的可控制备与光电性能研究

国家自然科学基金

0+阅读 · 2012年12月31日

增强子RNA对胃癌肝素酶基因表达的调控作用及其机制研究

国家自然科学基金

0+阅读 · 2012年12月31日

炎症通过mTOR信号通路导致脂肪组织储脂能力下降

国家自然科学基金

0+阅读 · 2011年12月31日

高压提高Ga-Ge基笼型物热电效率的第一性原理研究

国家自然科学基金

0+阅读 · 2009年12月31日

TR3相互作用新蛋白机理研究

国家自然科学基金

1+阅读 · 2008年12月31日

Musketeer (All for One, and One for All): A Generalist Vision-Language Model with Task Explanation Prompts

Arxiv

0+阅读 · 2023年5月11日

Super Vision Transformer

Arxiv

0+阅读 · 2023年5月10日

Sparse Spatial Transformers for Few-Shot Learning

Arxiv

0+阅读 · 2023年5月10日

Hybrid Transformer and CNN Attention Network for Stereo Image Super-resolution

Arxiv

0+阅读 · 2023年5月9日

A Survey on Graph Neural Networks and Graph Transformers in Computer Vision: A Task-Oriented Perspective

Arxiv

21+阅读 · 2022年9月27日

A Survey on Masked Autoencoder for Self-supervised Learning in Vision and Beyond

Arxiv

10+阅读 · 2022年7月30日

Transformers are Meta-Reinforcement Learners

Arxiv

15+阅读 · 2022年6月14日

A Survey on Vision Transformer

Arxiv

17+阅读 · 2022年2月23日

SiT: Self-supervised vIsion Transformer

Arxiv

19+阅读 · 2021年4月8日

Efficient Transformers: A Survey

Arxiv

23+阅读 · 2020年9月16日

VIP会员

文章信息

相关主题

词元分析器

最新内容

面向特种部队的、以操作员为中心的人工智能决策支持系统框架

面向特种部队的、以操作员为中心的人工智能决策支持系统框架

专知会员服务

3+阅读 · 今天7:54

《多域战场上反制小型无人机系统》150页

《多域战场上反制小型无人机系统》150页

专知会员服务

12+阅读 · 今天7:47

《基于成果军事教育框架下的军官联合职业军事教育认证程序》2026最新170页

《基于成果军事教育框架下的军官联合职业军事教育认证程序》2026最新170页

专知会员服务

4+阅读 · 今天7:43

战场人工智能：增强陆地作战能力的发现与要求

战场人工智能：增强陆地作战能力的发现与要求

专知会员服务

2+阅读 · 今天7:37

人工智能赋能指挥所：以人工智能为中心的指挥控制的核心要素

人工智能赋能指挥所：以人工智能为中心的指挥控制的核心要素

专知会员服务

4+阅读 · 今天7:33

以人工智能为中心的指挥控制

以人工智能为中心的指挥控制

专知会员服务

2+阅读 · 今天7:14

《通过适应复杂环境与特殊作战行动动态来变革情报周期》

《通过适应复杂环境与特殊作战行动动态来变革情报周期》

专知会员服务

3+阅读 · 今天4:15

俄乌冲突背景下军事特种公路运输日益增长的重要性

俄乌冲突背景下军事特种公路运输日益增长的重要性

专知会员服务

3+阅读 · 今天3:44

速度优先于谨慎：NSPM-11意味着什么（将人工智能融入美国国防和情报行动最全面的声明）

速度优先于谨慎：NSPM-11意味着什么（将人工智能融入美国国防和情报行动最全面的声明）

专知会员服务

8+阅读 · 6月10日

《基于深度强化学习的反无人机技术研究》178页

《基于深度强化学习的反无人机技术研究》178页

专知会员服务

12+阅读 · 6月10日

技术突破与战略优势竞争：美军人工智能技术运用阶段分析

技术突破与战略优势竞争：美军人工智能技术运用阶段分析

专知会员服务

7+阅读 · 6月10日

“史诗怒火”行动与“AI中心战”模式的浮现

“史诗怒火”行动与“AI中心战”模式的浮现

专知会员服务

12+阅读 · 6月10日

【CVPR2026教程】扩散模型的解析理解

【CVPR2026教程】扩散模型的解析理解

专知会员服务

5+阅读 · 6月10日

【CVPR2026教程】从感知到模拟：多模态推理中世界模型的涌现

【CVPR2026教程】从感知到模拟：多模态推理中世界模型的涌现

专知会员服务

6+阅读 · 6月10日

马赛克战：俄乌战场透析

马赛克战：俄乌战场透析

专知会员服务

18+阅读 · 6月10日

相关VIP内容

【NeurIPS22】大图上线性复杂度的节点级Transformer

【NeurIPS22】大图上线性复杂度的节点级Transformer

专知会员服务

21+阅读 · 2022年11月29日

人大最新《基于Transformer 的视频语言预训练》综述论文

人大最新《基于Transformer 的视频语言预训练》综述论文

专知会员服务

48+阅读 · 2021年9月27日

【ICCV 2021 】Vision Transformer中的相对位置编码

专知会员服务

30+阅读 · 2021年7月30日

【ICLR2021】通过多种自监督方式提升GAT中注意力

【ICLR2021】通过多种自监督方式提升GAT中注意力

专知会员服务

44+阅读 · 2021年2月27日

最新《Transformers模型》教程，64页ppt

最新《Transformers模型》教程，64页ppt

专知会员服务

326+阅读 · 2020年11月26日

自然语言处理中的注意力机制，Attention in Natural Language Processing

自然语言处理中的注意力机制，Attention in Natural Language Processing

专知会员服务

136+阅读 · 2020年5月30日

【CVPR2020-中科院计算所】弱监督语义分割的自监督等价注意力机制，Self-supervised Equivariant Attention Mechanism for Weakly Supervised Semantic Segmentation

【CVPR2020-中科院计算所】弱监督语义分割的自监督等价注意力机制，Self-supervised Equivariant Attention Mechanism for Weakly Supervised Semantic Segmentation

专知会员服务

76+阅读 · 2020年4月10日

100+篇《自监督学习(Self-Supervised Learning)》论文最新合集

100+篇《自监督学习(Self-Supervised Learning)》论文最新合集

专知会员服务

167+阅读 · 2020年3月18日

Transformer文本分类代码

Transformer文本分类代码

专知会员服务

118+阅读 · 2020年2月3日

【芝加哥大学】GRAPH-BERT: Only Attention is Needed for Learning Graph Representations

【芝加哥大学】GRAPH-BERT: Only Attention is Needed for Learning Graph Representations

专知会员服务

85+阅读 · 2020年1月15日

热门VIP内容

开通专知VIP会员享更多权益服务

《多域战场上反制小型无人机系统》150页

战场人工智能：增强陆地作战能力的发现与要求

面向特种部队的、以操作员为中心的人工智能决策支持系统框架

《基于成果军事教育框架下的军官联合职业军事教育认证程序》2026最新170页

相关资讯

RoBERTa中文预训练模型：RoBERTa for Chinese

RoBERTa中文预训练模型：RoBERTa for Chinese

PaperWeekly

57+阅读 · 2019年9月16日

深度学习的下一步：Transformer和注意力机制

深度学习的下一步：Transformer和注意力机制

云头条

56+阅读 · 2019年9月14日

BERT/Transformer/迁移学习NLP资源大列表

BERT/Transformer/迁移学习NLP资源大列表

专知

19+阅读 · 2019年6月9日

BERT/注意力机制/Transformer/迁移学习NLP资源大列表：awesome-bert-nlp

BERT/注意力机制/Transformer/迁移学习NLP资源大列表：awesome-bert-nlp

AINLP

40+阅读 · 2019年6月9日

从Seq2seq到Attention模型到Self Attention（二）

从Seq2seq到Attention模型到Self Attention（二）

量化投资与机器学习

23+阅读 · 2018年10月9日

【论文推荐】最新八篇情感分析相关论文—Pair-wise判别器、多模态情感分析、上下文语境、Gated 卷积网络

【论文推荐】最新八篇情感分析相关论文—Pair-wise判别器、多模态情感分析、上下文语境、Gated 卷积网络

专知

20+阅读 · 2018年6月29日

【论文推荐】最新四篇CVPR2018 视频描述生成相关论文—双向注意力、Transformer、重构网络、层次强化学习

【论文推荐】最新四篇CVPR2018 视频描述生成相关论文—双向注意力、Transformer、重构网络、层次强化学习

专知

31+阅读 · 2018年6月4日

跨越注意力：Cross-Attention

跨越注意力：Cross-Attention

我爱读PAMI

172+阅读 · 2018年6月2日

【论文推荐】最新十篇机器翻译相关论文—自然语言推理、无监督神经机器翻译、多任务学习、局部卷积、图卷积、多语种机器翻译

【论文推荐】最新十篇机器翻译相关论文—自然语言推理、无监督神经机器翻译、多任务学习、局部卷积、图卷积、多语种机器翻译

专知

15+阅读 · 2018年5月1日

【论文推荐】最新七篇自注意力机制(Self-attention)相关论文—结构化自注意力、相对位置、混合、句子表达、文本向量

【论文推荐】最新七篇自注意力机制(Self-attention)相关论文—结构化自注意力、相对位置、混合、句子表达、文本向量

专知

29+阅读 · 2018年3月12日

相关论文

Musketeer (All for One, and One for All): A Generalist Vision-Language Model with Task Explanation Prompts

Arxiv

0+阅读 · 2023年5月11日

Super Vision Transformer

Arxiv

0+阅读 · 2023年5月10日

Sparse Spatial Transformers for Few-Shot Learning

Arxiv

0+阅读 · 2023年5月10日

Hybrid Transformer and CNN Attention Network for Stereo Image Super-resolution

Arxiv

0+阅读 · 2023年5月9日

A Survey on Graph Neural Networks and Graph Transformers in Computer Vision: A Task-Oriented Perspective

Arxiv

21+阅读 · 2022年9月27日

A Survey on Masked Autoencoder for Self-supervised Learning in Vision and Beyond

Arxiv

10+阅读 · 2022年7月30日

Transformers are Meta-Reinforcement Learners

Arxiv

15+阅读 · 2022年6月14日

A Survey on Vision Transformer

Arxiv

17+阅读 · 2022年2月23日

SiT: Self-supervised vIsion Transformer

Arxiv

19+阅读 · 2021年4月8日

Efficient Transformers: A Survey

Arxiv

23+阅读 · 2020年9月16日

相关基金

针状β″相和细小片状η′相协同作用强化Al-Mg-Si-Zn合金及机制

国家自然科学基金

0+阅读 · 2015年12月31日

抑癌基因KLF4失活在幽门螺旋杆菌感染致胃癌发生发展的作用及其分子机制

国家自然科学基金

0+阅读 · 2014年12月31日

蛋白酶体抑制剂Bortezomib对肺动脉平滑肌细胞钙离子通路的作用研究

国家自然科学基金

0+阅读 · 2014年12月31日

热力耦合作用下纳米复合锑化钴基热电材料结构与热-电-力学性能研究

国家自然科学基金

0+阅读 · 2013年12月31日

丹参联合化疗和VEGF靶向药物对结肠癌的协同作用及机制研究

国家自然科学基金

0+阅读 · 2012年12月31日

(In,Ga)2Te3一维纳米结构及其核壳复合材料的可控制备与光电性能研究

国家自然科学基金

0+阅读 · 2012年12月31日

增强子RNA对胃癌肝素酶基因表达的调控作用及其机制研究

国家自然科学基金

0+阅读 · 2012年12月31日

炎症通过mTOR信号通路导致脂肪组织储脂能力下降

国家自然科学基金

0+阅读 · 2011年12月31日

高压提高Ga-Ge基笼型物热电效率的第一性原理研究

国家自然科学基金

0+阅读 · 2009年12月31日

TR3相互作用新蛋白机理研究

国家自然科学基金

1+阅读 · 2008年12月31日

微信扫码咨询专知VIP会员