延迟墙：面向实时虚拟化身评估现成情感识别模型的性能基准 (The Latency Wall: Benchmarking Off-the-Shelf Emotion Recognition for Real-Time Virtual Avatars) - 专知论文

会员服务 ·

0

识别 · 基准 · 交互 · 精度 · 情感识别 ·

The Latency Wall: Benchmarking Off-the-Shelf Emotion Recognition for Real-Time Virtual Avatars

翻译：延迟墙：面向实时虚拟化身评估现成情感识别模型的性能基准

from arxiv, Technical Report benchmarking off-the-shelf CV latencies on commodity CPU hardware for therapeutic VR applications

In the realm of Virtual Reality (VR) and Human-Computer Interaction (HCI), real-time emotion recognition shows promise for supporting individuals with Autism Spectrum Disorder (ASD) in improving social skills. This task requires a strict latency-accuracy trade-off, with motion-to-photon (MTP) latency kept below 140 ms to maintain contingency. However, most off-the-shelf Deep Learning models prioritize accuracy over the strict timing constraints of commodity hardware. As a first step toward accessible VR therapy, we benchmark State-of-the-Art (SOTA) models for Zero-Shot Facial Expression Recognition (FER) on virtual characters using the UIBVFED dataset. We evaluate Medium and Nano variants of YOLO (v8, v11, and v12) for face detection, alongside general-purpose Vision Transformers including CLIP, SigLIP, and ViT-FER.Our results on CPU-only inference demonstrate that while face detection on stylized avatars is robust (100% accuracy), a "Latency Wall" exists in the classification stage. The YOLOv11n architecture offers the optimal balance for detection (~54 ms). However, general-purpose Transformers like CLIP and SigLIP fail to achieve viable accuracy (<23%) or speed (>150 ms) for real-time loops. This study highlights the necessity for lightweight, domain-specific architectures to enable accessible, real-time AI in therapeutic settings.

翻译：在虚拟现实与人机交互领域，实时情感识别技术有望帮助自闭症谱系障碍患者提升社交技能。该任务需严格权衡延迟与精度，必须将动作到光子延迟控制在140毫秒以下以维持交互连续性。然而，大多数现成的深度学习模型优先考虑精度，却忽视了消费级硬件的严格时序约束。作为实现可及性VR治疗的第一步，我们基于UIBVFED数据集对虚拟角色零样本面部表情识别的先进模型进行基准测试。我们评估了YOLO系列的中型和纳米变体用于面部检测，同时测试了包括CLIP、SigLIP和ViT-FER在内的通用视觉Transformer模型。在纯CPU推理环境下的实验结果表明：虽然风格化虚拟化身的面部检测具有鲁棒性，但分类阶段存在“延迟墙”。YOLOv11n架构在检测阶段实现了最佳平衡。然而，CLIP和SigLIP等通用Transformer模型在实时交互循环中既无法达到可用精度，也无法满足速度要求。本研究揭示了开发轻量化领域专用架构的必要性，以推动治疗场景中可及性实时人工智能的实现。

0

相关内容

对抗性实验：利用敏感性分析、邻域搜索启发式算法和概率性想定生成来暴露人工智能弱点 | 2025最新83页

对抗性实验：利用敏感性分析、邻域搜索启发式算法和概率性想定生成来暴露人工智能弱点 | 2025最新83页

专知会员服务

25+阅读 · 2025年10月21日

多模态对话情感识别：方法、趋势、挑战与前景综述

多模态对话情感识别：方法、趋势、挑战与前景综述

专知会员服务

20+阅读 · 2025年5月28日

《静态与动态情感的面部表情识别综述》

《静态与动态情感的面部表情识别综述》

专知会员服务

20+阅读 · 2024年8月31日

面向虚实融合的人机交互

面向虚实融合的人机交互

专知会员服务

71+阅读 · 2023年6月25日

美陆军《仿真环境中基于无监督本体感受特征学习的自监督移动性评估》25页论文

美陆军《仿真环境中基于无监督本体感受特征学习的自监督移动性评估》25页论文

专知会员服务

23+阅读 · 2023年2月9日

【AI+军事】附论文+PPT《多模态评估的用于认知工作量和训练的可穿戴式大脑和身体感应装置》

【AI+军事】附论文+PPT《多模态评估的用于认知工作量和训练的可穿戴式大脑和身体感应装置》

专知会员服务

36+阅读 · 2022年5月14日

【TPAMI】从人机对抗提出视觉跟踪智能评估新方法，Global Instance Tracking: Locating Target More Like Humans

【TPAMI】从人机对抗提出视觉跟踪智能评估新方法，Global Instance Tracking: Locating Target More Like Humans

专知会员服务

22+阅读 · 2022年3月29日

【复旦大学等】情感计算的系统综述:情感模型、数据库及研究进展，A Systematic Review on Affective Computing: Emotion Models, Databases, and Recent Advances

【复旦大学等】情感计算的系统综述:情感模型、数据库及研究进展，A Systematic Review on Affective Computing: Emotion Models, Databases, and Recent Advances

专知会员服务

55+阅读 · 2022年3月17日

清华大学刘云新获MobiSys 2021 最佳论文奖：精准预测深度学习模型在边缘设备上的推理延迟

专知会员服务

33+阅读 · 2021年7月17日

深度人脸表情识别研究进展

专知会员服务

56+阅读 · 2021年3月5日

揭秘ChatGPT情感对话能力

揭秘ChatGPT情感对话能力

专知

16+阅读 · 2023年4月9日

注意力机制 | 图卷积多跳注意力机制 | Direct multi-hop Attention based GNN

注意力机制 | 图卷积多跳注意力机制 | Direct multi-hop Attention based GNN

AINLP

22+阅读 · 2020年11月29日

转化率预估(pCVR)系列--延迟预估模型（上篇）

转化率预估(pCVR)系列--延迟预估模型（上篇）

AINLP

31+阅读 · 2020年6月1日

【学界】DeepMind论文：深度压缩感知，新框架提升GAN性能

【学界】DeepMind论文：深度压缩感知，新框架提升GAN性能

GAN生成式对抗网络

14+阅读 · 2019年5月23日

你的算法可靠吗？神经网络不确定性度量

你的算法可靠吗？神经网络不确定性度量

专知

40+阅读 · 2019年4月27日

无需建模：谷歌SpecAugment即可获得最先进的语音识别性能

无需建模：谷歌SpecAugment即可获得最先进的语音识别性能

云头条

18+阅读 · 2019年4月23日

Facebook Oculus实验室实习生：手势估计最新综述

Facebook Oculus实验室实习生：手势估计最新综述

专知

10+阅读 · 2019年3月12日

【泡泡图灵智库】基于CPU的实时6D物体姿态估计（arXiv）

【泡泡图灵智库】基于CPU的实时6D物体姿态估计（arXiv）

泡泡机器人SLAM

12+阅读 · 2019年1月26日

【团队新作】连续情感识别，精准捕捉你的小情绪！

【团队新作】连续情感识别，精准捕捉你的小情绪！

中国科学院自动化研究所

16+阅读 · 2018年4月17日

自然语言处理中的Attention Model：是什么及为什么

自然语言处理中的Attention Model：是什么及为什么

新智元

11+阅读 · 2017年7月13日

基于虚拟现实的认知负荷与情绪干扰交互性分析关键技术研究

国家自然科学基金

1+阅读 · 2017年12月31日

基于马尔科夫信道模型的无线网络通信系统时延性能研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于MEMS加速度传感器的智能终端手势识别及三维交互模型

国家自然科学基金

6+阅读 · 2015年12月31日

数据中心网络中延时敏感的传输控制协议

国家自然科学基金

0+阅读 · 2015年12月31日

面向非接触式、非稳定和长时间尺度生理信号的情感状态自动识别研究

国家自然科学基金

2+阅读 · 2015年12月31日

人体行为识别的时空耦合随机图模型及其高效推理算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于人脸表情、身体姿态和语音的多模态情感识别方法研究

国家自然科学基金

10+阅读 · 2015年12月31日

数据中心延迟敏感型应用尾端响应时延服务质量保障方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

延迟容忍网络中自适应社会感知路由研究

国家自然科学基金

0+阅读 · 2015年12月31日

数据和模型混合驱动的虚拟人群行为仿真技术研究及其在军事中的应用

国家自然科学基金

10+阅读 · 2011年12月31日

RAVEN: Realtime Accessibility in Virtual ENvironments for Blind and Low-Vision People

Arxiv

0+阅读 · 2月8日

Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models

Arxiv

0+阅读 · 2月1日

Virtual Reflections on a Dynamic 2D Eye Model Improve Spatial Reference Identification

Arxiv

0+阅读 · 1月29日

SituFont: A Just-in-Time Adaptive Intervention System for Enhancing Mobile Readability in Situational Visual Impairments

Arxiv

0+阅读 · 1月27日

Comparative Evaluation of Machine Learning Algorithms for Affective State Recognition from Children's Drawings

Arxiv

0+阅读 · 1月26日

A Real-Time Error Prevention System for Gaze-Based Interaction in Virtual Reality Based on Anomaly Detection

Arxiv

0+阅读 · 1月21日

SmoothCLAP: Soft-Target Enhanced Contrastive Language\--Audio Pretraining for Affective Computing

Arxiv

0+阅读 · 1月18日

Learning Latency-Aware Orchestration for Parallel Multi-Agent Systems

Arxiv

0+阅读 · 1月15日

Time Perception in Virtual Reality: Effects of Emotional Valence and Stress Level

Arxiv

0+阅读 · 1月14日

Tailored Immersive Environments: Advancing Neurodivergent Support Through Virtual Reality

Arxiv

0+阅读 · 1月13日

VIP会员

文章信息

相关主题

相关VIP内容

对抗性实验：利用敏感性分析、邻域搜索启发式算法和概率性想定生成来暴露人工智能弱点 | 2025最新83页

对抗性实验：利用敏感性分析、邻域搜索启发式算法和概率性想定生成来暴露人工智能弱点 | 2025最新83页

专知会员服务

25+阅读 · 2025年10月21日

多模态对话情感识别：方法、趋势、挑战与前景综述

多模态对话情感识别：方法、趋势、挑战与前景综述

专知会员服务

20+阅读 · 2025年5月28日

《静态与动态情感的面部表情识别综述》

《静态与动态情感的面部表情识别综述》

专知会员服务

20+阅读 · 2024年8月31日

面向虚实融合的人机交互

面向虚实融合的人机交互

专知会员服务

71+阅读 · 2023年6月25日

美陆军《仿真环境中基于无监督本体感受特征学习的自监督移动性评估》25页论文

美陆军《仿真环境中基于无监督本体感受特征学习的自监督移动性评估》25页论文

专知会员服务

23+阅读 · 2023年2月9日

【AI+军事】附论文+PPT《多模态评估的用于认知工作量和训练的可穿戴式大脑和身体感应装置》

【AI+军事】附论文+PPT《多模态评估的用于认知工作量和训练的可穿戴式大脑和身体感应装置》

专知会员服务

36+阅读 · 2022年5月14日

【TPAMI】从人机对抗提出视觉跟踪智能评估新方法，Global Instance Tracking: Locating Target More Like Humans

【TPAMI】从人机对抗提出视觉跟踪智能评估新方法，Global Instance Tracking: Locating Target More Like Humans

专知会员服务

22+阅读 · 2022年3月29日

【复旦大学等】情感计算的系统综述:情感模型、数据库及研究进展，A Systematic Review on Affective Computing: Emotion Models, Databases, and Recent Advances

【复旦大学等】情感计算的系统综述:情感模型、数据库及研究进展，A Systematic Review on Affective Computing: Emotion Models, Databases, and Recent Advances

专知会员服务

55+阅读 · 2022年3月17日

清华大学刘云新获MobiSys 2021 最佳论文奖：精准预测深度学习模型在边缘设备上的推理延迟

专知会员服务

33+阅读 · 2021年7月17日

深度人脸表情识别研究进展

专知会员服务

56+阅读 · 2021年3月5日

热门VIP内容

开通专知VIP会员享更多权益服务

智能体记忆深度剖析：评价指标与系统局限性的分类体系及实证分析

《可信人工智能赋能系统的支柱》

【CMU博士论文】可靠轨迹预测的分层基石：数据、评估与方法

人工智能赋能边缘与自主系统：美陆军现代化进程聚焦威胁探测与战术边缘情报

相关资讯

揭秘ChatGPT情感对话能力

揭秘ChatGPT情感对话能力

专知

16+阅读 · 2023年4月9日

注意力机制 | 图卷积多跳注意力机制 | Direct multi-hop Attention based GNN

注意力机制 | 图卷积多跳注意力机制 | Direct multi-hop Attention based GNN

AINLP

22+阅读 · 2020年11月29日

转化率预估(pCVR)系列--延迟预估模型（上篇）

转化率预估(pCVR)系列--延迟预估模型（上篇）

AINLP

31+阅读 · 2020年6月1日

【学界】DeepMind论文：深度压缩感知，新框架提升GAN性能

【学界】DeepMind论文：深度压缩感知，新框架提升GAN性能

GAN生成式对抗网络

14+阅读 · 2019年5月23日

你的算法可靠吗？神经网络不确定性度量

你的算法可靠吗？神经网络不确定性度量

专知

40+阅读 · 2019年4月27日

无需建模：谷歌SpecAugment即可获得最先进的语音识别性能

无需建模：谷歌SpecAugment即可获得最先进的语音识别性能

云头条

18+阅读 · 2019年4月23日

Facebook Oculus实验室实习生：手势估计最新综述

Facebook Oculus实验室实习生：手势估计最新综述

专知

10+阅读 · 2019年3月12日

【泡泡图灵智库】基于CPU的实时6D物体姿态估计（arXiv）

【泡泡图灵智库】基于CPU的实时6D物体姿态估计（arXiv）

泡泡机器人SLAM

12+阅读 · 2019年1月26日

【团队新作】连续情感识别，精准捕捉你的小情绪！

【团队新作】连续情感识别，精准捕捉你的小情绪！

中国科学院自动化研究所

16+阅读 · 2018年4月17日

自然语言处理中的Attention Model：是什么及为什么

自然语言处理中的Attention Model：是什么及为什么

新智元

11+阅读 · 2017年7月13日

相关论文

RAVEN: Realtime Accessibility in Virtual ENvironments for Blind and Low-Vision People

Arxiv

0+阅读 · 2月8日

Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models

Arxiv

0+阅读 · 2月1日

Virtual Reflections on a Dynamic 2D Eye Model Improve Spatial Reference Identification

Arxiv

0+阅读 · 1月29日

SituFont: A Just-in-Time Adaptive Intervention System for Enhancing Mobile Readability in Situational Visual Impairments

Arxiv

0+阅读 · 1月27日

Comparative Evaluation of Machine Learning Algorithms for Affective State Recognition from Children's Drawings

Arxiv

0+阅读 · 1月26日

A Real-Time Error Prevention System for Gaze-Based Interaction in Virtual Reality Based on Anomaly Detection

Arxiv

0+阅读 · 1月21日

SmoothCLAP: Soft-Target Enhanced Contrastive Language\--Audio Pretraining for Affective Computing

Arxiv

0+阅读 · 1月18日

Learning Latency-Aware Orchestration for Parallel Multi-Agent Systems

Arxiv

0+阅读 · 1月15日

Time Perception in Virtual Reality: Effects of Emotional Valence and Stress Level

Arxiv

0+阅读 · 1月14日

Tailored Immersive Environments: Advancing Neurodivergent Support Through Virtual Reality

Arxiv

0+阅读 · 1月13日

相关基金

基于虚拟现实的认知负荷与情绪干扰交互性分析关键技术研究

国家自然科学基金

1+阅读 · 2017年12月31日

基于马尔科夫信道模型的无线网络通信系统时延性能研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于MEMS加速度传感器的智能终端手势识别及三维交互模型

国家自然科学基金

6+阅读 · 2015年12月31日

数据中心网络中延时敏感的传输控制协议

国家自然科学基金

0+阅读 · 2015年12月31日

面向非接触式、非稳定和长时间尺度生理信号的情感状态自动识别研究

国家自然科学基金

2+阅读 · 2015年12月31日

人体行为识别的时空耦合随机图模型及其高效推理算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于人脸表情、身体姿态和语音的多模态情感识别方法研究

国家自然科学基金

10+阅读 · 2015年12月31日

数据中心延迟敏感型应用尾端响应时延服务质量保障方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

延迟容忍网络中自适应社会感知路由研究

国家自然科学基金

0+阅读 · 2015年12月31日

数据和模型混合驱动的虚拟人群行为仿真技术研究及其在军事中的应用

国家自然科学基金

10+阅读 · 2011年12月31日

微信扫码咨询专知VIP会员