成为VIP会员查看完整内容
VIP会员码认证
首页
主题
会员
服务
注册
·
登录
语音识别
关注
753
语音识别是计算机科学和计算语言学的一个跨学科子领域,它发展了一些方法和技术,使计算机可以将口语识别和翻译成文本。 它也被称为自动语音识别(ASR),计算机语音识别或语音转文本(STT)。它整合了计算机科学,语言学和计算机工程领域的知识和研究。
综合
百科
VIP
热门
动态
论文
精华
Voices Across Registers: Corpus-Conditioned Vernacular Jailbreaks against Aligned LLMs via Fanfiction Subgenres
Arxiv
0+阅读 · 8月30日
KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs
Arxiv
0+阅读 · 8月30日
Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models
Arxiv
0+阅读 · 8月31日
BadPatches: Routing-Aware Backdoor Attacks on Vision Mixture-of-Experts
Arxiv
0+阅读 · 8月29日
MUSE: A Run-Centric Platform for Multimodal Unified Safety Evaluation of Large Language Models
Arxiv
0+阅读 · 8月31日
Linguistic Distance Segregates Latent Representations in Automatic Speech Recognition Systems
Arxiv
0+阅读 · 8月31日
The Fragility of Jailbreak Robustness Across Operational States
Arxiv
0+阅读 · 8月31日
Conjoint Audio-to-Spikes Encoding and Processing for Efficient Neuromorphic Speech Recognition
Arxiv
0+阅读 · 8月31日
From Speech to Subtitles: Evaluating ASR Models in Subtitling Italian Television Programs
Arxiv
0+阅读 · 8月31日
Will the User Ever Know? Covert Indirect Prompt Injection on Tool-Using LLM Agents
Arxiv
0+阅读 · 8月31日
Stride-k Subsampling: Train-Free Audio Token Reduction for Whisper
Arxiv
0+阅读 · 8月31日
Beyond the Payload: How User Invocation Shapes Coding Agent Vulnerability to Repository Poisoning
Arxiv
0+阅读 · 8月31日
Parallel Time-Band Mixing with Learned Observation-Adding for Robust ASR Front-Ends
Arxiv
0+阅读 · 8月31日
FSA-GRPO: Teaching Auditory LLMs to Use Few-Shot Demonstrations
Arxiv
0+阅读 · 8月29日
Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages
Arxiv
0+阅读 · 8月29日
参考链接
提示
微信扫码
咨询专知VIP会员与技术项目合作
(加微信请备注: "专知")
微信扫码咨询专知VIP会员
Top