超越单语假设：多模态大语言模型时代的语码转换自然语言处理综述 (Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities) - 专知论文

会员服务 ·

0

语言处理 · 语言模型 · 数据集 · 大语言模型 · 多模 ·

Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities

翻译：超越单语假设：多模态大语言模型时代的语码转换自然语言处理综述

Rajvee Sheth,Samridhi Raj Sinha,Mahavir Patil,Himanshu Beniwal,Mayank Singh

Code-switching (CSW), the alternation of languages and scripts within a single utterance, remains a fundamental challenge for multilingual NLP, even amidst the rapid advances of large language models (LLMs). Amidst the rapid advances of large language models (LLMs), most LLMs still struggle with mixed-language inputs, limited Codeswitching (CSW) datasets, and evaluation biases, which hinder their deployment in multilingual societies. This survey provides the first comprehensive analysis of CSW-aware LLM research, reviewing 327 studies spanning five research areas, 15+ NLP tasks, 30+ datasets, and 80+ languages. We categorize recent advances by architecture, training strategy, and evaluation methodology, outlining how LLMs have reshaped CSW modeling and identifying the challenges that persist. The paper concludes with a roadmap that emphasizes the need for inclusive datasets, fair evaluation, and linguistically grounded models to achieve truly multilingual capabilities https://github.com/lingo-iitgn/awesome-code-mixing/.

翻译：语码转换（CSW），即在单个话语中交替使用不同语言和文字，即使在大型语言模型（LLM）快速发展的背景下，它仍然是多语言自然语言处理面临的一项根本性挑战。在大型语言模型（LLM）快速发展的浪潮中，大多数LLM在处理混合语言输入时仍面临困难，同时受限于语码转换（CSW）数据集的匮乏以及评估偏差，这阻碍了其在多语言社会中的部署。本综述首次对CSW相关的LLM研究进行了全面分析，回顾了涵盖五个研究领域、15种以上NLP任务、30多个数据集以及80多种语言的327项研究。我们依据架构、训练策略和评估方法对最新进展进行了分类，概述了LLM如何重塑CSW建模，并指出了持续存在的挑战。本文最后提出了一份路线图，强调需要构建包容性数据集、建立公平评估体系以及发展基于语言学的模型，以实现真正的多语言能力 https://github.com/lingo-iitgn/awesome-code-mixing/。

0

相关内容

语言处理

多模态大语言模型的自我改进：综述

多模态大语言模型的自我改进：综述

专知会员服务

25+阅读 · 2025年10月8日

多模态大型语言模型：综述

多模态大型语言模型：综述

专知会员服务

45+阅读 · 2025年6月14日

《大语言模型时代的小型语言模型综述：技术、增强、应用、与大语言模型的合作及可信度》

《大语言模型时代的小型语言模型综述：技术、增强、应用、与大语言模型的合作及可信度》

专知会员服务

55+阅读 · 2024年11月7日

《语音大语言模型》最新进展综述

《语音大语言模型》最新进展综述

专知会员服务

57+阅读 · 2024年10月8日

《大型语言模型代码生成》综述

《大型语言模型代码生成》综述

专知会员服务

68+阅读 · 2024年6月4日

大型语言模型遇上自然语言处理：综述

大型语言模型遇上自然语言处理：综述

专知会员服务

38+阅读 · 2024年5月23日

《多模态大型语言模型》最新进展，详述26种现有MM-LLMs

《多模态大型语言模型》最新进展，详述26种现有MM-LLMs

专知会员服务

65+阅读 · 2024年1月25日

如何编辑大模型中的知识？浙大等最新《大型语言模型知识编辑》全面综述

如何编辑大模型中的知识？浙大等最新《大型语言模型知识编辑》全面综述

专知会员服务

72+阅读 · 2024年1月3日

大语言模型简明指南

大语言模型简明指南

专知会员服务

143+阅读 · 2023年7月29日

中科大腾讯最新《多模态大型语言模型》综述，详述多模态指令微调、上下文学习、思维链和辅助视觉推理技术

中科大腾讯最新《多模态大型语言模型》综述，详述多模态指令微调、上下文学习、思维链和辅助视觉推理技术

专知会员服务

105+阅读 · 2023年6月27日

194篇文献调研ChatGPT最新研究进展！最新《ChatGPT/GPT-4研究综述及对大型语言模型未来的展望》国内外研究者编著

194篇文献调研ChatGPT最新研究进展！最新《ChatGPT/GPT-4研究综述及对大型语言模型未来的展望》国内外研究者编著

专知

25+阅读 · 2023年4月7日

从T5到GPT-4最新最全梳理，人大等《大型语言模型综述》，51页pdf详述大模型进展

从T5到GPT-4最新最全梳理，人大等《大型语言模型综述》，51页pdf详述大模型进展

专知

25+阅读 · 2023年4月4日

NLP大牛Thomas Wolf等新书《Transformer自然语言处理》，466页pdf及代码

NLP大牛Thomas Wolf等新书《Transformer自然语言处理》，466页pdf及代码

专知

36+阅读 · 2022年2月7日

【2022新书】Transformer自然语言处理：构建语言应用

【2022新书】Transformer自然语言处理：构建语言应用

专知

38+阅读 · 2022年1月31日

绝对干货！NLP预训练模型：从transformer到albert

绝对干货！NLP预训练模型：从transformer到albert

新智元

13+阅读 · 2019年11月10日

Facebook 自然语言处理新突破：新模型能力赶超人类 & 超难 NLP 新基准

Facebook 自然语言处理新突破：新模型能力赶超人类 & 超难 NLP 新基准

AI科技评论

10+阅读 · 2019年9月17日

【综述】多语言神经机器翻译最新综述，附全文下载

【综述】多语言神经机器翻译最新综述，附全文下载

专知

32+阅读 · 2019年5月15日

NLP圣经《自然语言处理综述》2018最新版推荐

NLP圣经《自然语言处理综述》2018最新版推荐

深度学习与NLP

16+阅读 · 2018年9月26日

从语言学到深度学习NLP，一文概述自然语言处理

从语言学到深度学习NLP，一文概述自然语言处理

人工智能学家

13+阅读 · 2018年1月28日

自然语言处理（二）机器翻译篇 (NLP: machine translation)

自然语言处理（二）机器翻译篇 (NLP: machine translation)

DeepLearning中文论坛

12+阅读 · 2015年7月1日

基于盲双迭代策略的高可靠变速移动水声多用户通信理论和方法

国家自然科学基金

0+阅读 · 2017年12月31日

基于反馈型级联连接模型的多模态语义SFM方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

面向聋儿言语康复的多模态人机交互模型及技术研究

国家自然科学基金

3+阅读 · 2015年12月31日

基于形态和多词的有限语料蒙汉互译调序优化方法

国家自然科学基金

0+阅读 · 2015年12月31日

基于犹豫模糊语言信息的定性决策理论与方法

国家自然科学基金

2+阅读 · 2015年12月31日

基于比特置信度的低复杂度多进制LDPC码译码算法

国家自然科学基金

0+阅读 · 2015年12月31日

随机文法作为通用统计模型的扩展

国家自然科学基金

1+阅读 · 2015年12月31日

多域网络安全的异构策略语义形态与验证机制

国家自然科学基金

0+阅读 · 2014年12月31日

多语言大数据环境下的复杂网络行为分析、预测和干预

国家自然科学基金

4+阅读 · 2014年12月31日

基于潜在语义对偶空间的新词翻译自动识别方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

Beyond speculation: Measuring the growing presence of LLM-generated texts in multilingual disinformation

Arxiv

0+阅读 · 2月4日

Tracing Multilingual Representations in LLMs with Cross-Layer Transcoders

Arxiv

0+阅读 · 1月30日

Beyond Instrumental and Substitutive Paradigms: Introducing Machine Culture as an Emergent Phenomenon in Large Language Models

Arxiv

0+阅读 · 1月23日

Improving Training Efficiency and Reducing Maintenance Costs via Language Specific Model Merging

Arxiv

0+阅读 · 1月22日

A Comprehensive Study on Large Language Models for Mutation Testing

Arxiv

0+阅读 · 1月22日

Beyond Accuracy: Characterizing Code Comprehension Capabilities in (Large) Language Models

Arxiv

0+阅读 · 1月19日

Beyond the Turn-Based Game: Enabling Real-Time Conversations with Duplex Models

Arxiv

0+阅读 · 1月13日

Bridging the Linguistic Divide: A Survey on Leveraging Large Language Models for Machine Translation

Arxiv

0+阅读 · 1月12日

From Transformers to LLMs: A Systematic Survey of Efficiency Considerations in NLP

Arxiv

0+阅读 · 2025年12月31日

A Systematic Survey on Large Language Models for Algorithm Design

Arxiv

0+阅读 · 2025年12月30日

VIP会员

文章信息

相关主题

大语言模型

相关VIP内容

多模态大语言模型的自我改进：综述

多模态大语言模型的自我改进：综述

专知会员服务

25+阅读 · 2025年10月8日

多模态大型语言模型：综述

多模态大型语言模型：综述

专知会员服务

45+阅读 · 2025年6月14日

《大语言模型时代的小型语言模型综述：技术、增强、应用、与大语言模型的合作及可信度》

《大语言模型时代的小型语言模型综述：技术、增强、应用、与大语言模型的合作及可信度》

专知会员服务

55+阅读 · 2024年11月7日

《语音大语言模型》最新进展综述

《语音大语言模型》最新进展综述

专知会员服务

57+阅读 · 2024年10月8日

《大型语言模型代码生成》综述

《大型语言模型代码生成》综述

专知会员服务

68+阅读 · 2024年6月4日

大型语言模型遇上自然语言处理：综述

大型语言模型遇上自然语言处理：综述

专知会员服务

38+阅读 · 2024年5月23日

《多模态大型语言模型》最新进展，详述26种现有MM-LLMs

《多模态大型语言模型》最新进展，详述26种现有MM-LLMs

专知会员服务

65+阅读 · 2024年1月25日

如何编辑大模型中的知识？浙大等最新《大型语言模型知识编辑》全面综述

如何编辑大模型中的知识？浙大等最新《大型语言模型知识编辑》全面综述

专知会员服务

72+阅读 · 2024年1月3日

大语言模型简明指南

大语言模型简明指南

专知会员服务

143+阅读 · 2023年7月29日

中科大腾讯最新《多模态大型语言模型》综述，详述多模态指令微调、上下文学习、思维链和辅助视觉推理技术

中科大腾讯最新《多模态大型语言模型》综述，详述多模态指令微调、上下文学习、思维链和辅助视觉推理技术

专知会员服务

105+阅读 · 2023年6月27日

热门VIP内容

开通专知VIP会员享更多权益服务

论学习、公平性与复杂度

《整合杀伤链：一个用于边缘目标验证与战术推理的零样本框架》最新资料

2025中国人工智能学会系列白皮书⸺棋盘上的人工智能|附下载

通用智能体评估的逻辑架构

相关资讯

194篇文献调研ChatGPT最新研究进展！最新《ChatGPT/GPT-4研究综述及对大型语言模型未来的展望》国内外研究者编著

194篇文献调研ChatGPT最新研究进展！最新《ChatGPT/GPT-4研究综述及对大型语言模型未来的展望》国内外研究者编著

专知

25+阅读 · 2023年4月7日

从T5到GPT-4最新最全梳理，人大等《大型语言模型综述》，51页pdf详述大模型进展

从T5到GPT-4最新最全梳理，人大等《大型语言模型综述》，51页pdf详述大模型进展

专知

25+阅读 · 2023年4月4日

NLP大牛Thomas Wolf等新书《Transformer自然语言处理》，466页pdf及代码

NLP大牛Thomas Wolf等新书《Transformer自然语言处理》，466页pdf及代码

专知

36+阅读 · 2022年2月7日

【2022新书】Transformer自然语言处理：构建语言应用

【2022新书】Transformer自然语言处理：构建语言应用

专知

38+阅读 · 2022年1月31日

绝对干货！NLP预训练模型：从transformer到albert

绝对干货！NLP预训练模型：从transformer到albert

新智元

13+阅读 · 2019年11月10日

Facebook 自然语言处理新突破：新模型能力赶超人类 & 超难 NLP 新基准

Facebook 自然语言处理新突破：新模型能力赶超人类 & 超难 NLP 新基准

AI科技评论

10+阅读 · 2019年9月17日

【综述】多语言神经机器翻译最新综述，附全文下载

【综述】多语言神经机器翻译最新综述，附全文下载

专知

32+阅读 · 2019年5月15日

NLP圣经《自然语言处理综述》2018最新版推荐

NLP圣经《自然语言处理综述》2018最新版推荐

深度学习与NLP

16+阅读 · 2018年9月26日

从语言学到深度学习NLP，一文概述自然语言处理

从语言学到深度学习NLP，一文概述自然语言处理

人工智能学家

13+阅读 · 2018年1月28日

自然语言处理（二）机器翻译篇 (NLP: machine translation)

自然语言处理（二）机器翻译篇 (NLP: machine translation)

DeepLearning中文论坛

12+阅读 · 2015年7月1日

相关论文

Beyond speculation: Measuring the growing presence of LLM-generated texts in multilingual disinformation

Arxiv

0+阅读 · 2月4日

Tracing Multilingual Representations in LLMs with Cross-Layer Transcoders

Arxiv

0+阅读 · 1月30日

Beyond Instrumental and Substitutive Paradigms: Introducing Machine Culture as an Emergent Phenomenon in Large Language Models

Arxiv

0+阅读 · 1月23日

Improving Training Efficiency and Reducing Maintenance Costs via Language Specific Model Merging

Arxiv

0+阅读 · 1月22日

A Comprehensive Study on Large Language Models for Mutation Testing

Arxiv

0+阅读 · 1月22日

Beyond Accuracy: Characterizing Code Comprehension Capabilities in (Large) Language Models

Arxiv

0+阅读 · 1月19日

Beyond the Turn-Based Game: Enabling Real-Time Conversations with Duplex Models

Arxiv

0+阅读 · 1月13日

Bridging the Linguistic Divide: A Survey on Leveraging Large Language Models for Machine Translation

Arxiv

0+阅读 · 1月12日

From Transformers to LLMs: A Systematic Survey of Efficiency Considerations in NLP

Arxiv

0+阅读 · 2025年12月31日

A Systematic Survey on Large Language Models for Algorithm Design

Arxiv

0+阅读 · 2025年12月30日

相关基金

基于盲双迭代策略的高可靠变速移动水声多用户通信理论和方法

国家自然科学基金

0+阅读 · 2017年12月31日

基于反馈型级联连接模型的多模态语义SFM方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

面向聋儿言语康复的多模态人机交互模型及技术研究

国家自然科学基金

3+阅读 · 2015年12月31日

基于形态和多词的有限语料蒙汉互译调序优化方法

国家自然科学基金

0+阅读 · 2015年12月31日

基于犹豫模糊语言信息的定性决策理论与方法

国家自然科学基金

2+阅读 · 2015年12月31日

基于比特置信度的低复杂度多进制LDPC码译码算法

国家自然科学基金

0+阅读 · 2015年12月31日

随机文法作为通用统计模型的扩展

国家自然科学基金

1+阅读 · 2015年12月31日

多域网络安全的异构策略语义形态与验证机制

国家自然科学基金

0+阅读 · 2014年12月31日

多语言大数据环境下的复杂网络行为分析、预测和干预

国家自然科学基金

4+阅读 · 2014年12月31日

基于潜在语义对偶空间的新词翻译自动识别方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员