综述 | 低资源语言中的大模型安全对齐:方法、风险与评测体系

导读

大语言模型的安全对齐研究长期以英语和少数高资源语言为中心,但模型的真实部署场景远比这更复杂。大量用户使用的是低资源语言、地区语言、混合语言和文化语境强烈的表达方式。如果安全对齐只在英语中有效,那么模型在全球化应用中就可能出现一种隐蔽但严重的不平等:英语用户获得更强的拒答、毒性控制和有害内容防护,而低资源语言用户面对的却是更高的越狱成功率、更弱的内容 moderation、更不可靠的文化风险识别。 这篇系统综述《LLM Safety Alignment in Low-Resource Languages: A Systematic Literature Review》围绕低资源语言中的大模型安全对齐展开。作者采用 PRISMA 2020 系统综述流程,从 Semantic Scholar、arXiv 和 OpenAlex 中检索约 1500 篇论文,经去重、自动评分、LLM 辅助筛选和两轮人工修订,最终纳入 50 篇研究进行综合分析。 论文围绕四个研究问题组织:低资源语言中的安全对齐方法如何适配?多语言场景中会出现哪些安全风险、攻击行为和文化伤害?现有数据集、基准和评测框架有哪些?安全对齐能否跨语言迁移,迁移失败又受哪些因素影响?整体结论很直接:当前安全对齐仍然明显偏向高资源语言,简单翻译英语数据远远不够;未来需要原生语言安全基准、文化参与式数据构建、均衡多语预训练和可扩展的多语言对齐方法。

Introduction | 引言

论文首先指出,大语言模型已经进入教育、医疗、治理和数字交流等高影响场景。安全模型通常要求避免生成有害、非法、有毒、危险或带偏见的内容,同时保持对用户有用。过去几年,RLHF、宪法式 AI、安全微调和红队测试等技术推动了英文场景下的安全对齐进展。 问题在于,这些技术和评测框架大多建立在高资源语言上,尤其是英语。它们依赖大规模标注数据、基准、偏好反馈和安全策略,而这些资源在许多低资源语言中并不存在。更麻烦的是,英文中学到的安全拒答行为并不会可靠迁移到其他语言。已有研究显示,同样的有害提示翻译到低资源语言后,模型可能更容易服从危险指令。

核心问题

论文将低资源语言安全对齐视为一个系统性问题,而不是简单的数据缺口。安全失败可能来自预训练覆盖不均衡、目标语言偏好数据不足、安全表示迁移失败、文化伤害定义缺失,以及评测基准过度依赖翻译。尤其在非洲语言等场景中,很多安全基准、红队数据和本地文化风险几乎没有被充分覆盖。 作者因此提出四个研究问题:安全对齐方法如何迁移到低资源语言;多语言场景出现哪些风险;现有评测资源有哪些;跨语言安全迁移由哪些因素决定。这四个问题也构成全文结构。

相关工作部分指出,已有多语言安全综述通常更关注跨语言攻击、毒性检测或一般多语言评测,很少专门聚焦低资源语言中的安全对齐。它们也往往把低资源语言作为一个笼统类别,而没有充分讨论非洲语言、地区文化伤害和本地语言评测之间的差异。 本文的定位是补足这一缺口:它专门围绕低资源语言和非洲语言中的 LLM 安全对齐进行系统综述,并将已有研究整理为可操作的维度,包括方法、风险、基准和迁移机制。这种组织方式使读者不仅知道“有哪些论文”,更能看到研究生态中哪些环节仍然薄弱。

Methodology | 方法论

论文采用 PRISMA 2020 指南进行系统文献综述。作者从 Semantic Scholar、arXiv 和 OpenAlex 检索相关论文,关键词覆盖三类:技术维度,如 LLM、instruction tuning、foundation models;安全维度,如 alignment、jailbreak、adversarial attack、toxicity、RLHF、DPO;语言范围维度,如 low-resource language、multilingual、African language 等。 初始检索约得到 1500 条记录,去重后约 1300 条;经过自动评分和年份过滤后保留 242 篇候选;再通过 LLM 辅助资格筛选得到 70 篇建议保留论文;经过两轮人工复核和严格相关性验证,最终形成 50 篇论文的综合分析语料。

流程价值

这套流程的意义在于降低综述选择的随意性。低资源语言安全对齐是一个新兴方向,论文分散在安全、NLP、多语言建模、红队评测和地区语言研究等多个社区。如果没有系统筛选,容易只关注少数高可见度 benchmark,而忽略地方性数据集、文化风险研究和参数级安全迁移方法。

Safety Alignment Methods for Low-Resource Languages | 低资源语言安全对齐方法

论文将低资源语言安全对齐方法归纳为三类机制:文化扎根的数据适配、跨语言迁移与目标优化、机制和参数级对齐。这个分类很有用,因为它把“安全对齐发生在哪里”说清楚了:有些方法主要改数据,有些方法改优化目标,有些方法则直接修改模型内部表示或参数。

文化扎根的数据适配

最直接的方法是构建更好的多语言安全数据。代表性工作包括 CultureGuard、SEALGuard、LionGuard 2 等。它们共同强调,安全数据不能只是英文有害提示的翻译版,而要反映本地语言表达、代码混合现象和文化伤害定义。例如,东南亚、南亚、非洲和新加坡英语混合场景中的风险类别,与英文安全基准中的常规 toxic categories 并不完全一致。 论文特别强调数据质量的重要性。有研究显示,少量经过严格过滤和本地化处理的样本,可能达到或超过大规模未过滤翻译数据的效果。这说明低资源语言安全对齐不能只靠规模,还要关注翻译是否保留有害意图、是否破坏代码和 URL、是否经过母语者验证。

跨语言迁移与目标优化

当目标语言安全数据不足时,另一条路径是修改训练目标,让一种语言中学到的安全行为迁移到其他语言。代表方法包括 multilingual reward gap optimization、KTO 变体、知识蒸馏、推理链一致性和多语言 consistency loss。 这一类方法的共同目标是减少对目标语言成对偏好数据的依赖。例如,MPO 不要求每种语言都具备 chosen/rejected 偏好对,而是直接缩小安全与不安全输出之间的 reward gap。推理一致性方法则希望模型在不同语言中形成更一致的安全理由,而不是只在英文中学会拒答模板。

机制与参数级对齐

第三类方法试图直接操作模型内部。论文讨论了 Sparse Weight Editing、layer-wise safety feature transplant、attention head 干预等工作。这些方法基于一个观察:安全能力可能集中在模型的稀疏权重、特定层或安全关键表示中。如果能识别并迁移这些组件,就可能在不完整重训或不依赖大规模数据的情况下提升低资源语言安全性。 这种方向尤其适合资源受限环境。低资源语言往往缺少大规模高质量标注数据,也缺少足够算力做完整对齐训练。参数级和机制级方法若能稳定工作,将为低成本多语言安全迁移提供新路径。

Safety Risks in Multilingual and Low resource Language Contexts | 多语言与低资源语境中的安全风险

第五节总结多语言低资源场景中的主要安全风险,包括跨语言越狱、新语言微调带来的攻击面、代码混合和文化特定伤害。这些风险共同说明,低资源语言安全不是英文安全策略的“尾部场景”,而是会暴露模型安全机制边界的关键测试场。

跨语言越狱

跨语言越狱是最直接的风险。研究显示,将有害提示翻译到低资源语言,可能显著提高模型服从危险请求的概率。有结果显示,在 GPT-4 上,低资源语言有害提示的越狱成功率可达到 79%,而高资源语言低于 15%。这表明模型的拒答能力并没有均匀覆盖语言空间。 这种风险不只来自翻译。部分研究发现,小代理模型可以用低成本生成跨语言可迁移攻击;合同式、JSON 结构化提示等形式也会在多语言场景中扰乱拒答行为。低资源语言因为 tokenization、语义表示和安全训练覆盖不足,更容易成为安全薄弱点。

新语言微调与代码混合

论文还指出,微调本身可能成为攻击向量。即便使用良性数据对安全模型进行新语言适配,也可能破坏原有安全约束。这对非洲语言和其他低资源语言尤其重要,因为很多部署方会希望通过轻量微调补足语言能力,但如果没有同步安全校准,模型安全性可能下降。 代码混合也是现实中常见但评测不足的风险。很多多语言社群自然使用 code-switching,而不是刻意攻击模型。若模型在混合语言提示中安全鲁棒性下降,那么真实用户场景就会出现不可预期的安全漏洞。论文提到,混合语言可显著降低安全鲁棒性,在 GPT-3.5 和 GPT-4 上都观察到较高 bypass rate。

文化特定伤害

安全失败还具有文化维度。某些内容在一个文化中可能被视为无害,在另一个文化中可能带有歧视、污名或现实危险。Hausa 等低资源语言中的实验显示,模型可能生成有毒产品推荐、误导性建议或文化上不合适的内容,传统英文安全基准很难捕捉这些问题。 这提醒我们,安全对齐不是语言翻译问题,而是价值、语境和社会规范问题。缺乏本地文化参与的安全数据,会让模型在低资源语言中既不够安全,也不够尊重当地语境。

Safety Evaluation Benchmarks | 安全评测基准

第六节梳理现有多语言安全评测基准。总体趋势是,评测正在从简单英文翻译,逐步转向原生语言、地区文化风险和多语言对抗测试。代表性基准包括 XSafety、LinguaSafe、PolyglotToxicityPrompts、ML-Bench、SEALSBench、SEA-SafeguardBench、SGToxicGuard、Qorgau、IndicSafe、IndicJR、SEAHateCheck、IndoSafety、UbuntuGuard、Uhura 等。

全球与地区基准

全球多语言安全基准通常覆盖多种语言和安全问题,适合比较模型在不同语言上的整体表现。但论文指出,许多基准仍大量依赖英文数据翻译,这会丢失文化语义,也可能改变有害内容的原始意图。 地区性和文化本地化基准则更关注本土风险。例如东南亚、南亚、哈萨克语、俄罗斯语、印尼语和非洲语言中的安全评测,开始覆盖更贴近当地语言实践和社会语境的风险类型。相比通用 benchmark,这类资源更能发现英语中心评测无法识别的问题。

非洲语言缺口

论文特别指出,非洲语言安全基准仍严重不足。虽然已有 LSR、UbuntuGuard、Uhura 等工作关注 Yoruba、Hausa、Igbo、Igala 等语言中的拒答退化、政策安全和真实性约束,但与其他多语言评测生态相比,非洲语言覆盖仍然薄弱。 这不仅是数据规模问题,也影响方法开发。如果没有可靠评测,研究者就难以判断一种低资源语言对齐方法是否真的有效;如果评测依赖翻译,又会进一步掩盖文化特定伤害。数据和评测的不足,会反过来限制模型安全改进。

Cross-Lingual Transferability of Safety Alignment | 安全对齐的跨语言迁移性

第七节讨论安全对齐为什么难以跨语言迁移。论文总结的共识是:安全对齐并不是语言无关的。高资源语言中学到的拒答和安全推理,在低资源语言中往往退化。主要原因包括预训练覆盖不均衡、语言距离、脚本差异、形态复杂性、tokenization 碎片化、安全监督不足,以及本地偏好数据缺失。

迁移瓶颈

许多研究认为,预训练阶段的语言覆盖是核心瓶颈。安全相关知识和表示主要集中在高资源语言区域,低资源语言在模型 latent space 中表示更弱,因此后续对齐训练很难充分补齐。即使使用翻译数据做微调,模型也可能只是学到表层拒答模式,而没有建立稳定的跨语言安全表示。 另一类工作尝试从表示层面改善迁移。例如 Sparse Weight Editing 将高资源语言安全模型中的关键权重映射到低资源表示空间;多语言一致性目标则要求同一安全语义在不同语言中保持一致。这些方向说明,未来安全迁移可能需要数据、目标和模型内部机制同时协同。

Discussion | 讨论

讨论部分将四个研究问题串联起来:现有安全对齐方法大多从英文数据和英文安全定义出发,没有充分扩展到世界其他语言。这种失衡贯穿预训练、对齐、评测和应用部署全过程。 在方法层面,参数高效微调、数据合成和跨语言迁移虽然有帮助,但如果基础模型本身严重缺乏低资源语言覆盖,其增益会非常有限。在风险层面,跨语言越狱、代码混合攻击、新语言微调退化和文化特定伤害都被报告过,但评测覆盖不足。在基准层面,多语言 benchmark 正在增长,但非洲语言等地区仍被低估。最后,在迁移层面,简单翻译无法解决深层表示、文化语义和安全价值不一致的问题。

研究缺口

论文指出一个自我强化循环:预训练覆盖不足导致安全对齐迁移差,而评测基准不足又让这些缺陷难以被准确测量。要打破这个循环,需要同时推进原生语言数据、文化扎根评测、本地社群参与和可扩展多语言对齐技术。 这也意味着,低资源语言安全不能只由英语中心团队通过翻译完成。参与式数据采集、母语者验证、本地伤害分类和地区语言政策都应进入安全对齐流程。

Conclusion | 结论

论文最后总结说,当前 LLM 安全对齐方法仍主要为高资源语言设计,无法在低资源语言和多语言文化语境中可靠泛化。现有基准过度依赖翻译数据,常常无法捕捉文化扎根的伤害;多语言适配和微调有时还会降低低资源语言安全表现。 未来研究应聚焦四个方向:第一,构建原生语言安全基准,减少对英文翻译的依赖;第二,推动更加均衡的多语言预训练,使低资源语言在模型内部表示中不再被边缘化;第三,发展文化感知的评测方法,将本地社会规范和伤害定义纳入安全标准;第四,建立参与式框架,让非洲语言和其他低资源语言社区主动参与 AI 安全标准和实践的定义。

关键启示

第一,安全对齐不是英语问题的多语言外推,而是全球语言生态中的系统工程。 第二,低资源语言中的安全风险既包括技术层面的越狱和拒答退化,也包括文化层面的伤害误判和价值错配。 第三,翻译数据只能作为过渡方案,不能替代原生语言安全数据、母语者标注和本地文化评测。 第四,未来更可靠的多语言安全对齐,需要同时处理数据、优化目标、模型内部机制和评测基准。只有这样,大模型安全能力才可能从高资源语言真正扩展到全球语言用户。

成为VIP会员查看完整内容
0

相关内容

综述:面向移动端大语言模型的隐私与安全
专知会员服务
19+阅读 · 2025年9月7日
158页!天大等最新《大型语言模型安全:全面综述》
专知会员服务
51+阅读 · 2024年12月24日
低比特大语言模型综述:基础、系统与算法
专知会员服务
28+阅读 · 2024年10月6日
大语言模型对齐研究综述
专知会员服务
56+阅读 · 2024年8月1日
《大模型对齐方法》最新综述
专知会员服务
85+阅读 · 2024年3月8日
大语言模型安全现状与挑战
专知会员服务
89+阅读 · 2024年1月14日
大模型安全与对齐:复杂系统视角下的AI安全
专知会员服务
53+阅读 · 2024年1月2日
大型语言模型对齐
专知会员服务
120+阅读 · 2023年9月27日
【深度语义匹配模型】原理篇二:交互篇
AINLP
16+阅读 · 2020年5月18日
跨多个异构数据源的实体对齐
FCS
15+阅读 · 2019年3月13日
自然语言处理中的语言模型预训练方法
PaperWeekly
14+阅读 · 2018年10月21日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
6+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
1+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
4+阅读 · 2014年12月31日
Arxiv
17+阅读 · 2023年9月26日
VIP会员
最新内容
美国战争部在GenAI.mil上推出OpenAI的ChatGPT Mil
专知会员服务
1+阅读 · 今天15:16
人工智能赋能军事维护:重新定义国防战备
专知会员服务
0+阅读 · 今天15:00
《美陆军野战手册(2026年):特种部队》
专知会员服务
2+阅读 · 今天14:17
受限仓库多智能体取送中的动态安全等待点选择
《国防技术管理》印度智库报告最新45页
专知会员服务
5+阅读 · 8月28日
《美陆军最新条令:保障行动》
专知会员服务
5+阅读 · 8月28日
算法战场:人工智能如何重新定义军事力量
专知会员服务
8+阅读 · 8月28日
相关VIP内容
综述:面向移动端大语言模型的隐私与安全
专知会员服务
19+阅读 · 2025年9月7日
158页!天大等最新《大型语言模型安全:全面综述》
专知会员服务
51+阅读 · 2024年12月24日
低比特大语言模型综述:基础、系统与算法
专知会员服务
28+阅读 · 2024年10月6日
大语言模型对齐研究综述
专知会员服务
56+阅读 · 2024年8月1日
《大模型对齐方法》最新综述
专知会员服务
85+阅读 · 2024年3月8日
大语言模型安全现状与挑战
专知会员服务
89+阅读 · 2024年1月14日
大模型安全与对齐:复杂系统视角下的AI安全
专知会员服务
53+阅读 · 2024年1月2日
大型语言模型对齐
专知会员服务
120+阅读 · 2023年9月27日
相关基金
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
6+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
1+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
4+阅读 · 2014年12月31日
微信扫码咨询专知VIP会员