ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning

Large Language Models have shown impressive generative capabilities across diverse tasks, but their safety remains a critical concern. Existing post-training alignment methods, such as SFT and RLHF, reduce harmful outputs yet leave LLMs vulnerable to jailbreak attacks, especially advanced optimization-based ones. Recent system-2 approaches enhance safety by adding inference-time reasoning, where models assess potential risks before producing responses. However, we find these methods fail against powerful out-of-distribution jailbreaks, such as AutoDAN-Turbo and Adversarial Reasoning, which conceal malicious goals behind seemingly benign prompts. We observe that all jailbreaks ultimately aim to embed a core malicious intent, suggesting that extracting this intent is key to defense. To this end, we propose ARMOR, which introduces a structured three-step reasoning pipeline: (1) analyze jailbreak strategies from an external, updatable strategy library, (2) extract the core intent, and (3) apply policy-based safety verification. We further develop ARMOR-Think, which decouples safety reasoning from general reasoning to improve both robustness and utility. Evaluations on advanced optimization-based jailbreaks and safety benchmarks show that ARMOR achieves state-of-the-art safety performance, with an average harmful rate of 0.002 and an attack success rate of 0.06 against advanced optimization-based jailbreaks, far below other reasoning-based models. Moreover, ARMOR demonstrates strong generalization to unseen jailbreak strategies, reducing their success rate to zero. These highlight ARMOR's effectiveness in defending against OOD jailbreak attacks, offering a practical path toward secure and reliable LLMs.

翻译：大语言模型已在多种任务中展现出卓越的生成能力，但其安全性仍是关键问题。现有的训练后对齐方法（如SFT和RLHF）虽能减少有害输出，却使LLM在面对越狱攻击时依然脆弱，尤其是基于优化的高级攻击。近期的系统-2方法通过在推理时增加思考步骤来提升安全性，使模型在生成回复前评估潜在风险。然而，我们发现这些方法难以抵御强大的分布外越狱攻击，例如AutoDAN-Turbo和Adversarial Reasoning，此类攻击将恶意目标隐藏在看似无害的提示背后。我们观察到所有越狱攻击最终都旨在嵌入一个核心恶意意图，这表明提取该意图是防御的关键。为此，我们提出ARMOR，引入了一个结构化的三步推理流程：（1）从外部可更新的策略库中分析越狱策略，（2）提取核心意图，（3）应用基于策略的安全性验证。我们进一步开发了ARMOR-Think，将安全性推理与通用推理解耦，以同时提升鲁棒性和实用性。在基于优化的高级越狱攻击和安全性基准测试上的评估表明，ARMOR实现了最先进的安全性能，其平均有害率为0.002，在面对高级优化型越狱攻击时的攻击成功率为0.06，远低于其他基于推理的模型。此外，ARMOR对未见过的越狱策略展现出强大的泛化能力，将其成功率降至零。这些结果凸显了ARMOR在防御OOD越狱攻击方面的有效性，为构建安全可靠的大语言模型提供了一条实用路径。

相关内容

MoDELS

关注 45

ACM/IEEE第23届模型驱动工程语言和系统国际会议，是模型驱动软件和系统工程的首要会议系列，由ACM-SIGSOFT和IEEE-TCSE支持组织。自1998年以来，模型涵盖了建模的各个方面，从语言和方法到工具和应用程序。模特的参加者来自不同的背景，包括研究人员、学者、工程师和工业专业人士。MODELS 2019是一个论坛，参与者可以围绕建模和模型驱动的软件和系统交流前沿研究成果和创新实践经验。今年的版本将为建模社区提供进一步推进建模基础的机会，并在网络物理系统、嵌入式系统、社会技术系统、云计算、大数据、机器学习、安全、开源等新兴领域提出建模的创新应用以及可持续性。官网链接：http://www.modelsconference.org/

O’Reilly报告：知识图谱崛起——面向现代数据集成和数据结构体系，“The Rise of the Knowledge Graph——Toward Modern Data Integration and the Data Fabric Architecture”

专知会员服务

49+阅读 · 2022年2月18日

Linux导论，Introduction to Linux，96页ppt

专知会员服务

82+阅读 · 2020年7月26日

FlowQA: Grasping Flow in History for Conversational Machine Comprehension

专知会员服务

34+阅读 · 2019年10月18日

Auto-Sizing the Transformer Network: Improving Speed, Efficiency, and Performance for Low-Resource Machine Translation

专知会员服务

50+阅读 · 2019年10月17日