研究动机

大语言模型在面对自适应越狱攻击时依然脆弱,尤其在多轮交互场景中,攻击者可根据模型先前的拒绝响应或部分顺从行为迭代优化提示词。现有红队测试基准多评估针对固定受害模型的单轮攻击,忽视了真实安全失效事件的协同适应本质:攻击者精进策略,而防御方则更新模型以修补已暴露的漏洞。本研究构建了一个类TrailBlazer的强化学习红队测试环境以探究此场景:采用近端策略优化算法的攻击者学习如何基于对话历史施加提示词变异,同时受害模型可通过低秩自适应安全更新实现迭代增强。该框架不仅支持评估习得的多轮攻击是否优于随机变异策略,更能检验其在受害模型持续进化时的有效性。

研究方法

本方法将每次攻击表征为一个包含隐藏{REQUEST}占位符的可变越狱模板。每轮交互中,类TrailBlazer的近端策略优化策略观测有害查询嵌入与响应历史特征,继而选定离散变异动作并分配跨历史轮次的注意力权重。大语言模型变异器依据选定动作编辑当前模板,随后插入隐藏的有害请求并发送至受害模型。WildGuard评判模块对受害模型的响应进行裁决并提供奖励信号。我们通过可选的基于低秩自适应的协同进化机制扩展此循环:成功攻击样本用于微调受害模型以生成安全目标响应,而成功的模板编辑则可用来微调攻击者变异器。由此形成一个受控框架,用于对比固定受害模型的近端策略优化、动态进化受害模型的近端策略优化以及完整的攻击者-受害模型协同进化。

实现方案

本框架基于Python实现,其中近端策略优化策略采用PyTorch构建,批量模型推理依托vLLM加速,奖励标注由WildGuard完成,轻量级受害模型与攻击者更新则通过PEFT/LoRA实现。实验运行于Modal云平台GPU环境,利用持久化存储卷保存检查点、轨迹库、回合日志及适配器产物。为增强系统可解释性,每轮交互均记录选定动作、变异后模板、渲染的攻击提示词、受害模型响应、裁判标签、奖励值、策略概率分布及历史注意力权重。此外,系统集成并行采样收集、检查点扫描、预算受限重试评估及可恢复的协同进化周期,确保长周期实验在中断后能无缝续跑,避免已完成近端策略优化或低秩自适应阶段的进度丢失。

实验结果

近端策略优化仅在回合数足够长以支持迭代优化时,才显著优于随机变异。在五轮交互设定下,近端策略优化成功率可达0.600,而随机变异仅为0.433;若移除基于注意力的历史加权机制,成功率骤降至0.467,与随机基线持平。协同进化实验显示,固定攻击方的受害模型进化能在后期周期将近端策略优化成功率压制至0.000;反之,固定受害模型的攻击者进化则在全部四个周期内维持非零成功率,并于最强检查点达到0.688的成功率峰值。

讨论

上述结果表明,习得策略的核心优势并非发现更优的单次越狱手段,而在于利用历史交互持续优化模板变异。协同进化结果揭示了不对称性:受害模型的自适应能比近端策略优化更快封堵当前攻击分布,而攻击者低秩自适应进化则能拓展模板分布,并在受害模型固定时提升攻击恢复能力。定性分析还发现,WildGuard判定的为正的输出有时仅反映提示词复读或部分顺从,故裁判标注的“成功”应解读为诱发了不安全输出,而非确证有害任务被完整执行。

结论

本研究提出了一种融合多轮交互、历史感知近端策略优化、分层模板变异及基于低秩自适应的攻防自适应的自动化红队测试框架。核心启示在于:将自动化越狱搜索视为动态适应过程,而非静态提示词选择问题,可显著提升攻击效能。然而,鲁棒的协同进化仍具挑战性:更强的受害模型会迅速改变攻击态势,而稀疏的二元奖励对攻击策略的恢复指导有限。未来工作应结合更长周期的协同进化规划、更密集的语义奖励机制及更强的变异器模型,以更真实地刻画对抗性适应过程。

成为VIP会员查看完整内容
1

相关内容

军事防务数据板块介绍:系统化采集、存储、管理、分析与军事国防安全相关信息的专用数据板块,其核心在于整合全球新兴国防技术(军事人工智能、无人系统等)、热点案例(俄乌战争、美以伊战争)等方面的最新时讯、研究报告/论文、条令法规、案例分析,为战略研判、情报分析、决策支持等提供知识支撑。
《用于建模系统攻击路径的强化学习环境》
专知会员服务
23+阅读 · 3月5日
《大语言模型驱动的智能红队测试》
专知会员服务
18+阅读 · 2025年11月26日
《人工智能红队测试的再审视》
专知会员服务
16+阅读 · 2025年9月2日
【新书】AI红队演练:智能系统的攻击与防御
专知会员服务
29+阅读 · 2025年7月6日
《基于图神经网络与强化学习的自主空战决策研究》
专知会员服务
33+阅读 · 2025年5月15日
《红队分析工具中的混淆、隐蔽和非归属问题》最新79页
专知会员服务
18+阅读 · 2024年11月17日
《人工智能红队中的人为因素:社会与协作计算的视角》
基于模型的强化学习综述
专知
42+阅读 · 2022年7月13日
编辑推荐 | 红外弱小目标检测算法综述
中国图象图形学报
21+阅读 · 2020年10月12日
强化学习精品书籍
平均机器
26+阅读 · 2019年1月2日
基于机器学习的KPI自动化异常检测系统
运维帮
13+阅读 · 2017年8月16日
国家自然科学基金
6+阅读 · 2017年12月31日
国家自然科学基金
43+阅读 · 2015年12月31日
国家自然科学基金
40+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
12+阅读 · 2013年12月31日
国家自然科学基金
23+阅读 · 2009年12月31日
国家自然科学基金
50+阅读 · 2009年12月31日
VIP会员
最新内容
《基于强化学习的自动化红队测试》
专知会员服务
1+阅读 · 今天13:21
伊朗不对称防空战略的演进
专知会员服务
2+阅读 · 今天11:10
对抗环境下超视距目标打击的情报支援
专知会员服务
10+阅读 · 7月22日
《无人机对海面作战影响评估》
专知会员服务
15+阅读 · 7月21日
印度精确打击与指挥架构的断层
专知会员服务
7+阅读 · 7月20日
相关VIP内容
相关基金
国家自然科学基金
6+阅读 · 2017年12月31日
国家自然科学基金
43+阅读 · 2015年12月31日
国家自然科学基金
40+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
12+阅读 · 2013年12月31日
国家自然科学基金
23+阅读 · 2009年12月31日
国家自然科学基金
50+阅读 · 2009年12月31日
微信扫码咨询专知VIP会员