研究动机
大语言模型在面对自适应越狱攻击时依然脆弱,尤其在多轮交互场景中,攻击者可根据模型先前的拒绝响应或部分顺从行为迭代优化提示词。现有红队测试基准多评估针对固定受害模型的单轮攻击,忽视了真实安全失效事件的协同适应本质:攻击者精进策略,而防御方则更新模型以修补已暴露的漏洞。本研究构建了一个类TrailBlazer的强化学习红队测试环境以探究此场景:采用近端策略优化算法的攻击者学习如何基于对话历史施加提示词变异,同时受害模型可通过低秩自适应安全更新实现迭代增强。该框架不仅支持评估习得的多轮攻击是否优于随机变异策略,更能检验其在受害模型持续进化时的有效性。
研究方法
本方法将每次攻击表征为一个包含隐藏{REQUEST}占位符的可变越狱模板。每轮交互中,类TrailBlazer的近端策略优化策略观测有害查询嵌入与响应历史特征,继而选定离散变异动作并分配跨历史轮次的注意力权重。大语言模型变异器依据选定动作编辑当前模板,随后插入隐藏的有害请求并发送至受害模型。WildGuard评判模块对受害模型的响应进行裁决并提供奖励信号。我们通过可选的基于低秩自适应的协同进化机制扩展此循环:成功攻击样本用于微调受害模型以生成安全目标响应,而成功的模板编辑则可用来微调攻击者变异器。由此形成一个受控框架,用于对比固定受害模型的近端策略优化、动态进化受害模型的近端策略优化以及完整的攻击者-受害模型协同进化。
实现方案
本框架基于Python实现,其中近端策略优化策略采用PyTorch构建,批量模型推理依托vLLM加速,奖励标注由WildGuard完成,轻量级受害模型与攻击者更新则通过PEFT/LoRA实现。实验运行于Modal云平台GPU环境,利用持久化存储卷保存检查点、轨迹库、回合日志及适配器产物。为增强系统可解释性,每轮交互均记录选定动作、变异后模板、渲染的攻击提示词、受害模型响应、裁判标签、奖励值、策略概率分布及历史注意力权重。此外,系统集成并行采样收集、检查点扫描、预算受限重试评估及可恢复的协同进化周期,确保长周期实验在中断后能无缝续跑,避免已完成近端策略优化或低秩自适应阶段的进度丢失。
实验结果
近端策略优化仅在回合数足够长以支持迭代优化时,才显著优于随机变异。在五轮交互设定下,近端策略优化成功率可达0.600,而随机变异仅为0.433;若移除基于注意力的历史加权机制,成功率骤降至0.467,与随机基线持平。协同进化实验显示,固定攻击方的受害模型进化能在后期周期将近端策略优化成功率压制至0.000;反之,固定受害模型的攻击者进化则在全部四个周期内维持非零成功率,并于最强检查点达到0.688的成功率峰值。
讨论
上述结果表明,习得策略的核心优势并非发现更优的单次越狱手段,而在于利用历史交互持续优化模板变异。协同进化结果揭示了不对称性:受害模型的自适应能比近端策略优化更快封堵当前攻击分布,而攻击者低秩自适应进化则能拓展模板分布,并在受害模型固定时提升攻击恢复能力。定性分析还发现,WildGuard判定的为正的输出有时仅反映提示词复读或部分顺从,故裁判标注的“成功”应解读为诱发了不安全输出,而非确证有害任务被完整执行。
结论
本研究提出了一种融合多轮交互、历史感知近端策略优化、分层模板变异及基于低秩自适应的攻防自适应的自动化红队测试框架。核心启示在于:将自动化越狱搜索视为动态适应过程,而非静态提示词选择问题,可显著提升攻击效能。然而,鲁棒的协同进化仍具挑战性:更强的受害模型会迅速改变攻击态势,而稀疏的二元奖励对攻击策略的恢复指导有限。未来工作应结合更长周期的协同进化规划、更密集的语义奖励机制及更强的变异器模型,以更真实地刻画对抗性适应过程。