综述|进化计算如何支撑可信AI:从攻防搜索到安全自演化

导读

当人工智能从分类器走向基础模型、智能体与长期运行的系统,可信性问题也从“这个模型是否抗扰动”,扩展为“工具调用、外部知识、记忆和持续更新是否可靠”。这些对象往往离散、结构化、不可微,评估又昂贵;鲁棒性、安全性、任务效用与成本之间还存在冲突。仅靠单一梯度或单一最终分数,难以覆盖这些问题。 这篇综述以进化计算为共同视角,串联三条研究线:进化攻击寻找失败,进化防御搜索保护方案,可信自演化控制哪些变化可以长期继承。最值得关注的转变是:系统不只要选出当前有效的候选,还要决定哪些记忆、技能、工作流与防护更新可以进入下一轮。一次未经充分验证的“改进”,可能改变后续行为,甚至改变未来更新的生成与筛选。 以下严格按原文九个一级部分展开,保留主要分类和下级层次,重点说明“进化什么、怎样搜索、如何评估”。原图内部英文保留,图注采用中文。本文为综述解读,不是新方法的实验报告,也不把作者提出的未来方向视为已验证结论。 论文信息

  • 原题:Evolutionary Computation for Trustworthy AI: From Attacks and Defenses to Self-Evolving Era。
  • 作者:Junhao Dong、Chenkai Wang、Xuanhui Lin、Mingrong Gong、Siyu Wang、Yuqing Wen、Jiao Liu、Catherine Huang、Gary G. Yen、Xin Yao、Yew-Soon Ong;前三位为共同贡献作者。
  • 机构:南洋理工大学、新加坡科技研究局相关研究机构、Google、四川大学、岭南大学等。
  • 版本:arXiv于2026年10月2日提交,全文20页。本文依据该预印本解读,不据排版页眉推断期刊录用状态。
  • 论文页面:https://arxiv.org/abs/2610.02996
  • 原文下载:https://arxiv.org/pdf/2610.02996

1 Introduction|绪论

可信AI的评估对象正在扩大。预测模型主要涉及输入与输出;基础模型增加了提示、生成内容与检索知识;智能体还会操作工具、改变环境,并把经验写入记忆。攻击影响因此可能沿交互链传播,而不是止于一次错误回答。 作者归纳了四个搜索难点:黑盒条件下可见反馈有限;多个可信性指标存在权衡;不同漏洞需要行为多样的攻击与互补防御;攻击者、防御者与系统自身会持续适应。这四点分别对应进化计算的免梯度搜索、多目标优化、多样性保持种群搜索与协同进化。

图1:进化计算支撑可信AI的总体视角。黑盒、指标权衡、多样性与持续攻防挑战,对应不同进化机制,并延伸至自演化治理。来源:原论文图1,第1页。 进化计算并非只指遗传算法。候选可以是像素扰动、提示、程序、架构、策略或工作流;适应度来自系统反馈;变异与重组则按照候选表示设计。若评估成本很高,可以使用代理模型或不同保真度的评估减少开销。 多目标与多样性也不能混为一谈。多目标搜索保留不同指标之间的非支配折中,例如安全与有用性;质量—多样性搜索则保留不同“行为生态位”中的高质量候选,例如触发不同失效类型的测试。多个指标上的折中,并不自动意味着行为覆盖广泛。 在自演化场景中,进化还承担治理角色。限制候选更新、以可信性指导筛选、验证入库条件,都会影响后续系统版本。作者因此同时讨论“通过进化提高可信性”与“持续进化过程本身是否可信”。

2 Survey Scope and Positioning|综述范围与定位

2.1 综述范围

可信AI包含广泛的技术、伦理与社会问题,本文重点放在进化计算与鲁棒性、安全、安保及隐私的交叉区域。公平性会在多目标模型设计与评估中出现,但本文不是覆盖所有伦理维度的综合治理综述。 三类研究的区别在于进化承担的角色:攻击侧搜索扰动、触发器、提示、知识或策略;防御侧优化数据、结构、训练与部署保护;自演化侧改变可供未来版本使用的持久状态。前两者通常围绕候选解,自演化额外涉及更新的继承。 作者既纳入进化机制直接决定候选生成、选择与种群管理的工作,也讨论反复生成、评估、保留、复用记忆和技能的进化启发式系统。因此,不应把文中所有自演化系统都等同于标准遗传算法。

2.2 与已有综述的比较

原文比较三类已有综述:可信AI研究通常按威胁模型、攻击面与防护机制组织;进化学习综述通常按表示、变异、选择、多目标与知识迁移组织;自演化综述关注经验、记忆或工作流的长期改变。 本文把三者连接起来,突出一个共同问题:候选如何被生成和评价,以及选中的结果会不会成为未来系统的组成部分。原文表1用于比较覆盖范围,图3梳理2018—2026年的代表工作;这些是作者的文献组织,不是统一基准下的方法排名。

图2:综述完整分类框架。攻击按目标系统与攻击面组织,防御按优化组件组织,可信自演化按约束、筛选和协同进化机制组织。来源:原论文图2,第3页。

3 Preliminaries|预备知识

3.1 进化搜索过程

标准流程是初始化种群,按适应度选择父代,通过变异与重组产生后代,再决定下一代保留哪些候选,直到预算或停止条件满足。适应度可以是单值,也可以是同时描述安全、效用与成本的向量。 论文还介绍模因计算与人工免疫系统。前者将种群探索与局部改进结合,允许在可用时利用梯度或任务知识,而不放弃候选多样性;后者借鉴识别、适应性防御与免疫记忆,形成检测和响应机制。因此,“进化算法无需解析梯度”不意味着所有混合方法都禁止使用梯度。

3.2 通过进化搜索实现攻击与防御

传统对抗学习可以理解为:攻击在允许的扰动集合内最大化模型损失;防御则调整模型,降低最坏扰动下的预期损失。进化计算把搜索对象扩展为候选种群,不再局限于一个扰动或一组模型参数。 多目标种群可以保存不同效果、隐蔽性、有效性与成本的攻击,或不同鲁棒性、效用与效率的防御。质量—多样性档案则保留行为互补的候选。当攻防共同更新时,一侧的改进会改变另一侧面对的适应度环境,构成协同进化。

3.3 自演化系统的状态更新

系统状态可以包括模型组件、记忆、技能、工作流、防护机制与档案。候选更新先接受准入判断:通过才改变状态,否则维持原状态。被接受的状态会被下一轮继承,并影响下一轮候选的生成、评估与选择。 这一表达把“生成候选”和“批准长期写入”区分开。可信性可以进入三个位置:限制允许的更新空间;指导选择与准入;塑造持续攻防的反馈。验证一次输出安全,并不足以证明把相关经验写入长期记忆也安全。

4 Evaluation and Benchmarking|评估与基准

4.1 可信性评估

**4.1.1 鲁棒性

攻击成功率必须放在明确威胁模型下解释。图像通常同时报告扰动幅度与查询成本;稀疏、硬标签攻击还涉及修改元素数量与边界搜索成本。文本、语音、图结构则分别需要语义、感知或结构有效性约束。若候选已改变原任务含义,高成功率可能并不代表有效的鲁棒性测试。

**4.1.2 安全与隐私

安全评价不仅看有害回答比例,也看暴露了哪些失败类型。质量—多样性红队测试需要报告行为覆盖与档案质量。模型反演涉及重建相似度、身份相关成功率与迁移性;隐私评价还应区分成员推断、训练数据记忆等不同风险,不能用单一攻击指标替代全部隐私结论。

**4.1.3 任务性能保持

正常输入准确率、任务成功率与正常请求拒绝率应与安全指标一起报告。过度拒绝会降低系统效用;减少拒绝也可能放松安全边界。可信优化应呈现权衡,而不是只展示更高的拒绝率或更低的攻击成功率。

4.2 进化搜索评估

**4.2.1 优化性能与多样性

单目标方法可报告最佳或最终适应度;多目标方法常以超体积等指标衡量折中解集;质量—多样性方法则报告最高适应度、档案覆盖与质量—多样性分数。覆盖只有在行为类别定义合理时,才能说明发现了多少类失败。

**4.2.2 预算与收敛

“一次评估”可能是一条模型查询、一次裁判调用、一次架构训练或一次环境执行,成本并不等价。固定预算比较看同样资源下的结果,固定目标比较看达到指定水平所需的成本。论文强调独立重复运行、分布统计和置信区间,避免把一次偶然成功当作稳定优势。

4.3 基准资源

原文把资源分成可信性基准与进化搜索基准。前者包括RobustBench、NAS-RobBench-201、JailbreakBench、HarmBench、StrongREJECT、MM-SafetyBench、ETHICS、BBQ,以及Agent-SafetyBench、R-Judge、OS-Harm;后者包括COCO/BBOB、IOH、多目标测试族、QD-Suite、QDax与多任务优化资源。

图3:进化计算与可信AI的代表评估资源。上半部分定义任务与可信性指标,下半部分衡量搜索效率、折中解集和行为覆盖。来源:原论文表2,第8页。 完整比较需要同时说明目标系统、威胁模型、评价器与任务指标,以及成本单位、总预算、停止条件和独立运行次数。上述资源提供不同维度的测量工具,并不共同构成已经标准化的统一排行榜。

5 Evolutionary Attacks|进化攻击

5.1 面向预测模型的攻击

**5.1.1 对抗输入生成

One Pixel Attack、GenAttack等工作把扰动作为种群候选,利用模型反馈搜索失败。后续研究扩展到高维、稀疏与只能看到标签的黑盒条件,也覆盖文本、语音和图数据。其共同价值是处理不可微或反馈有限的搜索,同时满足语义、结构或功能约束。

**5.1.2 进化后门攻击

后门研究把搜索移到训练阶段的持久操纵。LADDER等工作优化触发模式,同时考虑效果与隐蔽性;其他工作涉及频域模式与输入相关触发器。可信性分析必须区分推理时扰动与训练时植入,因为防护位置及影响持续时间不同。

**5.1.3 进化模型反演

反演的目标不是单纯改变预测,而是利用输出反馈逼近与目标身份相关的信息。综述讨论遗传搜索与生成先验的结合,其评价包含重建质量、相似性和相关成功率。这类工作体现了进化搜索与隐私风险的联系,而不是鲁棒性指标的简单延伸。

5.2 面向生成模型的攻击

**5.2.1 进化越狱

Open Sesame、AutoDAN等将提示作为结构化候选,使用选择、分层重组和语言模型辅助变异。后续工作增加语义质量、隐蔽性与跨模型迁移目标。本文关注的是搜索机制与评价设计,而非提供可复用的越狱文本。

**5.2.2 检索增强攻击与模型窃取

检索增强生成引入了独立于参数的外部知识通道。GARAG、DIGA、NeuroGenPoisoning等研究搜索文档或段落,使检索与生成偏离预期;Stealix则搜索有信息量的查询,以提高近似目标模型行为的效率。不同方法分别操纵外部证据或抽取模型行为,不能都归为提示越狱。

5.3 面向智能体系统的攻击

**5.3.1 注入与接口攻击

智能体从网页、表格、界面与工具响应中读取内容,因而输入边界扩大。StruPhantom、Genesis、EVA等研究把候选注入与策略放到这些接口,按其对后续智能体行为的影响进行评价。风险不只是不良回答,也可能是被诱导的操作与流程偏移。

**5.3.2 轨迹与环境感知攻击

T-MAP利用工具执行轨迹评价候选并指导搜索;OpenART进一步把环境状态纳入开放式红队测试。评价对象由一个输入扩展为动作、观察与环境变化的链条。长期记忆、多智能体交互与具身执行仍是相对不足的方向。

5.4 讨论

攻击效果既取决于进化算法,也取决于表示、初始化、反馈质量、适应度与预算。现有研究常同时改变多个因素,难以隔离进化机制本身的贡献。作者建议采用更受控的黑盒搜索比较,并设计能捕捉检索、工具和长轨迹传播影响的高效评价。

6 Evolutionary Defenses|进化防御

6.1 训练数据

**6.1.1 进化对抗训练

防御侧不是把成功攻击当作终点,而是将发现的困难样本反馈给训练。EMO-GAT搜索样本选择及比例;ER-APT结合梯度生成与进化操作,为视觉语言模型的对抗提示学习构造多样样本;IGAff搜索变换后的困难图像。进化主要改变模型学习的数据分布。

图4:进化驱动的区域对抗提示学习。进化过程进一步筛选和改进困难样本,结合自然样本训练,并动态平衡干净与对抗目标。来源:原论文图5,第12页。

**6.1.2 安全与对齐数据生成

EVOREFUSE关注伪恶意指令引起的不必要拒绝;Rainbow Teaming以质量—多样性搜索生成不同失效提示,并用于后续训练;Q-DIG将类似模式扩展到视觉—语言—动作模型。这里应区分发现失败与利用失败训练,后者还需要验证是否改善未见情形。

6.2 模型设计

**6.2.1 鲁棒架构搜索

进化架构搜索把干净性能、对抗鲁棒性与模型大小直接纳入结构选择。MORAS、双保真搜索、TAM-NAS及NERO-Net等代表不同的候选空间和成本策略。模块切换则不是从零设计架构,而是在现有模型间搜索组合以抑制后门、保留效用。 模型设计还可显式优化集成多样性与准确率—公平性权衡。核心不是“某类结构天然安全”,而是把可信性纳入结构评价,并持续验证对不同攻击与数据分布的表现。

6.3 训练优化

**6.3.1 目标与训练策略搜索

TaylorGLO进化损失函数,MO-PBT搜索多目标训练配置,TRG-ASO随训练阶段调整对抗策略。EvoPref维护低秩适配器种群,探索有用性、无害性与诚实性之间的折中。搜索对象因此可以是训练规则或对齐参数,而不只是输入样本。

**6.3.2 安全与鲁棒策略搜索

SNES、SMC-ES等把进化策略与模型检查结合;SERL研究故障容忍控制;LyEvO结合约束优化、统计验证与稳定性分析。显式安全要求可以进入适应度或筛选,但验证结论始终依赖所规定的行为属性和环境假设。

6.4 部署防护

**6.4.1 进化推理时防御

RAILS通过免疫启发式过程,在当前输入附近调整类别平衡的样本种群;安全人脸识别相关工作搜索输入特定的去噪策略。这类方法把适应性放进推理循环,需要同时衡量额外时间与查询开销,不能只报告最终鲁棒性。

**6.4.2 后训练后门缓解

触发区域检测与轻量修复方法利用进化搜索定位可疑区域,再进行模型修复;模块切换优化后训练配置。效果须联合衡量后门抑制与正常表现,不应把检测候选区域等同于已证明清除了所有后门。

6.5 讨论

综述指出,进化计算通常充当外层优化器,而不是替代底层学习和安全机制。更关键的问题是搜索放在哪里、候选是什么、反馈是否能代表可信性。趋势也从部署前搜索一个鲁棒解,延伸到训练及执行中的适应性保护。

7 Trustworthy Self-Evolving AI|可信自演化人工智能

7.1 搜索空间受约束的探索

第一类机制回答“允许产生什么更新”。MermaidFlow在结构与语义约束下进化有类型工作流,排除不合法、不可执行或不兼容的后代;SEVerA结合迭代合成与形式验证,使满足明确行为属性的候选进入后续学习。 这里限制的是可行更新空间。结构正确不必然意味着完整语义安全,形式验证也只覆盖所指定属性;约束越明确,越容易判断到底保证了什么、没有保证什么。

7.2 选择引导的改进

第二类机制允许提出多个修改,但通过安全感知适应度、验证或准入规则决定保留哪些。AgentBreeder联合能力与安全选择多智能体支架;HarnessBank将提示、知识、工具和运行控制的候选修改,与长期入库决策分离。

图5:HarnessBank的智能体运行支架自演化过程。候选由失败诊断与已有档案生成,经过门控筛选后,验证有效的更新才能进入档案并被后续轮次继承。来源:原论文图6,第14页。 SHE把轨迹级失败转为局部安全更新,并检查安全与效用;即时记忆系统采用测试—验证—写入循环,避免未经验证的经验直接持久化。TAME、SkillHarness和Membrane进一步治理记忆、技能边界与安全知识的持续复用,同时关注越狱与过度拒绝。 这一类方法不仅筛选“本轮哪个候选更好”,还管理继承状态何时适用、何时需要修正。文中所述验证机制各有覆盖边界,不构成任意未来环境下的普遍安全保证。

7.3 策略性攻防协同进化

第三类机制让新攻击改变防御训练,防御改进再改变攻击的选择压力。ROMANCE维护多样攻击者并交替训练合作策略;CEMMA演化多模态攻击,再将成功案例用于更新防御者;Evo-MARL结合攻击提示种群与多智能体强化学习。 更持久的系统保存两侧状态:DARWIN维护攻击策略池和连续防护版本,EvoSafety把攻击技能与验证过的防御记忆外置。双方不必使用同一种优化算法,关键是反馈互相改变,且知识能够跨轮次积累。

7.4 讨论

自演化把鲁棒性问题从某个静态版本推进到整个更新过程。错误记忆、不可靠技能或脆弱流程一旦保留,就可能影响后来任务与修改。原文的三类机制分别治理可行空间、保留决策与适应性反馈,可互相补充,并非三个必须择一的独立方案。 因此,当前版本通过测试,并不能替代更新流程的可信评估。随着种群、档案与外部存储持续积累,选择和继承本身也成为需要审查的系统行为。

8 Open Challenges and Future Research Directions|开放挑战与未来方向

8.1 有限预算下的多组件搜索

智能体包含提示、检索、记忆、工具、流程和模型配置,联合进化会扩大搜索空间与评估成本。不同修改的代价也不同:提示和路由可能仅需少量查询,持久记忆或工具变更则需要更广的执行验证,参数更新还涉及训练计算。 作者建议优先优化成本较低、对能力或安全影响较大的组件,并进行预算感知分配。多智能体情形还需要考虑组件和代理之间耦合的风险。这是一条未来设计方向,不是已经验证的通用最优调度方案。

8.2 面向多样威胁的多解防御

单一架构、策略或防护可能难以覆盖不同攻击、数据分布与安全要求。进化搜索可以保留多个互补解,通过集成、投票或情境选择进行部署。这里需要追求真实的防御互补性,而不是保存许多行为近似的候选;运行成本与选择机制也必须评估。

8.3 自演化中的多任务泛化

智能体跨通信、检索、规划、编程和工具使用工作,但更新常只在产生它的少量任务上评价。局部改进可能无法迁移,甚至损伤已有能力。作者建议跨任务评估候选,选择既能泛化又能保留旧能力的更新,连接持续学习中的稳定性—可塑性权衡。

8.4 可信性与进化搜索的多目标基准

当前安全基准与优化基准往往分离,难以判断相同安全收益是否消耗相同资源。未来统一基准应在可比预算下,联合报告鲁棒性、安全、任务效用、搜索成本与收敛。加权总分可以辅助汇总,但不应遮蔽独立指标及其折中,也不能替代行为覆盖分析。

图6:开放挑战与研究方向路线图。多组件成本、多解防御、跨任务保持和统一评估,连接性能、安全、防护、泛化与公平比较等长期目标。来源:原论文图7,第15页。

9 Conclusion|结论

这篇综述的贡献是建立统一的组织视角,而不是提出一套在所有场景下胜出的安全算法。它围绕“进化什么、如何搜索、怎样评价”连接攻击、防御与持久自演化:攻击用种群寻找失效,防御搜索数据、结构与策略,自演化进一步治理哪些变化能够被继承。 进化计算的优势在于适应黑盒与结构化搜索,显式保留多目标折中,并维护行为多样的候选。但可信性不会因为使用了进化机制自动出现:错误的适应度、狭窄的测试范围、昂贵或有噪声的反馈,仍会产生不可靠结论。 对可信AI研究与工程实践,本文最重要的提醒是:同时评价结果与搜索过程,同时考虑当前效用与未来继承。尤其当系统持续写入记忆、技能和防护档案时,“生成—筛选—验证—保留”不再只是优化流程,也是可信系统的治理边界。 原文链接: 论文摘要与版本记录;完整综述及参考文献。本文概述的方法及结论均依据该综述;具体实现、威胁模型与实验结果请查阅原文和对应研究。

成为VIP会员查看完整内容
1
VIP会员
最新内容
2026年词元(Token)经济发展全景研究报告
专知会员服务
4+阅读 · 10月6日
刚刚!Jev中文教程项目发布了
专知会员服务
5+阅读 · 10月4日
《人工智能赋能的适应性多功能电磁战》
专知会员服务
12+阅读 · 9月29日
俄乌战场实验室:全面战争如何重塑现代作战
专知会员服务
8+阅读 · 9月29日
2026年美空军协会会议上的无人机系统趋势
专知会员服务
12+阅读 · 9月28日
微信扫码咨询专知VIP会员