环境设计在塑造协作式多智能体强化学习(MARL)算法的开发与评估中发挥着关键作用。尽管现有基准突显了关键挑战,但它们往往缺乏设计自定义评估场景所需的模块化。我们提出了基于JAX的全加速战斗模拟器(TABX),这是一个面向可重构多智能体任务的高吞吐量沙盒。TABX对环境参数提供精细控制,允许系统性地研究涌现的智能体行为以及跨越多样化任务复杂度的算法权衡。利用JAX在图形处理器上的硬件加速执行,TABX实现了大规模并行化并显著降低了计算开销。通过提供一个快速、可扩展且易于定制的框架,TABX促进了复杂结构化领域中MARL智能体的研究,并为未来研究奠定了可扩展的基础。我们的代码可通过以下网址获取:[此https网址]。
所有这些组件均可通过配置接口访问,使用户能够在不修改底层模拟代码的情况下轻松修改和共享自定义配置。为进一步支持场景设计,我们提供了一个图形用户界面,通过直观的可视化工作流来设计手工制作的场景。利用这种高度的可配置性,我们证明了各种环境参数的受控变化——得益于TABX基于JAX的端到端向量化实现,这种变化在大规模条件下成为可能——使得系统性地研究基本MARL挑战成为现实。综上所述,本文做出以下贡献:
• 提出了TABX,一个基于JAX的高吞吐量多智能体战斗模拟器,具备硬件加速执行和大规模并行环境采样能力,并提供一套代表性基线实现,以促进标准化基准测试和可复现研究。
• 提出了一个可定制框架,支持无需修改代码即可动态配置单元、地形、启发式策略和物理动力学,同时配备图形化场景编辑器及一组预定义场景,从而实现灵活多样的MARL实验。
• 证明TABX能够系统性地分析核心MARL挑战,包括信息依赖的值学习、长时域任务中的稀疏奖励探索以及零样本泛化。