AI models are already deployed in societies affected by armed conflict, and journalists, humanitarian workers, governments and ordinary citizens rely on them for information or for their work processes. No established practice exists for checking whether their outputs can make those conflicts worse. We tested nine model configurations from four providers (OpenAI, Anthropic, DeepSeek, xAI) on 90 multi-turn scenarios designed to surface misaligned behaviour in conflict contexts: false equivalence between documented atrocities, denial of genocide, and failure to recognise ethnic slurs, among others. When such outputs feed into journalism, humanitarian reporting, or public debate, they can deepen divisions in fragile societies. Failure rates span 6\% to 47\% between the best and worst performing models, which makes model choice a safety question in its own right and when users pushed for ``balance'' in cases where international courts have already assigned responsibility, five of nine configurations failed 80 to 100 percent of the time. We release the first evaluation framework for this domain and propose adding it to alignment evaluation portfolios.


翻译:人工智能模型已部署在受武装冲突影响的社会中,记者、人道主义工作者、政府及普通民众依赖这些模型获取信息或辅助工作流程。目前尚缺乏既有实践来检验模型输出是否可能加剧冲突。我们针对四家供应商(OpenAI、Anthropic、DeepSeek、xAI)的九种模型配置,在90个旨在暴露冲突场景中不当行为的多轮场景中进行了测试:包括对已记录暴行进行虚假等同、否认种族灭绝、未能识别种族歧视用语等。当此类输出被用于新闻报道、人道主义报告或公共辩论时,可能加深脆弱社会的裂痕。最佳与最差模型间的故障率跨度达6%至47%,这使得模型选择本身成为安全问题;当用户在国际法庭已确认责任归属的案件中强行要求“均衡报道”时,九种配置中有五种在80%至100%的案例中出现故障。我们发布了该领域的首个评估框架,并建议将其纳入对齐评估体系。

0
下载
关闭预览

相关内容

ACM/IEEE第23届模型驱动工程语言和系统国际会议,是模型驱动软件和系统工程的首要会议系列,由ACM-SIGSOFT和IEEE-TCSE支持组织。自1998年以来,模型涵盖了建模的各个方面,从语言和方法到工具和应用程序。模特的参加者来自不同的背景,包括研究人员、学者、工程师和工业专业人士。MODELS 2019是一个论坛,参与者可以围绕建模和模型驱动的软件和系统交流前沿研究成果和创新实践经验。今年的版本将为建模社区提供进一步推进建模基础的机会,并在网络物理系统、嵌入式系统、社会技术系统、云计算、大数据、机器学习、安全、开源等新兴领域提出建模的创新应用以及可持续性。 官网链接:http://www.modelsconference.org/
万字长文 | 人工智能引发大规模战争的六种可能路径
专知会员服务
36+阅读 · 2025年9月6日
中文版 | 重新定义数字时代冲突:人工智能的角色
专知会员服务
18+阅读 · 2025年5月3日
中文版 | 人工智能将如何影响战场行动
专知会员服务
26+阅读 · 2025年4月13日
战争、人工智能和未来冲突
专知会员服务
38+阅读 · 2024年7月13日
俄乌冲突中的人工智能
专知会员服务
100+阅读 · 2024年3月30日
俄乌战争与加以冲突:人工智能走向战场
专知会员服务
140+阅读 · 2023年11月27日
【前沿】智能化战争,会改变些什么?
中国自动化学会
22+阅读 · 2019年8月21日
国家自然科学基金
345+阅读 · 2017年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
11+阅读 · 2015年12月31日
国家自然科学基金
51+阅读 · 2014年12月31日
国家自然科学基金
6+阅读 · 2014年12月31日
国家自然科学基金
1+阅读 · 2014年12月31日
国家自然科学基金
4+阅读 · 2014年12月31日
国家自然科学基金
3+阅读 · 2014年12月31日
国家自然科学基金
18+阅读 · 2009年12月31日
VIP会员
最新内容
边缘计算的军事应用
专知会员服务
7+阅读 · 8月9日
一种考虑资源机动性的武器目标分配混合算法
专知会员服务
9+阅读 · 8月8日
《多域冲突比较支持模型》60页
专知会员服务
14+阅读 · 8月7日
相关VIP内容
万字长文 | 人工智能引发大规模战争的六种可能路径
专知会员服务
36+阅读 · 2025年9月6日
中文版 | 重新定义数字时代冲突:人工智能的角色
专知会员服务
18+阅读 · 2025年5月3日
中文版 | 人工智能将如何影响战场行动
专知会员服务
26+阅读 · 2025年4月13日
战争、人工智能和未来冲突
专知会员服务
38+阅读 · 2024年7月13日
俄乌冲突中的人工智能
专知会员服务
100+阅读 · 2024年3月30日
俄乌战争与加以冲突:人工智能走向战场
专知会员服务
140+阅读 · 2023年11月27日
相关资讯
【前沿】智能化战争,会改变些什么?
中国自动化学会
22+阅读 · 2019年8月21日
相关基金
国家自然科学基金
345+阅读 · 2017年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
11+阅读 · 2015年12月31日
国家自然科学基金
51+阅读 · 2014年12月31日
国家自然科学基金
6+阅读 · 2014年12月31日
国家自然科学基金
1+阅读 · 2014年12月31日
国家自然科学基金
4+阅读 · 2014年12月31日
国家自然科学基金
3+阅读 · 2014年12月31日
国家自然科学基金
18+阅读 · 2009年12月31日
Top
微信扫码咨询专知VIP会员