本文源自美国人工智能安全研究所。本文件为提高两用基础模型(以下简称 “基础模型”)的安全性、保障性和可信性提供了自愿性指南,与《国家人工智能倡议法》、第 14110 号行政命令和 2024 年 10 月 24 日关于人工智能的总统国家安全备忘录保持一致。具体来说,它侧重于管理此类模型被故意滥用以对公共安全或国家安全造成危害的风险。基础模型被滥用的方式仍在不断演变,但可能出现的情况包括:利用模型促进化学、生物、放射性或核武器的开发;发动攻击性网络攻击;生成有害或危险的内容,如未经同意的真实个人亲密图像(NCII)。

基础模型的快速发展为了解其能力和误用风险带来了巨大挑战,本文件为识别、衡量和减轻整个人工智能生命周期中的这些风险提供了依据。误用风险并不只是模型本身的功能--它们部分源于恶意行为者的动机、资源和限制,以及模型集成到应用程序和社会危害防御措施中的方式。因此,本文提供的指南既涉及这些风险的技术方面,也涉及更广泛的社会方面。

本文件确定了预测、测量和减轻基础模型误用风险的程序和框架,并就组织如何提供风险管理实践的透明度提出了建议。本文件尤其关注基础模型的初始开发者,但整个人工智能供应链中的其他参与者也在管理误用风险方面发挥作用,第 3 节对此进行了更详细的介绍。

成为VIP会员查看完整内容
12

相关内容

军事防务数据板块介绍:系统化采集、存储、管理、分析与军事国防安全相关信息的专用数据板块,其核心在于整合全球新兴国防技术(军事人工智能、无人系统等)、热点案例(俄乌战争、美以伊战争)等方面的最新时讯、研究报告/论文、条令法规、案例分析,为战略研判、情报分析、决策支持等提供知识支撑。
《人工智能灾难性风险概述》2023最新55页报告
专知会员服务
70+阅读 · 2023年10月6日
美国人工智能国家安全委员会发布最终报告, 130页pdf
专知会员服务
148+阅读 · 2021年3月2日
【2022新书】深度学习归一化技术,117页pdf
专知
29+阅读 · 2022年11月25日
【干货书】优化算法,232页pdf
专知
26+阅读 · 2022年9月8日
智能合约的形式化验证方法研究综述
专知
16+阅读 · 2021年5月8日
事件知识图谱构建研究进展与趋势
THU数据派
99+阅读 · 2019年12月11日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2014年12月31日
国家自然科学基金
2+阅读 · 2014年12月31日
国家自然科学基金
2+阅读 · 2014年12月31日
Arxiv
176+阅读 · 2023年4月20日
A Survey of Large Language Models
Arxiv
501+阅读 · 2023年3月31日
Arxiv
83+阅读 · 2023年3月26日
Arxiv
182+阅读 · 2023年3月24日
Arxiv
27+阅读 · 2023年3月17日
VIP会员
最新内容
《基于强化学习的自动化红队测试》
专知会员服务
3+阅读 · 7月23日
伊朗不对称防空战略的演进
专知会员服务
4+阅读 · 7月23日
对抗环境下超视距目标打击的情报支援
专知会员服务
10+阅读 · 7月22日
《无人机对海面作战影响评估》
专知会员服务
15+阅读 · 7月21日
印度精确打击与指挥架构的断层
专知会员服务
7+阅读 · 7月20日
相关基金
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2014年12月31日
国家自然科学基金
2+阅读 · 2014年12月31日
国家自然科学基金
2+阅读 · 2014年12月31日
微信扫码咨询专知VIP会员