美国陆军战争学院的综合口试作为该学院的终极考核,用于衡量其高级军官的战略思维。2026年初,三个教员评审组依据该标准对四个领先的商业人工智能(AI)系统进行了测试:ChatGPT、Gemini、Claude和Grok。在未提供核心课程材料的情况下进行提示,所有四个模型均通过了考核。与静态基准不同,该考核的即兴对话形式揭示了在通用评估中不可见的显著性能差异,其中一个模型表现出统计学上的显著优势。这些发现对美国战争部评估商业人工智能战略应用的方式提出了挑战,并表明以领域特定、基于对话的基准测试作为更严格的标准。

成为VIP会员查看完整内容
0

相关内容

军事防务数据板块介绍:系统化采集、存储、管理、分析与军事国防安全相关信息的专用数据板块,其核心在于整合全球新兴国防技术(军事人工智能、无人系统等)、热点案例(俄乌战争、美以伊战争)等方面的最新时讯、研究报告/论文、条令法规、案例分析,为战略研判、情报分析、决策支持等提供知识支撑。
VIP会员
最新内容
《人工智能能通过美国陆军战争学院吗?》报告
专知会员服务
0+阅读 · 46分钟前
军事域人工智能驱动系统的治理
专知会员服务
0+阅读 · 57分钟前
失去控制的指挥:人工智能时代的任务式指挥
专知会员服务
15+阅读 · 9月11日
美国的新国家安全科技战略思考
专知会员服务
6+阅读 · 9月11日
微信扫码咨询专知VIP会员