综述 | The Past and Future of AI Scientists:AI科学家的过去与未来

论文题目: The Past and Future of AI Scientists 作者: Ross D. King 机构: University of Cambridge;Chalmers University of Technology 论文链接: https://arxiv.org/pdf/2608.14407 发布时间: 2026 年 8 月 14 日 关键词: AI Scientist、自动科学、机器发现、自驱实验室、科学智能体、诺贝尔图灵挑战

导读

这篇长综述的核心判断很鲜明:AI Scientist 不是更大的预测模型,也不是会写论文的聊天机器人,而是能够在科学循环中形成假设、推出可检验后果、设计并执行实验、解释结果、修正信念的综合性科学主体。作者 Ross D. King 曾参与 Adam 和 Eve 等自动科学系统,因而本文既是历史回顾,也是一份路线图。 论文把 AI Scientist 的发展放在“发现科学”传统中理解。从 DENDRAL、BACON,到 Adam、Eve,再到 AlphaFold、LLM agent、自驱实验室和多智能体科研系统,作者认为单个组件的自动化已经不再是主要瓶颈。真正难题是集成:未来 AI Scientist 必须同时连接文献、形式化知识、数学模型、概率信念、因果推理、仿真、实验设计、机器人实验、数据分析、可追溯记录和安全治理。 本文最值得关注的是它对“自主科学”的边界划分。作者强调,科学自主性不能按营销叙事来定义,而要根据系统实际做了哪些科学决策来度量。诺贝尔图灵挑战提出到 2050 年构建能够自动完成诺贝尔级发现的 AI 系统;作者认为进展已经快于预期,但越接近这一目标,评测、来源记录、责任、安全和治理就越不能缺位。

Introduction:引言

论文从科学方法的生产力问题出发。现代科学极大改变了人类生活,但气候变化、粮食安全、抗微生物耐药、癌症和未来大流行等挑战要求科学变得更快、更便宜、更系统、更可复现。作者认为,唯一可行的增量来源是人工智能。 AI Scientist 的定义比普通科研辅助工具更强:它需要整合科学知识、假设生成、实验设计、实验执行、结果解释以及假设或理论的迭代修正,并具有明确的自主程度。预测模型即使有科学价值,也不自动成为 AI Scientist;会写论文的 LLM 也不一定是 AI Scientist;实验自动化只有在实验选择和解释被纳入闭环时,才接近自驱实验室。 本文的中心论点是:构建 AI Scientist 的关键组件正在汇合。基础模型、形式化科学知识、自动推理、概率信念、仿真、实验设计、智能体软件、实验室机器人、机器可读协议、数据分析和 provenance 系统共同构成自动化科学方法的基础。

The History of Discovery Science:发现科学的历史

机器发现并不是大模型时代才出现的概念。DENDRAL 和 Meta-DENDRAL 在 20 世纪 60 到 70 年代已经展示了专家系统如何利用结构化领域知识解决化学质谱解释问题。BACON 则探索从数据中重新发现经验规律和方程。 Adam 是论文中最重要的历史节点之一。它被视为第一个通过假设形成和物理实验循环做出新科学发现的机器系统。Eve 则更强调闭环实验优化和药物发现,被作者看作现代自驱实验室架构的直接来源。 作者特别区分 Adam 和 Eve 的思想传统:Adam 代表假设驱动的机器科学家,Eve 代表数据驱动的闭环实验系统。今天的 AI Scientist 需要把这两条线合并起来,既能进行科学推理,也能高效选择和执行实验。

The Current State of AI for Science:当前状态

AI 已经深度嵌入现代科学。它可以预测结构、提出分子、写代码、读论文、选择实验,也能驱动机器人实验平台。但作者提醒,大多数系统仍然只自动化科学流程中的一个局部任务。 论文把当前系统大致分为四类:预测型科学 AI、基于 LLM 的科学智能体、自驱实验室、集成式 AI Scientist。AlphaFold 是强大的预测型科学 AI,但主要做静态推断,不负责提出科学问题或执行实验。LLM 科研智能体可以组织工作流和生成论文,但通常缺少物理实验闭环。自驱实验室可以执行实验和优化目标,但问题、材料和目标函数往往仍由人预先定义。 因此,作者主张保留“AI Scientist”这个术语,只用于那些实质性整合科学循环的系统。能预测、能写作、能检索、能执行实验都还不够,关键是能否把这些能力连接成可修正信念的闭环。

Architecture and Roadmap for AI Scientists:架构与路线图

论文提出的 AI Scientist 架构不是单体模型,而是由多个模块交互组成的科学系统。核心包括科学记忆、文献接口、假设生成器、形式化推理器、仿真引擎、实验设计模块、安全与权限治理器、协议编译器、物理或云实验室、数据质量与分析模块,以及人类科学家介入界面。 这张架构图的重点在于:科学循环中的每条箭头都是潜在故障点。假设可能语言上合理但科学上不连贯;仿真可能实现了错误模型;实验协议可能遗漏关键约束;机器人可能执行失败;统计分析可能数学上正确但回答了错误问题。完整 AI Scientist 必须显式表示和检查这些区别。 论文还提出一个科学自主等级框架,从 0 到 5 描述人类干预程度。0 级是无科学自主,系统只是普通计算工具;1 级是任务自主;2 级是工作流自主;3 级是闭环自主;4 级是研究计划自主;5 级是开放式科学自主。作者强调,自主性应与能力、可靠性、风险分开报告。高自主不必然代表高质量,在高风险场景中,低自主但可靠受控的系统可能更好。

Representations for Scientific Knowledge and Models:科学知识与模型表示

作者认为,科学家只能发现其语言能够表达的东西。AI Scientist 的知识表示不能只靠自然语言,也不能只靠向量嵌入。科学知识需要多种表示协同:符号逻辑适合约束和推理,概率模型适合不确定性,数学方程适合定量机制,因果图适合干预解释,仿真和数字孪生适合复杂系统,知识图谱和本体适合组织概念关系。 论文强调神经符号结合。神经模型擅长感知、语言理解、表示学习和生成式搜索;符号系统擅长显式语义、约束、证明和可追溯推理;概率理论则承担信念更新和不确定性校准。完整 AI Scientist 必须根据具体科学任务选择和组合表示,而不是押注单一范式。 数字孪生在这里被视为重要工具,但作者也提醒,数字孪生不是完美复制品,而是依赖目的和假设的模型。一个模型足以支持某类预测,并不意味着足以支持另一类实验决策。

Reading and Formalising the Scientific Literature:阅读与形式化文献

科学文献规模已经超过任何个人能完整阅读的范围。AI Scientist 必须能检索、抽取、综合、验证文献中的主张,并把自然语言陈述转化为可计算、可追溯的科学记录。 作者区分“检索论文”和“综合内容”。可靠的文献综合需要识别主要主张、判断证据强弱、发现论文之间的支持或矛盾关系,并说明引用是否真正支持相关论断。仅仅找到标题相近的论文,或在文本中堆砌引用,都不构成科学理解。 论文还强调时间性。科学主张在发表时可能是合理的,但后来可能被新证据修正。AI Scientist 应能追踪证据随时间变化的状态,而不是把文献当成静态语料库。

Hypothesis Generation and Scientific Creativity:假设生成与科学创造力

科学从问题和异常开始。AI Scientist 需要提出解释性假设,而不是只生成听起来合理的句子。论文讨论了溯因推理、类比、机制假设、反事实思考和搜索空间构造等路径。 作者认为,最佳解释不一定是语言上最流畅的解释。候选假设必须能导出可检验后果,并能与替代假设竞争。AI Scientist 应维护多个假设及其不确定性,而不是过早收敛到一个自信答案。 创造力也不能脱离约束。一个科学假设需要与已有知识兼容,或明确说明它挑战了哪些假设;需要产生新预测;需要能被实验、观察、仿真或数学证明检验。对 AI Scientist 来说,生成能力只是开始,选择、约束和证伪更关键。

Deduction, Simulation and Prediction:演绎、仿真与预测

假设只有能推出可检验后果,才成为科学假设。演绎推理负责从前提推出结论,数学模型负责表达定量关系,仿真负责探索复杂系统,预测则连接假设与可观测结果。 论文认为,形式化验证在数学、程序和科学协议中尤其重要。证明助手和类型系统能够减少推理错误;符号回归可以从数据中发现方程;仿真模型能在实验成本高或不可直接观测时提供中间证据。 但预测不是科学的终点。一个模型如果只给出高准确率,却不能说明何时适用、何时失效、哪些变量可干预,就很难支撑自主科学决策。AI Scientist 必须把预测放进假设、机制、实验和信念修正的闭环里。

Observation, Measurement and Experimentation:观察、测量与实验

自然是科学假设的最终裁判。AI Scientist 必须区分观察、测量和实验:观察记录自然状态,测量把现象转化为数据,实验则通过干预生成证据。 作者强调实验设计不仅是选择下一个样本点。真正的科学实验需要考虑可执行性、成本、伦理、安全、仪器约束、失败恢复、质量控制和负结果价值。实验协议还必须机器可读、可执行、可审计,能被机器人或云实验室准确实施。 自驱实验室展示了闭环实验优化的潜力,但如果目标函数、候选空间和实验动作完全由人定义,它仍然只是有限自主。AI Scientist 的更高阶段要求系统能判断现有仪器是否足够、是否需要新实验类型,以及实验失败究竟来自理论错误还是执行错误。

Data Analysis, Interpretation and Belief Revision:数据分析、解释与信念修正

实验只产生数据,不直接产生结论。AI Scientist 需要评估数据质量、选择统计模型、处理不确定性、比较竞争假设,并根据证据更新信念。 论文强调,统计显著性不能替代科学解释。系统应追踪样本来源、测量误差、批次效应、缺失机制、先验假设和分析选择。每个结论都应附带可机器读取的证据记录,说明用到了哪些数据、模型、推理、实验和解释步骤。 信念修正是 AI Scientist 与普通自动化流程的分界线之一。系统不能在新结果出现时简单覆盖旧答案,而要记录分歧、负结果和不确定性变化。科学记忆应是动态信念状态,而不是被动档案。

Evaluation and Benchmarking of AI Scientists:评测与基准

作者反复强调:流畅科学写作不是发现,重新生成训练数据中的答案也不是发现。AI Scientist 的评测必须覆盖正确性、新颖性、自主性、泛化性、效率、可复现性、解释性、安全性和科学重要性。 自主性尤其需要用 provenance 记录判断。系统是否选择了问题、提出了关键假设、设计了实验、处理了失败、选择了分析方法、解释了结果,都应被记录。一个系统如果只是在专家预设流程中执行步骤,就不能获得高自主性评价。 诺贝尔图灵挑战的评估标准也不能简化为一次惊艳展示。合格系统需要做出真正新颖且重要的发现,机器贡献必须清楚,证据需要独立实验、观察或证明支持,结果要能经受独立复现或验证,并能说明限制。

Human-AI Scientific Collaboration:人机科学协作

人类和机器具有不同优势。机器能并行检索、维护大规模信念状态、执行重复实验、探索巨大组合空间;人类擅长价值判断、问题选择、概念重构、跨领域意义判断和责任承担。 作者反对把人机协作简化为“人类监督最后一步”。有效协作应把权限交给已经证明可靠的组件,把人类介入放在关键科学决策、风险边界和异常处理处。一个糟糕的人机组合可能同时放大人类偏见和机器错误。 论文还讨论了贡献与署名。机器贡献不应被隐藏,但机器也不能承担法律或伦理责任。未来科学出版和评价体系需要区分作者身份、贡献记录、责任主体和系统 provenance。

Ethical, Social and Governance Aspects:伦理、社会与治理

AI Scientist 会改变谁能提出科学问题、谁能运行实验、谁能获得发现收益。它可能降低科研成本、提高可复现性,也可能集中科学权力、自动化错误,甚至把推理直接连接到危险物理行动。 治理重点包括安全权限、实验范围、数据来源、双重用途、责任归属、审计日志、事故记录和人类可干预机制。作者强调,高风险实验中的 AI Scientist 不能依赖事后审查,而必须在架构中内置约束。 科学治理还需要关注公平性。若少数机构掌握大规模自动科研基础设施,科学议程可能更加集中。开放协议、可复现实验记录、互操作实验平台和公共评测基准将成为重要制衡机制。

The Future and the Nobel Turing Challenge:未来与诺贝尔图灵挑战

诺贝尔图灵挑战提出,到 2050 年开发出能够自动完成诺贝尔质量发现的 AI 系统。作者认为,进展已经快于原先预期。Adam、Eve、AlphaFold、自驱实验室、LLM agents 和科学工作流系统已经分别证明关键组件可行。 但真正的挑战不是某个组件达到人类专家水平,而是构建能够跨问题持续运行的科学系统。这样的系统要能选择重要问题、形成新概念、发明实验方法、协调大量 AI 科学家与实验平台,并在严格证据标准下产出可复现发现。 作者对未来保持乐观,但这种乐观不是无条件的。AI Scientist 可能让科学更快、更便宜、更系统,也可能让错误和风险规模化。成功的标志不是机器写出像论文的文本,而是机器参与产生经得起独立检验的新知识。

Conclusions:结论

论文最后回到一个总判断:人类科学组织方式深受人类认知和物理限制影响,而 AI Scientist 将改变这些限制。未来科学可能不再围绕单个实验室、单篇论文和单个研究者组织,而是围绕可执行知识、持续更新的科学记忆、自动实验网络和可审计机器贡献组织。 AI Scientist 的核心不是更聪明的聊天界面,而是完整科学循环的自动化:读文献、表示知识、生成假设、演绎预测、设计实验、执行测量、解释数据、修正信念,并接受评测、治理和责任约束。 这篇综述的价值在于,它给出了 AI Scientist 的历史谱系、能力边界和路线图。对于今天的科研智能体建设,最关键的启示是:不要把“生成科学文本”误认为“自动科学”,也不要把“局部自动化”误认为“科学自主”。真正的 AI Scientist 必须用证据、实验、可复现性和治理来证明自己。

成为VIP会员查看完整内容
0

相关内容

论文 | OmniScientist:全模态全学科AI科学家
专知会员服务
8+阅读 · 8月16日
AutoResearch AI综述:迈向AI驱动的科学发现自动化
专知会员服务
18+阅读 · 5月26日
迈向医学人工智能科学家
专知会员服务
21+阅读 · 4月1日
从Idea构想到论文发表:AI for Research全链路综述与实践
专知会员服务
25+阅读 · 2025年7月21日
98页 | 量子位智库《2024年度AI十大趋势报告》附下载
专知会员服务
46+阅读 · 2024年12月14日
【AI4Science】Nature刊文综述人工智能时代的科学发现
专知会员服务
76+阅读 · 2023年8月8日
前沿综述:集体智能与深度学习的交叉进展
专知会员服务
76+阅读 · 2022年2月6日
人工智能的现状与未来(附PPT)
人工智能学家
76+阅读 · 2019年3月27日
A Technical Overview of AI & ML in 2018 & Trends for 2019
待字闺中
18+阅读 · 2018年12月24日
AI综述专栏 | 基于深度学习的目标检测算法综述
人工智能前沿讲习班
12+阅读 · 2018年12月7日
AI综述专栏 | 深度神经网络加速与压缩
人工智能前沿讲习班
32+阅读 · 2018年10月31日
AI综述专栏|多模态学习研究进展综述
人工智能前沿讲习班
64+阅读 · 2018年7月13日
AI综述专栏 | 步态识别的深度学习综述
人工智能前沿讲习班
29+阅读 · 2018年6月27日
AI综述专栏|跨领域推荐系统文献综述(下)
人工智能前沿讲习班
14+阅读 · 2018年5月18日
AI综述专栏 | 跨领域推荐系统文献综述(上)
人工智能前沿讲习班
13+阅读 · 2018年5月16日
国家自然科学基金
7+阅读 · 2017年12月31日
国家自然科学基金
4+阅读 · 2017年12月31日
国家自然科学基金
15+阅读 · 2016年12月31日
国家自然科学基金
21+阅读 · 2015年12月31日
国家自然科学基金
12+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
12+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
Arxiv
0+阅读 · 6月21日
Arxiv
11+阅读 · 2022年10月8日
Arxiv
26+阅读 · 2018年9月21日
VIP会员
相关主题
最新内容
综述 | 触觉与力觉感知机器人学习
专知会员服务
0+阅读 · 今天15:36
综述 | AI科学家的过去与未来
专知会员服务
0+阅读 · 今天15:35
论文 | OmniScientist:全模态全学科AI科学家
专知会员服务
8+阅读 · 8月16日
无人机已改变战场,但并未解决指挥问题
专知会员服务
11+阅读 · 8月14日
相关资讯
人工智能的现状与未来(附PPT)
人工智能学家
76+阅读 · 2019年3月27日
A Technical Overview of AI & ML in 2018 & Trends for 2019
待字闺中
18+阅读 · 2018年12月24日
AI综述专栏 | 基于深度学习的目标检测算法综述
人工智能前沿讲习班
12+阅读 · 2018年12月7日
AI综述专栏 | 深度神经网络加速与压缩
人工智能前沿讲习班
32+阅读 · 2018年10月31日
AI综述专栏|多模态学习研究进展综述
人工智能前沿讲习班
64+阅读 · 2018年7月13日
AI综述专栏 | 步态识别的深度学习综述
人工智能前沿讲习班
29+阅读 · 2018年6月27日
AI综述专栏|跨领域推荐系统文献综述(下)
人工智能前沿讲习班
14+阅读 · 2018年5月18日
AI综述专栏 | 跨领域推荐系统文献综述(上)
人工智能前沿讲习班
13+阅读 · 2018年5月16日
相关基金
国家自然科学基金
7+阅读 · 2017年12月31日
国家自然科学基金
4+阅读 · 2017年12月31日
国家自然科学基金
15+阅读 · 2016年12月31日
国家自然科学基金
21+阅读 · 2015年12月31日
国家自然科学基金
12+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
12+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
微信扫码咨询专知VIP会员