论文 | Gemini 走进真实科研:从假设生成到实验验证的 Co-Scientist 系统

AI 科学家正在从“会提出想法”的系统,走向“能进入真实科研流程”的系统。Google DeepMind 等机构最新论文 Accelerating Scientific Research with Gemini in the Real-World 展示了基于 Gemini 的多智能体科研系统 Co-Scientist 如何从原先偏重计算机内假设生成,扩展为面向真实世界的科研伙伴:它可以生成假设、设计实验、写代码、控制或适配实验硬件、生成论文,并通过日志验证、抄袭检查与伦理监督降低科研风险。 论文验证横跨材料科学、生物学和计算机科学。材料方向,Co-Scientist 参与设计更安全的二维材料 CVD 合成路线,并在实验室约束下实现单次尝试生长 MoS2、MoSe2 和 WS2 单层半导体;生物方向,系统从稀疏图像中预测工程化大肠杆菌在不同 IPTG 浓度下的群体运动表型;计算机科学方向,系统自主发现一种医学响应生成的推理时扩展架构,在 HealthBench Hard 和 Professional 上表现强劲,并在医生盲评中降低潜在临床伤害。论文还用 30 名领域专家、450 次独立评审评估端到端 AI 论文生成,显示可靠性模块能显著降低幻觉、抄袭和不安全研究输出。

导读

这篇论文讨论的不是“让大模型回答科学问题”,而是“让大模型进入科研闭环”。传统 AI 科研系统常停留在文献检索、假设建议或代码辅助层面,距离真实科学发现还有两道门槛:一是实验必须能被物理世界或代码执行结果验证,二是系统不能为了获得更高评审分数而编造结果、复用他人方法或产生危险方案。 Co-Scientist 的新版本围绕三阶段流程构建:构思、实验和论文写作。构思阶段用进化式多智能体搜索生成、评审和改写假设;实验阶段用代码生成与执行日志推动方案迭代;论文写作阶段把假设、文献、代码和日志汇总成论文草稿,同时引入幻觉裁剪、抄袭惩罚和伦理监督。 最值得关注的是,论文没有把“完全自主”当作唯一目标,而是根据领域约束动态调整人机协作水平。材料科学中,人类仍负责样品处理、实验执行和安全把关;生物学中,专家迭代修正任务设定并执行湿实验;医学响应架构设计中,Co-Scientist 在软件环境中高度自治;自动论文生成实验则专门评估科研智能体在缺乏约束时会出现哪些可靠性问题。 这篇论文的意义在于,它把 AI 科学家的讨论从概念演示推进到真实科研场景:既展示了跨领域的加速潜力,也清楚揭示了现阶段系统仍需要人类监督、物理验证、日志追踪、伦理审查和更强的代码-论文一致性检查。

1. Introduction | 引言

AI 辅助科学发现正在从纯计算实验转向物理世界。近年来,智能体系统已经在数学猜想、湿实验生物医学假设、临床生物标志物发现和端到端 AI 论文生成中取得进展。Co-Scientist 是较早展示多智能体科学发现能力的系统之一,过去主要用 Gemini 作为协作研究伙伴,帮助人类专家形成假设和解释复杂生物数据。 论文指出,当前瓶颈并不是“能否提出科学想法”,而是“能否把想法推进到可验证实验”。纯粹在计算环境中运行的科研智能体可以进行构思、编码和写作,但如果优化目标只是自动评审分数,就容易出现奖励黑客行为,例如生成看似合理但实际并未执行的结果、虚构方法细节或不当引用。另一方面,机器人实验室和自动化硬件可以提供物理 grounding,却通常局限于特定实验流程。 因此,作者提出扩展版 Co-Scientist:一个能够跨材料科学、生物学和计算机科学工作的执行扎根型科研伙伴。系统并不追求在所有场景中完全自动化,而是把人类专家、实验设备、代码执行环境和多智能体推理结合起来,按每个领域的安全和验证需求分配自治程度。

2. Methods | 方法

Co-Scientist 的工作流分为三阶段:构思、实验、论文写作。

构思阶段

系统首先接收研究指令和约束,生成候选假设群体。每个候选假设由并行文献综述支撑,并经过安全筛查和 LLM peer review。评审维度包括新颖性、合理性和可测试性。假设之间通过贝叶斯评分和 UCB 探索机制排序,既利用已有高分假设,也鼓励不确定但有潜力的新方向。 随后,系统通过类似进化算法的方式产生后代假设:交叉用于融合两个父假设的互补洞见,变异用于根据评审反馈改写单个假设。最终,最高分假设进入实验阶段。这个设计的目标不是一次性让模型给出“最佳答案”,而是在多轮比较、反馈和约束中逐步收敛。

实验阶段

实验阶段把研究计划转为可运行代码或可执行实验流程。对于计算任务,系统先在小数据子集上生成脚手架逻辑,再逐步切换到完整规模执行。多个 solver 并行生成候选程序,meta-agent 汇总错误信息、性能结果和实验日志,推动下一轮改进。 对于物理实验,Co-Scientist 生成的方案需要由实验人员或半自动硬件执行。论文特别强调,物理世界中的验证要比代码执行更复杂:实验设备有本地约束,材料样品会出现副产物,测量结果可能不确定,且安全要求更高。因此系统输出必须能被人类专家审查、修改和落地。

论文写作阶段

论文写作阶段把最终假设、实验结果、代码日志和文献背景合成为结构化手稿。系统会先生成摘要、引言、相关工作、方法、结果和讨论等标准部分,再通过进化式改写优化草稿。候选手稿由自动评审器从多个维度打分。 这一阶段也是风险最高的环节。因为如果系统只优化“像好论文”的评分,就可能编造实验、夸大结果或借用已有方法而不注明来源。为此,作者引入联合优化目标,把评审分数、抄袭惩罚和幻觉惩罚一起纳入优化;同时加入确定性的幻觉裁剪模块,将论文中的定量声明与原始实验执行日志交叉验证。对于可能造成危害的研究方向,系统还采用两层安全架构:初始研究方向筛查,以及构思和计划阶段的持续伦理监督。

3. Evaluation and Results | 评估与结果

论文将 Co-Scientist 放入四类验证场景:材料科学、生物学、医学响应生成架构发现,以及端到端论文生成可靠性评估。这四类任务构成从人类主导到高度自治的连续谱。

材料科学

材料实验聚焦二维材料合成。二维过渡金属碳化物、氮化物和硫族化物在电子、光电和能源存储中具有重要价值,但从文献配方迁移到具体实验设备并不容易。不同实验室的炉体几何、气流、前驱体纯度、基底处理等都会显著影响结果。 在 MXene 方向,Co-Scientist 参与设计了一条更安全的 CVD 路线,使用固态 C2Cl6 作为前驱体方案,目标是实现二维钛碳化物相关结构的自底向上生长。论文报告称,显微和衍射分析表明所得层状二维材料与 Ti3C2Tx MXene 晶格具有关键结构相似性,但作者也明确指出仍需进一步实验确认原子结构。这一点很重要:论文没有把结果包装成完全定论,而是保留了材料鉴定中的不确定性。

在 TMD 方向,Co-Scientist 利用 Gemini 3 Deep Think 快速把实验室约束转化为可执行生长配方,在分钟级生成针对本地硬件的 MoS2、MoSe2 和 WS2 合成方案。实验结果显示,系统实现了单次尝试的单层二维半导体生长。这说明 AI 在材料合成中的价值不只是搜索文献,而是把文献知识、本地设备约束和可执行参数连接起来。

生物学

生物实验关注工程化大肠杆菌的 swarming 表型预测。Swarming motility 是一种群体细菌行为,宏观菌落形态会受到基因表达和环境条件影响。若能准确预测不同诱导剂浓度下的形态变化,就可能减少设计-构建-测试-学习循环中的实验筛选次数。 Co-Scientist 设计了一个视觉语言预测流程:给定邻近 IPTG 浓度下的菌落图像,预测留出浓度条件下的菌落形态。系统使用 Gemini 3 Pro Image 生成候选图像,再用 Gemini 2.5 Pro 进行 Best-of-N 选择。评估中,pLac-rpoS 菌株表现出 IPTG 相关形态变化,系统基本捕捉到这种趋势;pLac-gfp 作为对照菌株,形态应随 IPTG 保持稳定,系统也较好避免了虚构剂量响应。

论文也指出了局限:模型在某些形态指标上仍可能偏向生成更规则的菌落边界,说明视觉生成模型并不天然理解复杂生物物理过程。它可以帮助减少筛选空间,但不能取代湿实验验证。

医学响应生成

计算机科学实验让 Co-Scientist 自主设计一种医学响应生成的推理时扩展架构 Agent_H。研究指令只给出目标和约束,系统需要在不访问 HealthBench Hard 和 HealthBench Professional 测试集的情况下,利用 1282 条合成健康查询和评估工具迭代设计 agent workflow。 Agent_H 的最终架构包含八个阶段:查询分诊与自适应计算分配、复杂问题分解、并行候选生成、锦标赛选择与共识、迭代批评与修正、元认知验证、指南引用审计和长度优化。每个查询大约需要 40 到 80 次 LLM 调用,因此它不是单次模型回答,而是一个高成本的推理时系统。

自动评测显示,Agent_H 在 HealthBench Hard 上取得最高原始分数,并在长度调整后超过所有对照模型;在 HealthBench Professional 上,Claude Opus 5 的原始分数更高,但长度调整后 Agent_H 领先。医生盲评则给出更谨慎的结论:三名认证医生对 106 个问题进行并排比较,Agent_H 相比 Gemini 3.1 Pro 显著降低“伤害可能性”,但其他八个维度没有显著差异。论文据此提醒,自动评审的优势不应直接等同于医生主观临床质量优势。

自动论文生成

最后一组实验评估 Co-Scientist 在端到端生成研究论文时的可靠性。研究者设置了 50 个计算科学主题,并比较三组系统:完整 Co-Scientist、去除可靠性模块的消融版本,以及 Agent Laboratory 基线。30 名领域专家进行双盲评审,共 450 次独立审查。 结果非常有信息量。对于会使论文结论失效的结果幻觉,完整 Co-Scientist 将发生率降到 4%,而消融版本为 46%,Agent Laboratory 基线为 90%;极端数据捏造被降到 0%。对于严重方法幻觉,完整系统为 24%,基线为 100%;对于严重抄袭,完整系统为 16%,基线为 60%。安全方面,初始安全系统拒绝 98.7% 的有害研究指令,并且伦理监督使专家评定安全的实验计划比例达到 96.7%。

这些结果说明,科研智能体确实可以通过日志验证和安全约束降低风险,但并不能完全消除风险。论文在附录中进一步分析了残余失败模式,包括选择性报告、数学描述与代码实现不一致、mock 函数伪装成动态流程,以及低比例的潜在无意识抄袭。

论文的相关工作覆盖大语言模型与智能体、自动机器学习、面向科研任务的大模型,以及自主科研系统。作者将 Co-Scientist 放在“科学发现智能体”的谱系中:一端是通用 LLM 与 agent 框架,强调规划、工具调用、代码执行和记忆;另一端是自动化实验平台和机器人实验室,强调物理执行、传感器反馈和实验闭环。 与许多只在软件环境中生成论文或代码的系统相比,本文更强调实验 grounding。与狭义自动化实验平台相比,Co-Scientist 又试图成为跨领域框架,可以根据材料、生物、医学软件任务等不同实验表面调整自治水平。论文也承认,完整系统代码并未公开,因为它深度依赖 Google 专有基础设施和安全控制。

5. Discussion | 讨论

论文的总体结论是:自治和可靠性可以在统一架构中共存,但前提是系统必须被实验读数、执行日志和人类专家监督约束。尤其是在真实世界科研中,大模型最有价值的位置未必是完全替代科学家,而是承担假设搜索、方案生成、代码实现、文献组织、结果校验和写作辅助,并让人类在关键安全和物理验证环节保持控制。

局限与失败模式

材料实验还没有跨实验室验证,二维材料合成的可复现性本身就是难题。生物预测是否能泛化到未表征基因线路或其他菌种仍未知。医学响应架构是在特定基准和合成训练查询上发现的,能否迁移到真实多轮临床对话还需要进一步评估。 更深层的问题是验证范围。执行日志能确认论文中报告的数值是否来自某次运行,但不能保证系统没有选择性报告,也不能自动判断论文中的数学描述是否忠实对应代码实现。未来需要更强的代码到文本一致性检查、运行完整性审计、静态分析和实时文献验证。

伦理问题

闭环科研智能体会降低行动门槛,也带来双重用途风险。一个系统如果能设计可执行实验协议,就可能被用于有害研究。论文中的安全架构能显著降低风险,但不能保证覆盖所有组合式风险,尤其是多个看似无害子任务组合成危险轨迹时。 论文还提醒,AI 可能造成“理解幻觉”:研究者容易把流畅的 AI 输出误认为真正科学进展。若科研智能体大规模生成相似假设和类似论文,还可能缩窄科学探索多样性。因此,AI 科学家的评估不能只看速度和产量,也要看原创性、可复现性、安全性和对科学共同体的长期影响。

6. Conclusion | 结论

这篇论文展示了 Co-Scientist 从纯计算构思走向执行扎根科研的阶段性进展。通过连接物理实验硬件、代码执行环境、确定性日志验证和专家监督,系统在材料科学、生物学、医学响应生成和自动论文生成中展示了跨领域科学加速潜力。 但论文最重要的结论并不是“AI 科学家已经可以独立替代人类”,而是“AI 的有效角色取决于每个实验场景的物理、安全和验证需求”。当实验具有高风险或强物理约束时,人类仍必须参与监督和验证;当任务主要在软件环境中运行时,智能体可以承担更高自治水平。未来如果自动实验室、多智能体科研网络和更严格的验证机制进一步结合,科学发现的瓶颈可能逐渐从构思速度转向实验吞吐量。 原论文:Accelerating Scientific Research with Gemini in the Real-World 论文链接:https://arxiv.org/abs/2608.26701

成为VIP会员查看完整内容
0

相关内容

人工智能将与科研深度结合,成为科学家继计算机之后的新生产工具。
VIP会员
最新内容
《国防技术管理》印度智库报告最新45页
专知会员服务
1+阅读 · 今天14:49
《美陆军最新条令:保障行动》
专知会员服务
1+阅读 · 今天14:39
算法战场:人工智能如何重新定义军事力量
专知会员服务
2+阅读 · 今天14:29
《北约联邦式电子战云架构》
专知会员服务
5+阅读 · 8月27日
《美陆军野战手册:空域管理战术》
专知会员服务
7+阅读 · 8月27日
微信扫码咨询专知VIP会员