论文 | Closed-loop Auto Research for Molecular Property Prediction:分子性质预测中的闭环自动研究与泛化认证

论文题目: Closed-loop Auto Research for Molecular Property Prediction: Discovering and Certifying Generalizable Improvements 作者: Jingjie Ning, Xiaochuan Li, Ji Zeng, Chenyan Xiong, Guolin Ke 机构: Carnegie Mellon University;DP Technology, Beijing 论文链接: https://arxiv.org/pdf/2606.22731 关键词: 自动研究、科学智能体、分子性质预测、泛化评估、外部数据增强、数据泄漏控制

导读

这篇论文讨论的不是传统意义上的自动机器学习,而是更接近“自动做研究”的闭环系统:智能体不仅调超参数,还可以改特征、改模型代码、引入外部数据,并在一次次实验反馈中选择下一步动作。这样的系统看起来更像科研助手,但也带来一个核心风险:它在验证集上找到的改进,究竟是真正可迁移的发现,还是对有限验证信号的适配? 作者把这个问题落到分子性质预测场景中。原因很直接:药物发现相关任务通常端点多、数据小、评价敏感,既适合快速重复实验,也非常容易被验证集选择、外部数据重合、分布偏移等因素误导。因此,论文提出一种“发现和认证分离”的评估方式:自动研究循环可以在内部训练与验证划分上搜索,但最终每个被选中的配置都要冻结后,在从未被循环读取标签的留出测试集上只评估一次。 论文的关键结论很清晰:闭环自动研究确实能在 36 个分子预测端点上发现可泛化改进,但可迁移的动作类型强烈依赖数据集 regime。TDC ADMET 上外部数据最有效,Polaris ADME 上模型代码干预最有效,MoleculeNet 上特征和模型干预都能迁移。同时,留出认证揭示了两类典型失败:一类是验证集选择方差,另一类是外部数据虽通过污染过滤但仍因分布不匹配而不迁移。

Introduction:从自动调参到自动研究

传统 AutoML 主要在固定数据集、固定特征空间、固定模型族内搜索,例如调超参数、选择模型或做简单预处理。本文关注的闭环 Auto Research 更进一步:它允许智能体在实验反馈中提出假设、修改研究流程、改变分子表示、编辑模型训练代码,甚至寻找并清洗外部测量数据。 这种能力扩张使系统更接近真实科研过程,但也放大了评估难度。因为研究循环会反复读取验证结果,任何被报告的验证集提升都可能混入两类失真:一是多次选择导致的验证集偶然性,二是外部数据可能重新引入测试集来源、近邻结构或分布不匹配样本。 因此,作者把论文的中心问题定义为:闭环自动研究所发现的改进,能否在搜索循环从未读取标签的留出测试集上成立?这里的重点不是某个化学模型是否最强,而是如何给自动研究系统建立可审计、可归因、可复现的泛化认证流程。 本文在分子性质预测上进行实验,共覆盖 36 个端点,来自 TDC ADMET、MoleculeNet 和 Polaris ADME。系统从一个强 MapLight 风格 CPU 基线出发,分别允许三类干预:特征轴、模型轴和数据轴。每次实验只允许一个轴发生变化,从而把收益归因到具体动作类型。

论文把相关工作放在三个方向中理解。 首先是自动机器学习与程序化建模。AutoML 系统已经能自动搜索模型、超参数和管线组件,但它通常不改变研究问题本身,也不主动获取外部科学证据。相比之下,Auto Research 的动作空间更大,因而不能只用验证集最优来证明有效。 其次是科学智能体与自动实验。近期科学智能体开始被用于代码生成、实验规划、文献检索和迭代优化,但很多系统更强调“能不能产生改进”,较少把“改进是否可泛化”作为独立评估对象。本文的贡献在于把发现过程与认证过程严格隔离。 第三是分子性质预测与药物发现基准。ADMET、MoleculeNet、Polaris 等任务长期用于评估分子表征和机器学习模型,但这类任务普遍存在小数据、端点异质、外部来源重叠等问题。对于会主动找数据的智能体来说,污染控制不再是附属步骤,而是整个评估协议的一部分。

Experimental design:实验设计与留出认证

三类干预轴

论文把自动研究动作拆成三个互斥轴。 特征轴负责改变分子表示,例如结构警报、描述符、指纹组合或任务相关特征。模型轴负责改变估计器、优化方式、正则化、集成与训练程序。数据轴负责寻找外部测量来源,并在过滤后把新增样本并入训练。 为了避免多个动作混在一起无法归因,系统采用 file-level ablation lock:一次提交只允许一个轴的文件发生有效变化。这样,如果留出测试集上出现提升,就能追踪它来自特征、模型还是外部数据。

基准、划分与指标

实验覆盖三个套件。TDC ADMET 包含 22 个端点,使用 TDC benchmark 预设划分;MoleculeNet 包含 10 个端点,采用固定 10% 分子留出;Polaris ADME 包含 4 个端点,使用更严格的 scaffold-based 20% 留出划分。 所有端点都先由强基线统一处理,再让自动研究系统在内部训练和验证划分上搜索。不同任务使用对应指标,并报告相对强基线的归一化提升。这样做的目的不是堆一个单一排行榜,而是比较不同干预轴在不同数据 regime 下是否真正迁移。

留出测试协议

搜索阶段结束后,每个端点按验证集选择出配置,并被冻结。随后系统在内部训练数据上重新训练,并在留出测试集上只评估一次。测试标签从不进入智能体循环,测试结构也只由评估器拥有的污染过滤器用于外部数据审计。 这个协议的价值在于把“搜索用信号”和“认证用信号”分离。验证集可以引导探索,但最终能否称为发现,取决于留出测试集是否支持。

外部数据的防泄漏机制

数据轴是最敏感的部分,因为分子数据集常常从相同 assay 或数据库重新聚合而来。论文设计了三层过滤。 第一层是标准化身份去重:对分子做脱盐、中和和标准 InChIKey 归一化,移除与训练、验证、测试中任一分子身份匹配的行。第二层是同源拒绝:如果外部文件中超过 5% 的测试分子骨架出现在该文件中,就整份拒绝。第三层是近邻过滤:去除与测试分子 ECFP4 Tanimoto 相似度大于等于 0.9 的分子。 注意,这个过滤器是评估器侧的,智能体不能绕过。它能降低“把测试来源重新导入训练”的风险,但论文后面也证明,防泄漏并不等于保证迁移。

Held-out generalization:留出泛化结果

总体结果显示,按验证集路由选择的配置在三个套件上都得到正向留出提升:TDC ADMET 为 +0.013,MoleculeNet 为 +0.011,Polaris ADME 为 +0.042。更重要的是,最有效的轴并不一致。 在 TDC ADMET 上,数据轴是最能迁移的干预。外部数据经过严格过滤后,仍能给部分端点带来稳定收益。MoleculeNet 上,特征轴和模型轴都能迁移,说明对表示和训练程序的改动能够在这些端点上保留有效信号。Polaris ADME 上,模型轴最强,留出提升达到 +0.042,而数据轴虽然验证集为正,却在测试集转负。

端点级结果进一步说明,聚合提升不是由单个任务偶然拉高。36 个端点中,TDC 有 12/22 个端点为正,MoleculeNet 有 5/10 个端点为正,Polaris 的 4 个端点全部为正。较大的收益包括 CYP2C9 substrate 约 +0.172、FreeSolv 约 +0.147、Lipophilicity 约 +0.097,以及 HLM clearance 约 +0.080。 这些结果支持一个更细的判断:闭环自动研究不是在所有任务上用同一种技巧取胜,而是在不同数据条件下发现不同类型的有效动作。对小而异质的分子任务而言,这一点比平均分本身更有价值。

What held-out certification reveals about transfer:留出认证揭示了什么

选择方差

第一类失败是选择方差。TDC 的模型轴在验证集上达到 +0.041,是单轴中很高的验证提升,但留出测试只有 +0.003。论文观察到,随着保留的模型轴快照增加,验证聚合值不断上升,而测试聚合值接近零,二者差距从较早快照开始就存在。 这说明问题不一定是某个模型过拟合训练集,而是搜索循环反复适配一个有限验证划分后,选中了对验证噪声有利、但不代表真实可迁移效应的配置。对自动研究系统来说,这类风险尤其突出,因为智能体越会利用反馈,就越需要独立认证集来约束。

分布漂移

第二类失败是分布漂移。Polaris 的数据轴在验证集上为 +0.022,但留出测试为 -0.019。外部数据并没有明显污染测试分子,也通过了身份去重、同源拒绝和近邻过滤,但它来自相对 Polaris 测试划分更偏离的 assay 或来源。 这说明“数据更多”并不必然更好。对于药物发现任务,外部数据必须在测量定义、实验条件和目标分布上匹配端点,否则即使没有泄漏,也可能把训练分布推向错误方向。

数据收益在哪里迁移

论文统计了外部数据的准入与拒绝情况。最终 18 个被接受的数据源共增加 1666 行训练样本,其中 TDC 为 11 个来源、148 行,MoleculeNet 为 3 个来源、93 行,Polaris 为 4 个来源、1425 行。 有意思的是,Polaris 增加的数据最多,却产生负的留出迁移;TDC 增加的数据较少,却获得最好的数据轴迁移。这再次说明,数据量不是核心,来源匹配和端点覆盖才是关键。 过滤器也发挥了必要作用。它拒绝了多个高重合来源,例如半衰期和 VDss 相关文件与测试结构重合可达 88% 到 89%,AMES 相关来源也有 64% 重合,远高于 5% 阈值。如果这些来源被纳入训练,验证提升很可能变成虚假的“泄漏收益”。

External controls:外部控制实验

与标准自动机器学习比较

为了确认 Polaris 模型轴收益不是普通超参数搜索就能复现的,作者构造了 matched-trial AutoML 控制实验。控制系统使用 FLAML,在相同模型家族、相同特征、相同划分、相同端点指标和匹配的试验次数下搜索。 结果显示,AutoML 的归一化留出提升为 +0.006,而智能体模型轴为 +0.042。即使给 AutoML 加上相同目标缩放,提升也只有 +0.006。论文认为,智能体模型轴的优势主要来自代码级干预,例如多种子集成、按任务选择估计器、调整容量和正则化,而不是单纯搜索固定模型的超参数。

与三维预训练模型比较

作者还引入 Uni-Mol 作为预训练 3D 模型参照。Uni-Mol 约 8400 万参数,在相同任务训练划分上微调。结果显示,本文的 CPU 管线整体具有竞争力:在 Uni-Mol 产生有效测试预测的 35 个端点中,强基线已超过 Uni-Mol 27 个端点,验证选择后的自动研究管线超过 25 个端点。 这并不意味着 3D 预训练无效。论文指出,在 Polaris 的部分端点上,3D 表示仍有真实优势,智能体模型轴能缩小差距但没有完全反超。更稳妥的结论是:对于许多小型 ADMET 任务,经过精心设计和认证的轻量 CPU 管线仍然非常强,而预训练模型的收益需要结合端点和数据条件判断。

Discussion:讨论与启示

这篇论文最重要的启示,是把闭环自动研究从“找到验证集提升”推进到“证明哪些提升能泛化”。当智能体拥有更大的动作空间时,传统 AutoML 式的验证集报告不够充分,因为它无法区分真实发现、选择方差、数据污染和分布偏移。 轴隔离设计让研究动作可归因。特征、模型、数据三类动作分别搜索,避免了多种变化叠加后无法解释。留出测试协议让结果可认证。搜索循环从不读测试标签,最终冻结配置后只评估一次,把“发现阶段”与“证明阶段”分开。 外部数据审计则是面向科学智能体的关键组件。论文证明污染过滤是必要的:没有它,高重合来源会造成虚假提升。但污染过滤还不充分:Polaris 数据轴通过过滤后仍因分布不匹配而失败。这一点对未来自动科研系统非常重要,因为“可信数据获取”不仅要排除泄漏,还要判断数据是否与目标测量问题一致。 从应用角度看,闭环自动研究更适合被视为“可审计的实验生成器”,而不是一次性输出最优模型的黑箱。它可以提出有价值的改动,但每个改动都需要独立认证、来源追踪和失败模式分析。

Conclusions:结论

本文提出并验证了一个面向分子性质预测的闭环 Auto Research 评估框架。系统可以在特征、模型和外部数据三个轴上自动提出研究动作,并通过严格的留出测试协议认证哪些动作真正泛化。 实验表明,自动研究在 36 个端点上能产生可迁移改进,但有效动作强烈依赖任务 regime:TDC 主要受益于外部数据,Polaris 主要受益于模型代码干预,MoleculeNet 同时受益于特征和模型改动。留出认证还揭示了两类不迁移机制:验证集选择方差和外部数据分布漂移。 因此,这篇论文给出的不是一个单纯更高分的分子预测模型,而是一套更适合科学智能体时代的评估范式:允许系统自由探索,但必须用隔离的留出证据、轴级归因和可审计数据流程来确认哪些发现真正成立。

成为VIP会员查看完整内容
0

相关内容

Nature速递:基于大语言模型的自动化学研究
专知会员服务
35+阅读 · 2024年1月5日
IJCAI 2022 | 端到端的几何transformer:用于分子属性预测
专知会员服务
13+阅读 · 2022年12月26日
主动学习预测结合自由能进行分子优化
专知会员服务
16+阅读 · 2022年9月18日
DeepMind | 通过去噪来进行分子性质预测的预训练
专知会员服务
13+阅读 · 2022年6月27日
【AAAI2022】LGD:用于物体检测的标签引导自蒸馏
专知会员服务
17+阅读 · 2022年1月2日
论文浅尝 - CIKM2020 | 用于推荐系统的多模态知识图谱
开放知识图谱
12+阅读 · 2020年12月17日
CVPR 2019 Oral 论文解读 | 无监督域适应语义分割
AI科技评论
49+阅读 · 2019年5月29日
论文浅尝 | 用于知识图中链接预测的嵌入方法 SimplE
开放知识图谱
24+阅读 · 2019年4月3日
读书报告 | Deep Learning for Extreme Multi-label Text Classification
科技创新与创业
48+阅读 · 2018年1月10日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
2+阅读 · 2014年12月31日
国家自然科学基金
1+阅读 · 2014年12月31日
VIP会员
最新内容
论文 | 分子性质预测中的闭环自动研究与泛化认证
论文 | OmniScientist:全模态全学科AI科学家
专知会员服务
0+阅读 · 今天14:40
无人机已改变战场,但并未解决指挥问题
专知会员服务
5+阅读 · 8月14日
驱动军事决策变革的顶尖人工智能指挥系统
专知会员服务
11+阅读 · 8月11日
非对称防御中的自组织临界性:俄乌战争
专知会员服务
10+阅读 · 8月10日
相关基金
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
2+阅读 · 2014年12月31日
国家自然科学基金
1+阅读 · 2014年12月31日
微信扫码咨询专知VIP会员