FragmentFlow: Scalable Transition State Generation for Large Molecules - 专知论文

会员服务 ·

0

分子 · 生成方法 · 结构 · 几何结构 · 原子 ·

FragmentFlow: Scalable Transition State Generation for Large Molecules

翻译：FragmentFlow：面向大分子的可扩展过渡态生成方法

Ron Shprints,Peter Holderrieth,Juno Nam,Rafael Gómez-Bombarelli,Tommi Jaakkola

Transition states (TSs) are central to understanding and quantitatively predicting chemical reactivity and reaction mechanisms. Although traditional TS generation methods are computationally expensive, recent generative modeling approaches have enabled chemically meaningful TS prediction for relatively small molecules. However, these methods fail to generalize to practically relevant reaction substrates because of distribution shifts induced by increasing molecular sizes. Furthermore, TS geometries for larger molecules are not available at scale, making it infeasible to train generative models from scratch on such molecules. To address these challenges, we introduce FragmentFlow: a divide-and-conquer approach that trains a generative model to predict TS geometries for the reactive core atoms, which define the reaction mechanism. The full TS structure is then reconstructed by re-attaching substituent fragments to the predicted core. By operating on reactive cores, whose size and composition remain relatively invariant across molecular contexts, FragmentFlow mitigates distribution shifts in generative modeling. Evaluated on a new curated dataset of reactions involving reactants with up to 33 heavy atoms, FragmentFlow correctly identifies 90% of TSs while requiring 30% fewer saddle-point optimization steps than classical initialization schemes. These results point toward scalable TS generation for high-throughput reactivity studies.

翻译：过渡态（TSs）是理解和定量预测化学反应性及反应机理的核心。尽管传统的过渡态生成方法计算成本高昂，但近期的生成建模方法已能对相对较小的分子进行具有化学意义的过渡态预测。然而，由于分子尺寸增大引起的分布偏移，这些方法难以推广到具有实际意义的反应底物。此外，大分子的过渡态几何结构无法大规模获取，这使得从头开始在此类分子上训练生成模型变得不可行。为应对这些挑战，我们提出了FragmentFlow：一种分而治之的方法，该方法训练一个生成模型来预测定义反应机理的反应核心原子的过渡态几何结构。随后，通过将取代基片段重新连接到预测的核心上，重建完整的过渡态结构。通过作用于反应核心——其尺寸和组成在不同分子环境中保持相对不变——FragmentFlow缓解了生成建模中的分布偏移问题。在一个新构建的、涉及多达33个重原子的反应物反应数据集上进行评估，FragmentFlow正确识别了90%的过渡态，同时比经典的初始化方案减少了30%的鞍点优化步骤。这些结果表明了面向高通量反应性研究的可扩展过渡态生成的前景。

0

相关内容

CVPR2025最新《扩散Transformers》论文，概述最新图像视频生成方法

CVPR2025最新《扩散Transformers》论文，概述最新图像视频生成方法

专知会员服务

13+阅读 · 2025年4月20日

大模型上下文长度扩展中的检索增强技术简述

大模型上下文长度扩展中的检索增强技术简述

专知会员服务

28+阅读 · 2024年7月5日

《生成式模型: 变分自编码器与扩散模型》，75页ppt，Google DeepMind科学家Ruiqi Gao

《生成式模型: 变分自编码器与扩散模型》，75页ppt，Google DeepMind科学家Ruiqi Gao

专知会员服务

66+阅读 · 2023年6月10日

扩散模型综述又一弹！西湖大学李子青等最新《生成式扩散模型》综述，18页pdf详解扩散模型基础、方法体系和应用

扩散模型综述又一弹！西湖大学李子青等最新《生成式扩散模型》综述，18页pdf详解扩散模型基础、方法体系和应用

专知会员服务

121+阅读 · 2022年9月9日

Nat. Mach. Intel. | 一种用于分子相互作用和分子性质预测自动图学习方法

Nat. Mach. Intel. | 一种用于分子相互作用和分子性质预测自动图学习方法

专知会员服务

20+阅读 · 2022年6月25日

【ICLR2022】MIT最新论文《用于分子生成的数据高效图文法学习》，用图文法生成新分子，Data-Efficient Graph Grammar Learning for Molecular Generation

【ICLR2022】MIT最新论文《用于分子生成的数据高效图文法学习》，用图文法生成新分子，Data-Efficient Graph Grammar Learning for Molecular Generation

专知会员服务

14+阅读 · 2022年4月10日

【Nature. Mach. Intell. 】基于条件transformer、知识蒸馏和强化学习的多约束分子生成

【Nature. Mach. Intell. 】基于条件transformer、知识蒸馏和强化学习的多约束分子生成

专知会员服务

30+阅读 · 2022年3月27日

Transformer模型-深度学习自然语言处理，17页ppt

Transformer模型-深度学习自然语言处理，17页ppt

专知会员服务

108+阅读 · 2020年8月30日

TensorFlow 2.2为keras.Model加入train_step方法，开发者可自由定义模型自动训练过程

TensorFlow 2.2为keras.Model加入train_step方法，开发者可自由定义模型自动训练过程

专知会员服务

36+阅读 · 2020年3月27日

【DeepMind】PolyGen: 一种三维网格的自回归生成模型，PolyGen: An Autoregressive Generative Model of 3D Meshes

【DeepMind】PolyGen: 一种三维网格的自回归生成模型，PolyGen: An Autoregressive Generative Model of 3D Meshes

专知会员服务

37+阅读 · 2020年2月27日

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

专知

12+阅读 · 2022年10月31日

NLP大牛Thomas Wolf等新书《Transformer自然语言处理》，466页pdf及代码

NLP大牛Thomas Wolf等新书《Transformer自然语言处理》，466页pdf及代码

专知

36+阅读 · 2022年2月7日

Transformer模型-深度学习自然语言处理，17页ppt

Transformer模型-深度学习自然语言处理，17页ppt

专知

14+阅读 · 2020年8月30日

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

专知

21+阅读 · 2019年11月14日

Keras作者推荐的Github项目，基于TensorFlow2的生成式模型合集

Keras作者推荐的Github项目，基于TensorFlow2的生成式模型合集

专知

15+阅读 · 2019年5月17日

最新23页《深度学习图像超分辨率应用综述》论文，带你全面了解深度学习超分方法（附下载）

最新23页《深度学习图像超分辨率应用综述》论文，带你全面了解深度学习超分方法（附下载）

专知

43+阅读 · 2019年2月20日

这可能是「多模态机器学习」最通俗易懂的介绍

这可能是「多模态机器学习」最通俗易懂的介绍

计算机视觉life

113+阅读 · 2018年12月20日

TensorFlow 1.9 新增 tf.keras 官方入门教程（Keras与TF的深度集成）

TensorFlow 1.9 新增 tf.keras 官方入门教程（Keras与TF的深度集成）

专知

13+阅读 · 2018年7月20日

【论文】所见所想所真，对抗学习GAN提升跨模态检索效果！阿里巴巴AI Labs等团队最新工作

【论文】所见所想所真，对抗学习GAN提升跨模态检索效果！阿里巴巴AI Labs等团队最新工作

专知

12+阅读 · 2017年12月21日

NLP中自动生产文摘（auto text summarization）

NLP中自动生产文摘（auto text summarization）

机器学习研究会

14+阅读 · 2017年10月10日

基于生物大分子可编程多层级自组装特性, 构建新型生物催化纳米组装体

国家自然科学基金

0+阅读 · 2015年12月31日

单层过渡金属硫化物中拓扑激子和能谷电子学相关理论研究

国家自然科学基金

0+阅读 · 2015年12月31日

小分子动力学演化量子速度极限的代数理论

国家自然科学基金

0+阅读 · 2015年12月31日

结构可控的高有序有机半导体结晶薄膜的溶液法生长及应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于深度学习的多尺度本质图像提取方法

国家自然科学基金

5+阅读 · 2015年12月31日

多级可控组装模拟生物体系的功能

国家自然科学基金

0+阅读 · 2015年12月31日

一种高通量大尺度生物样品电镜三维重构方法的研究

国家自然科学基金

0+阅读 · 2015年12月31日

催化过程多尺度动态模拟方法的研究

国家自然科学基金

0+阅读 · 2015年12月31日

新型过渡金属硫属化合物二维半导体：可控制备、物性表征及光电子器件

国家自然科学基金

0+阅读 · 2014年12月31日

基于多孔沸石的独特性质构建功能性过渡金属催化剂实现有机合成的高效催化

国家自然科学基金

0+阅读 · 2014年12月31日

Efficient Generative Modeling with Unitary Matrix Product States Using Riemannian Optimization

Arxiv

0+阅读 · 3月12日

EnTransformer: A Deep Generative Transformer for Multivariate Probabilistic Forecasting

Arxiv

0+阅读 · 3月12日

HYGENE: A Diffusion-based Hypergraph Generation Method

Arxiv

0+阅读 · 3月10日

Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

Arxiv

0+阅读 · 3月6日

SpecBridge: Bridging Mass Spectrometry and Molecular Representations via Cross-Modal Alignment

Arxiv

0+阅读 · 3月3日

QFlowNet: Fast, Diverse, and Efficient Unitary Synthesis with Generative Flow Networks

Arxiv

0+阅读 · 3月3日

PoolPy: Automated combinatorial pooling for high-throughput molecular profiling

Arxiv

0+阅读 · 2月25日

Scalable, quantum-accessible, and adaptive pseudorandom quantum state and pseudorandom function-like quantum state generators

Arxiv

0+阅读 · 2月17日

Sample Efficient Generative Molecular Optimization with Joint Self-Improvement

Arxiv

0+阅读 · 2月11日

Exploring the Potential of Large Language Models in Simulink-Stateflow Mutant Generation

Arxiv

0+阅读 · 2月3日

VIP会员

文章信息

相关主题

最新内容

乌克兰前线的五项创新

乌克兰前线的五项创新

专知会员服务

1+阅读 · 今天6:14

军事通信系统与设备的技术演进综述

军事通信系统与设备的技术演进综述

专知会员服务

1+阅读 · 今天5:59

《北约 AI手册：作战人员的实用考量》（2026最新64页）

《北约 AI手册：作战人员的实用考量》（2026最新64页）

专知会员服务

1+阅读 · 今天5:54

《北约标准：医疗评估手册》174页

《北约标准：医疗评估手册》174页

专知会员服务

1+阅读 · 今天5:51

《提升生成模型的安全性与保障》博士论文

《提升生成模型的安全性与保障》博士论文

专知会员服务

0+阅读 · 今天5:47

美国当前高超音速导弹发展概述

美国当前高超音速导弹发展概述

专知会员服务

4+阅读 · 4月19日

《高超音速武器：一项再度兴起的技术》120页slides

《高超音速武器：一项再度兴起的技术》120页slides

专知会员服务

8+阅读 · 4月19日

无人机蜂群建模与仿真方法

无人机蜂群建模与仿真方法

专知会员服务

9+阅读 · 4月19日

《重建美国空中力量：为应对同级冲突平衡空军战斗力量》美智库报告

《重建美国空中力量：为应对同级冲突平衡空军战斗力量》美智库报告

专知会员服务

3+阅读 · 4月19日

《量化反无人机系统对抗无人机蜂群效能的创新方法》

《量化反无人机系统对抗无人机蜂群效能的创新方法》

专知会员服务

12+阅读 · 4月19日

澳大利亚发布《国防战略（2026年）》

澳大利亚发布《国防战略（2026年）》

专知会员服务

4+阅读 · 4月19日

【CMU博士论文】迈向基于基础先验的 4D 感知研究

【CMU博士论文】迈向基于基础先验的 4D 感知研究

专知会员服务

4+阅读 · 4月19日

大语言模型智能体中的外显化机制：记忆、技能、协议与评测基准工程综述

大语言模型智能体中的外显化机制：记忆、技能、协议与评测基准工程综述

专知会员服务

14+阅读 · 4月19日

全球高超音速武器最新发展趋势

全球高超音速武器最新发展趋势

专知会员服务

3+阅读 · 4月19日

《利用大语言模型增强多域作战兵棋推演》（报告）

《利用大语言模型增强多域作战兵棋推演》（报告）

专知会员服务

14+阅读 · 4月18日

相关VIP内容

CVPR2025最新《扩散Transformers》论文，概述最新图像视频生成方法

CVPR2025最新《扩散Transformers》论文，概述最新图像视频生成方法

专知会员服务

13+阅读 · 2025年4月20日

大模型上下文长度扩展中的检索增强技术简述

大模型上下文长度扩展中的检索增强技术简述

专知会员服务

28+阅读 · 2024年7月5日

《生成式模型: 变分自编码器与扩散模型》，75页ppt，Google DeepMind科学家Ruiqi Gao

《生成式模型: 变分自编码器与扩散模型》，75页ppt，Google DeepMind科学家Ruiqi Gao

专知会员服务

66+阅读 · 2023年6月10日

扩散模型综述又一弹！西湖大学李子青等最新《生成式扩散模型》综述，18页pdf详解扩散模型基础、方法体系和应用

扩散模型综述又一弹！西湖大学李子青等最新《生成式扩散模型》综述，18页pdf详解扩散模型基础、方法体系和应用

专知会员服务

121+阅读 · 2022年9月9日

Nat. Mach. Intel. | 一种用于分子相互作用和分子性质预测自动图学习方法

Nat. Mach. Intel. | 一种用于分子相互作用和分子性质预测自动图学习方法

专知会员服务

20+阅读 · 2022年6月25日

【ICLR2022】MIT最新论文《用于分子生成的数据高效图文法学习》，用图文法生成新分子，Data-Efficient Graph Grammar Learning for Molecular Generation

【ICLR2022】MIT最新论文《用于分子生成的数据高效图文法学习》，用图文法生成新分子，Data-Efficient Graph Grammar Learning for Molecular Generation

专知会员服务

14+阅读 · 2022年4月10日

【Nature. Mach. Intell. 】基于条件transformer、知识蒸馏和强化学习的多约束分子生成

【Nature. Mach. Intell. 】基于条件transformer、知识蒸馏和强化学习的多约束分子生成

专知会员服务

30+阅读 · 2022年3月27日

Transformer模型-深度学习自然语言处理，17页ppt

Transformer模型-深度学习自然语言处理，17页ppt

专知会员服务

108+阅读 · 2020年8月30日

TensorFlow 2.2为keras.Model加入train_step方法，开发者可自由定义模型自动训练过程

TensorFlow 2.2为keras.Model加入train_step方法，开发者可自由定义模型自动训练过程

专知会员服务

36+阅读 · 2020年3月27日

【DeepMind】PolyGen: 一种三维网格的自回归生成模型，PolyGen: An Autoregressive Generative Model of 3D Meshes

【DeepMind】PolyGen: 一种三维网格的自回归生成模型，PolyGen: An Autoregressive Generative Model of 3D Meshes

专知会员服务

37+阅读 · 2020年2月27日

热门VIP内容

开通专知VIP会员享更多权益服务

军事通信系统与设备的技术演进综述

《北约标准：医疗评估手册》174页

乌克兰前线的五项创新

《北约 AI手册：作战人员的实用考量》（2026最新64页）

相关资讯

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

专知

12+阅读 · 2022年10月31日

NLP大牛Thomas Wolf等新书《Transformer自然语言处理》，466页pdf及代码

NLP大牛Thomas Wolf等新书《Transformer自然语言处理》，466页pdf及代码

专知

36+阅读 · 2022年2月7日

Transformer模型-深度学习自然语言处理，17页ppt

Transformer模型-深度学习自然语言处理，17页ppt

专知

14+阅读 · 2020年8月30日

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

专知

21+阅读 · 2019年11月14日

Keras作者推荐的Github项目，基于TensorFlow2的生成式模型合集

Keras作者推荐的Github项目，基于TensorFlow2的生成式模型合集

专知

15+阅读 · 2019年5月17日

最新23页《深度学习图像超分辨率应用综述》论文，带你全面了解深度学习超分方法（附下载）

最新23页《深度学习图像超分辨率应用综述》论文，带你全面了解深度学习超分方法（附下载）

专知

43+阅读 · 2019年2月20日

这可能是「多模态机器学习」最通俗易懂的介绍

这可能是「多模态机器学习」最通俗易懂的介绍

计算机视觉life

113+阅读 · 2018年12月20日

TensorFlow 1.9 新增 tf.keras 官方入门教程（Keras与TF的深度集成）

TensorFlow 1.9 新增 tf.keras 官方入门教程（Keras与TF的深度集成）

专知

13+阅读 · 2018年7月20日

【论文】所见所想所真，对抗学习GAN提升跨模态检索效果！阿里巴巴AI Labs等团队最新工作

【论文】所见所想所真，对抗学习GAN提升跨模态检索效果！阿里巴巴AI Labs等团队最新工作

专知

12+阅读 · 2017年12月21日

NLP中自动生产文摘（auto text summarization）

NLP中自动生产文摘（auto text summarization）

机器学习研究会

14+阅读 · 2017年10月10日

相关论文

Efficient Generative Modeling with Unitary Matrix Product States Using Riemannian Optimization

Arxiv

0+阅读 · 3月12日

EnTransformer: A Deep Generative Transformer for Multivariate Probabilistic Forecasting

Arxiv

0+阅读 · 3月12日

HYGENE: A Diffusion-based Hypergraph Generation Method

Arxiv

0+阅读 · 3月10日

Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

Arxiv

0+阅读 · 3月6日

SpecBridge: Bridging Mass Spectrometry and Molecular Representations via Cross-Modal Alignment

Arxiv

0+阅读 · 3月3日

QFlowNet: Fast, Diverse, and Efficient Unitary Synthesis with Generative Flow Networks

Arxiv

0+阅读 · 3月3日

PoolPy: Automated combinatorial pooling for high-throughput molecular profiling

Arxiv

0+阅读 · 2月25日

Scalable, quantum-accessible, and adaptive pseudorandom quantum state and pseudorandom function-like quantum state generators

Arxiv

0+阅读 · 2月17日

Sample Efficient Generative Molecular Optimization with Joint Self-Improvement

Arxiv

0+阅读 · 2月11日

Exploring the Potential of Large Language Models in Simulink-Stateflow Mutant Generation

Arxiv

0+阅读 · 2月3日

相关基金

基于生物大分子可编程多层级自组装特性, 构建新型生物催化纳米组装体

国家自然科学基金

0+阅读 · 2015年12月31日

单层过渡金属硫化物中拓扑激子和能谷电子学相关理论研究

国家自然科学基金

0+阅读 · 2015年12月31日

小分子动力学演化量子速度极限的代数理论

国家自然科学基金

0+阅读 · 2015年12月31日

结构可控的高有序有机半导体结晶薄膜的溶液法生长及应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于深度学习的多尺度本质图像提取方法

国家自然科学基金

5+阅读 · 2015年12月31日

多级可控组装模拟生物体系的功能

国家自然科学基金

0+阅读 · 2015年12月31日

一种高通量大尺度生物样品电镜三维重构方法的研究

国家自然科学基金

0+阅读 · 2015年12月31日

催化过程多尺度动态模拟方法的研究

国家自然科学基金

0+阅读 · 2015年12月31日

新型过渡金属硫属化合物二维半导体：可控制备、物性表征及光电子器件

国家自然科学基金

0+阅读 · 2014年12月31日

基于多孔沸石的独特性质构建功能性过渡金属催化剂实现有机合成的高效催化

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员