A Large-Scale Dataset for Molecular Structure-Language Description via a Rule-Regularized Method - 专知论文

会员服务 ·

0

分子 · 结构 · 数据集 · 标注 · 构建 ·

A Large-Scale Dataset for Molecular Structure-Language Description via a Rule-Regularized Method

翻译：基于规则正则化方法的大规模分子结构-语言描述数据集

Feiyang Cai,Guijuan He,Yi Hu,Jingjing Wang,Joshua Luo,Tianyu Zhu,Srikanth Pilla,Gang Li,Ling Liu,Feng Luo

Molecular function is largely determined by structure. Accurately aligning molecular structure with natural language is therefore essential for enabling large language models (LLMs) to reason about downstream chemical tasks. However, the substantial cost of human annotation makes it infeasible to construct large-scale, high-quality datasets of structure-grounded descriptions. In this work, we propose a fully automated annotation framework for generating precise molecular structure descriptions at scale. Our approach builds upon and extends a rule-based chemical nomenclature parser to interpret IUPAC names and construct enriched, structured XML metadata that explicitly encodes molecular structure. This metadata is then used to guide LLMs in producing accurate natural-language descriptions. Using this framework, we curate a large-scale dataset of approximately $163$k molecule-description pairs. A rigorous validation protocol combining LLM-based and expert human evaluation on a subset of $2,000$ molecules demonstrates a high description precision of $98.6\%$. The resulting dataset provides a reliable foundation for future molecule-language alignment, and the proposed annotation method is readily extensible to larger datasets and broader chemical tasks that rely on structural descriptions.

翻译：分子功能主要由其结构决定。因此，准确地将分子结构与自然语言对齐，对于使大语言模型能够推理下游化学任务至关重要。然而，人工标注的高昂成本使得构建大规模、高质量的结构化描述数据集变得不可行。在本工作中，我们提出了一种全自动的标注框架，用于大规模生成精确的分子结构描述。我们的方法基于并扩展了一种基于规则的化学命名解析器，以解释IUPAC名称并构建丰富的、结构化的XML元数据，该元数据明确编码了分子结构。随后，利用该元数据引导大语言模型生成准确的自然语言描述。通过该框架，我们构建了一个包含约$163$k个分子-描述对的大规模数据集。在一个包含$2,000$个分子的子集上，结合基于大语言模型的评估和专家人工评估的严格验证方案表明，描述精度高达$98.6\%$。所得到的数据集为未来的分子-语言对齐研究提供了可靠的基础，并且所提出的标注方法易于扩展到更大的数据集以及依赖结构描述的更广泛的化学任务中。

0

相关内容

大语言模型基准综述

大语言模型基准综述

专知会员服务

27+阅读 · 2025年8月22日

基于文本引导的分子发现中大型语言模型综述：从分子生成到优化

基于文本引导的分子发现中大型语言模型综述：从分子生成到优化

专知会员服务

7+阅读 · 2025年5月24日

基于大语言模型的知识图谱逻辑规则挖掘框架及应用

基于大语言模型的知识图谱逻辑规则挖掘框架及应用

专知会员服务

27+阅读 · 2025年5月22日

面向统计学家的大型语言模型概述

面向统计学家的大型语言模型概述

专知会员服务

32+阅读 · 2025年3月16日

【ICLR2024】3D-MoLM：增强语言模型对分子3D空间结构的理解

【ICLR2024】3D-MoLM：增强语言模型对分子3D空间结构的理解

专知会员服务

12+阅读 · 2024年2月29日

科学语言建模：大型语言模型在分子科学中的量化综述

科学语言建模：大型语言模型在分子科学中的量化综述

专知会员服务

31+阅读 · 2024年2月8日

【博士论文】负责任大型语言模型:安全性、公平性、可信性，142页pdf

【博士论文】负责任大型语言模型:安全性、公平性、可信性，142页pdf

专知会员服务

34+阅读 · 2024年1月26日

【哈佛大学博士论文】《大语言模型的结构建模》，132页pdf

【哈佛大学博士论文】《大语言模型的结构建模》，132页pdf

专知会员服务

46+阅读 · 2024年1月25日

分子表示如何用图学习？圣母大学等《图分子表示学习》最新简明综述，表述方法、数据集、应用等

分子表示如何用图学习？圣母大学等《图分子表示学习》最新简明综述，表述方法、数据集、应用等

专知会员服务

27+阅读 · 2022年7月12日

【ICLR2022】MIT最新论文《用于分子生成的数据高效图文法学习》，用图文法生成新分子，Data-Efficient Graph Grammar Learning for Molecular Generation

【ICLR2022】MIT最新论文《用于分子生成的数据高效图文法学习》，用图文法生成新分子，Data-Efficient Graph Grammar Learning for Molecular Generation

专知会员服务

14+阅读 · 2022年4月10日

【Manning新书】大规模数据结构和算法，306页pdf

【Manning新书】大规模数据结构和算法，306页pdf

专知

14+阅读 · 2022年5月30日

《文本分类大综述：从浅层到深度学习》最新2020版35页pdf

《文本分类大综述：从浅层到深度学习》最新2020版35页pdf

专知

59+阅读 · 2020年8月6日

Video Description视频描述综述论文-方法、数据集和评估指标，UWA

Video Description视频描述综述论文-方法、数据集和评估指标，UWA

专知

38+阅读 · 2020年3月5日

【综述】3D数据分类深度学习方法综述，25页论文带你全面了解最新进展

【综述】3D数据分类深度学习方法综述，25页论文带你全面了解最新进展

中国人工智能学会

20+阅读 · 2019年7月17日

最全中文自然语言处理数据集、平台和工具整理

最全中文自然语言处理数据集、平台和工具整理

深度学习与NLP

34+阅读 · 2019年6月22日

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

AI科技评论

12+阅读 · 2019年5月2日

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

机器之心

15+阅读 · 2019年3月18日

自然语言处理（NLP）知识结构总结

自然语言处理（NLP）知识结构总结

AI100

51+阅读 · 2018年8月17日

基于深度学习的文本分类6大算法-原理、结构、论文、源码打包分享

基于深度学习的文本分类6大算法-原理、结构、论文、源码打包分享

深度学习与NLP

25+阅读 · 2018年7月18日

论文报告 | Graph-based Neural Multi-Document Summarization

论文报告 | Graph-based Neural Multi-Document Summarization

科技创新与创业

15+阅读 · 2017年12月15日

大规模分数阶微分系统的高性能并行算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

含非正态及缺失数据的结构方程模型分析

国家自然科学基金

0+阅读 · 2015年12月31日

可扩展的蛋白质组学大数据存储与分析模型研究

国家自然科学基金

1+阅读 · 2015年12月31日

面向大规模分布式一致性最优化问题的结构型一阶求解算法研究

国家自然科学基金

1+阅读 · 2015年12月31日

方差正则化的分类模型选择方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

数据内在结构和稀疏保持的大间隔分类方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

大数据环境下基于量子计算的非结构化数据关键问题的研究

国家自然科学基金

2+阅读 · 2015年12月31日

面向异分布数据的主动学习方法

国家自然科学基金

12+阅读 · 2015年12月31日

重油组成矩阵的分子水平构建及基于结构导向集总的催化裂化反应动力学模型

国家自然科学基金

0+阅读 · 2014年12月31日

生物网络的可计算建模

国家自然科学基金

2+阅读 · 2014年12月31日

Modelling Language using Large Language Models

Arxiv

0+阅读 · 3月11日

De novo molecular structure elucidation from mass spectra via flow matching

Arxiv

0+阅读 · 2月23日

LogiPart: Local Large Language Models for Data Exploration at Scale with Logical Partitioning

Arxiv

0+阅读 · 2月17日

DALL: Data Labeling via Data Programming and Active Learning Enhanced by Large Language Models

Arxiv

0+阅读 · 2月15日

OmniScience: A Large-scale Multi-modal Dataset for Scientific Image Understanding

Arxiv

0+阅读 · 2月14日

Benchmarking Large Language Models for Knowledge Graph Validation

Arxiv

0+阅读 · 2月11日

LLM Reasoning Predicts When Models Are Right: Evidence from Coding Classroom Discourse

Arxiv

0+阅读 · 2月10日

Hybrid Pooling with LLMs via Relevance Context Learning

Arxiv

0+阅读 · 2月9日

Orthogonal Hierarchical Decomposition for Structure-Aware Table Understanding with Large Language Models

Arxiv

0+阅读 · 2月2日

A Survey of Large Language Models

A Survey of Large Language Models

Arxiv

501+阅读 · 2023年3月31日

VIP会员

文章信息

相关主题

最新内容

美以伊冲突中的人工智能应用：人工智能工具、部署策略及作战影响分析

美以伊冲突中的人工智能应用：人工智能工具、部署策略及作战影响分析

专知会员服务

1+阅读 · 今天15:43

比利时发布用于实时战场军事装备识别的离线人工智能系统

比利时发布用于实时战场军事装备识别的离线人工智能系统

专知会员服务

1+阅读 · 今天15:41

《经济冲击与战略损失：美伊军事冲突的不可持续成本》

《经济冲击与战略损失：美伊军事冲突的不可持续成本》

专知会员服务

1+阅读 · 今天15:37

超越网格：作战环境对炮兵的影响

超越网格：作战环境对炮兵的影响

专知会员服务

1+阅读 · 今天15:35

KDD 2026 | MixRAGRec：面向LLM推荐的混合专家KG-RAG框架

KDD 2026 | MixRAGRec：面向LLM推荐的混合专家KG-RAG框架

专知会员服务

4+阅读 · 今天12:11

综述 | 推理时控制：可信大语言模型的运行时治理全景

综述 | 推理时控制：可信大语言模型的运行时治理全景

专知会员服务

3+阅读 · 今天12:10

BES：让语言模型通过双向进化搜索自我改进

BES：让语言模型通过双向进化搜索自我改进

专知会员服务

4+阅读 · 5月30日

ICML 2026 | 揭开视觉语言模型计数瓶颈：看得到，却说不出

ICML 2026 | 揭开视觉语言模型计数瓶颈：看得到，却说不出

专知会员服务

5+阅读 · 5月30日

以色列-美国-伊朗战争中的无人机：关键要点

以色列-美国-伊朗战争中的无人机：关键要点

专知会员服务

4+阅读 · 5月30日

美以伊战争：首次人工智能战争——军事自主性困境

美以伊战争：首次人工智能战争——军事自主性困境

专知会员服务

5+阅读 · 5月30日

《Palantir任务保障性软件安全标准（MA-S2）》

《Palantir任务保障性软件安全标准（MA-S2）》

专知会员服务

14+阅读 · 5月30日

《美海军利用扩展现实增强知识流动研究》300页报告

《美海军利用扩展现实增强知识流动研究》300页报告

专知会员服务

8+阅读 · 5月30日

基于声学的无人机检测技术综述

基于声学的无人机检测技术综述

专知会员服务

8+阅读 · 5月30日

《当代混合战争分析框架：俄乌战争经验教训》

《当代混合战争分析框架：俄乌战争经验教训》

专知会员服务

9+阅读 · 5月30日

生成式AI基础小册子绪论解读：一条数学地基路线，178页pdf

生成式AI基础小册子绪论解读：一条数学地基路线，178页pdf

专知会员服务

12+阅读 · 5月29日

相关VIP内容

大语言模型基准综述

大语言模型基准综述

专知会员服务

27+阅读 · 2025年8月22日

基于文本引导的分子发现中大型语言模型综述：从分子生成到优化

基于文本引导的分子发现中大型语言模型综述：从分子生成到优化

专知会员服务

7+阅读 · 2025年5月24日

基于大语言模型的知识图谱逻辑规则挖掘框架及应用

基于大语言模型的知识图谱逻辑规则挖掘框架及应用

专知会员服务

27+阅读 · 2025年5月22日

面向统计学家的大型语言模型概述

面向统计学家的大型语言模型概述

专知会员服务

32+阅读 · 2025年3月16日

【ICLR2024】3D-MoLM：增强语言模型对分子3D空间结构的理解

【ICLR2024】3D-MoLM：增强语言模型对分子3D空间结构的理解

专知会员服务

12+阅读 · 2024年2月29日

科学语言建模：大型语言模型在分子科学中的量化综述

科学语言建模：大型语言模型在分子科学中的量化综述

专知会员服务

31+阅读 · 2024年2月8日

【博士论文】负责任大型语言模型:安全性、公平性、可信性，142页pdf

【博士论文】负责任大型语言模型:安全性、公平性、可信性，142页pdf

专知会员服务

34+阅读 · 2024年1月26日

【哈佛大学博士论文】《大语言模型的结构建模》，132页pdf

【哈佛大学博士论文】《大语言模型的结构建模》，132页pdf

专知会员服务

46+阅读 · 2024年1月25日

分子表示如何用图学习？圣母大学等《图分子表示学习》最新简明综述，表述方法、数据集、应用等

分子表示如何用图学习？圣母大学等《图分子表示学习》最新简明综述，表述方法、数据集、应用等

专知会员服务

27+阅读 · 2022年7月12日

【ICLR2022】MIT最新论文《用于分子生成的数据高效图文法学习》，用图文法生成新分子，Data-Efficient Graph Grammar Learning for Molecular Generation

【ICLR2022】MIT最新论文《用于分子生成的数据高效图文法学习》，用图文法生成新分子，Data-Efficient Graph Grammar Learning for Molecular Generation

专知会员服务

14+阅读 · 2022年4月10日

热门VIP内容

开通专知VIP会员享更多权益服务

比利时发布用于实时战场军事装备识别的离线人工智能系统

超越网格：作战环境对炮兵的影响

美以伊冲突中的人工智能应用：人工智能工具、部署策略及作战影响分析

《经济冲击与战略损失：美伊军事冲突的不可持续成本》

相关资讯

【Manning新书】大规模数据结构和算法，306页pdf

【Manning新书】大规模数据结构和算法，306页pdf

专知

14+阅读 · 2022年5月30日

《文本分类大综述：从浅层到深度学习》最新2020版35页pdf

《文本分类大综述：从浅层到深度学习》最新2020版35页pdf

专知

59+阅读 · 2020年8月6日

Video Description视频描述综述论文-方法、数据集和评估指标，UWA

Video Description视频描述综述论文-方法、数据集和评估指标，UWA

专知

38+阅读 · 2020年3月5日

【综述】3D数据分类深度学习方法综述，25页论文带你全面了解最新进展

【综述】3D数据分类深度学习方法综述，25页论文带你全面了解最新进展

中国人工智能学会

20+阅读 · 2019年7月17日

最全中文自然语言处理数据集、平台和工具整理

最全中文自然语言处理数据集、平台和工具整理

深度学习与NLP

34+阅读 · 2019年6月22日

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

AI科技评论

12+阅读 · 2019年5月2日

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

机器之心

15+阅读 · 2019年3月18日

自然语言处理（NLP）知识结构总结

自然语言处理（NLP）知识结构总结

AI100

51+阅读 · 2018年8月17日

基于深度学习的文本分类6大算法-原理、结构、论文、源码打包分享

基于深度学习的文本分类6大算法-原理、结构、论文、源码打包分享

深度学习与NLP

25+阅读 · 2018年7月18日

论文报告 | Graph-based Neural Multi-Document Summarization

论文报告 | Graph-based Neural Multi-Document Summarization

科技创新与创业

15+阅读 · 2017年12月15日

相关论文

Modelling Language using Large Language Models

Arxiv

0+阅读 · 3月11日

De novo molecular structure elucidation from mass spectra via flow matching

Arxiv

0+阅读 · 2月23日

LogiPart: Local Large Language Models for Data Exploration at Scale with Logical Partitioning

Arxiv

0+阅读 · 2月17日

DALL: Data Labeling via Data Programming and Active Learning Enhanced by Large Language Models

Arxiv

0+阅读 · 2月15日

OmniScience: A Large-scale Multi-modal Dataset for Scientific Image Understanding

Arxiv

0+阅读 · 2月14日

Benchmarking Large Language Models for Knowledge Graph Validation

Arxiv

0+阅读 · 2月11日

LLM Reasoning Predicts When Models Are Right: Evidence from Coding Classroom Discourse

Arxiv

0+阅读 · 2月10日

Hybrid Pooling with LLMs via Relevance Context Learning

Arxiv

0+阅读 · 2月9日

Orthogonal Hierarchical Decomposition for Structure-Aware Table Understanding with Large Language Models

Arxiv

0+阅读 · 2月2日

A Survey of Large Language Models

A Survey of Large Language Models

Arxiv

501+阅读 · 2023年3月31日

相关基金

大规模分数阶微分系统的高性能并行算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

含非正态及缺失数据的结构方程模型分析

国家自然科学基金

0+阅读 · 2015年12月31日

可扩展的蛋白质组学大数据存储与分析模型研究

国家自然科学基金

1+阅读 · 2015年12月31日

面向大规模分布式一致性最优化问题的结构型一阶求解算法研究

国家自然科学基金

1+阅读 · 2015年12月31日

方差正则化的分类模型选择方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

数据内在结构和稀疏保持的大间隔分类方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

大数据环境下基于量子计算的非结构化数据关键问题的研究

国家自然科学基金

2+阅读 · 2015年12月31日

面向异分布数据的主动学习方法

国家自然科学基金

12+阅读 · 2015年12月31日

重油组成矩阵的分子水平构建及基于结构导向集总的催化裂化反应动力学模型

国家自然科学基金

0+阅读 · 2014年12月31日

生物网络的可计算建模

国家自然科学基金

2+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员