Accurate parsing of citations is necessary for machine-readable scholarly infrastructure. But, despite sustained interest in this problem, existing evaluation techniques are often not generalizable, based on synthetic data, or not publicly available. We introduce RenoBench, a public domain benchmark for citation parsing, sourced from PDFs released on four publishing ecosystems: SciELO, Redalyc, the Public Knowledge Project, and Open Research Europe. Starting from 161,000 annotated citations, we apply automated validation and feature-based sampling to produce a dataset of 10,000 citations spanning multiple languages, publication types, and platforms. We then evaluate a variety of citation parsing systems and report field-level precision and recall. Our results show strong performance from language models, particularly when fine-tuned. RenoBench enables reproducible, standardized evaluation of citation parsing systems, and provides a foundation for advancing automated citation parsing and metascientific research.


翻译:引文的精确解析是构建可机读学术基础设施的必要条件。然而,尽管学界对这一课题持续关注,现有评估技术往往缺乏泛化能力、基于合成数据或未公开可用。我们提出RenoBench——一个源自四个出版生态系统(SciELO、Redalyc、公共知识项目及开放研究欧洲)PDF文档的引文解析公开基准数据集。基于16.1万条标注引文,我们通过自动化验证与特征采样生成涵盖多语言、多出版类型及多平台的1万条引文数据集。随后评估多种引文解析系统,并报告字段级精确率与召回率。实验结果表明,语言模型(尤其经微调后)表现优异。RenoBench实现了引文解析系统的可复现标准化评估,为推进自动化引文解析及元科学研究奠定基础。

0
下载
关闭预览

相关内容

华为人大清华最新论文:推荐领域的Benchmark终于出现了?
何恺明的ResNet论文,被引量刚突破10万+
专知会员服务
27+阅读 · 2021年12月19日
可解释强化学习,Explainable Reinforcement Learning: A Survey
专知会员服务
132+阅读 · 2020年5月14日
AAAI 2020论文解读:关注实体以更好地理解文本
AI科技评论
17+阅读 · 2019年11月20日
disentangled-representation-papers
CreateAMind
26+阅读 · 2018年9月12日
一文简述ResNet及其多种变体
机器之心
23+阅读 · 2018年4月22日
行人再识别ReID论文阅读-SPGAN
极市平台
10+阅读 · 2018年2月26日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
9+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
2+阅读 · 2014年12月31日
国家自然科学基金
8+阅读 · 2014年12月31日
国家自然科学基金
5+阅读 · 2014年12月31日
国家自然科学基金
3+阅读 · 2014年12月31日
国家自然科学基金
2+阅读 · 2014年12月31日
VIP会员
最新内容
综述 | 世界动作模型:少做梦,多行动
专知会员服务
2+阅读 · 6月23日
美以伊冲突:无人机与人工智能的运用
专知会员服务
4+阅读 · 6月23日
《特种部队在透明战场中的生存力》最新报告
专知会员服务
3+阅读 · 6月23日
综述 | 3D场景图:开放挑战与未来方向
专知会员服务
8+阅读 · 6月22日
21世纪的无人机战争
专知会员服务
4+阅读 · 6月22日
《量子技术的军事任务技术适配与利用》
专知会员服务
5+阅读 · 6月22日
相关VIP内容
华为人大清华最新论文:推荐领域的Benchmark终于出现了?
何恺明的ResNet论文,被引量刚突破10万+
专知会员服务
27+阅读 · 2021年12月19日
可解释强化学习,Explainable Reinforcement Learning: A Survey
专知会员服务
132+阅读 · 2020年5月14日
相关基金
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
9+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
2+阅读 · 2014年12月31日
国家自然科学基金
8+阅读 · 2014年12月31日
国家自然科学基金
5+阅读 · 2014年12月31日
国家自然科学基金
3+阅读 · 2014年12月31日
国家自然科学基金
2+阅读 · 2014年12月31日
Top
微信扫码咨询专知VIP会员