识别科学文本修订的可靠评估指标 (Identifying Reliable Evaluation Metrics for Scientific Text Revision) - 专知论文

会员服务 ·

0

识别 · 评估指标 · 分析 · 大语言模型 · ROUGE ·

Identifying Reliable Evaluation Metrics for Scientific Text Revision

翻译：识别科学文本修订的可靠评估指标

Léane Jourdan,Florian Boudin,Richard Dufour,Nicolas Hernandez

from arxiv, V3 contains the English version, accepted to ACL 2025 main (26 pages). V4 contains the French version (TALN 2025, 32 pages) with corrected results for cramer's v and pairwise accuracy

Evaluating text revision in scientific writing remains a challenge, as traditional metrics such as ROUGE and BERTScore primarily focus on similarity rather than capturing meaningful improvements. In this work, we analyse and identify the limitations of these metrics and explore alternative evaluation methods that better align with human judgments. We first conduct a manual annotation study to assess the quality of different revisions. Then, we investigate reference-free evaluation metrics from related NLP domains. Additionally, we examine LLM-as-a-judge approaches, analysing their ability to assess revisions with and without a gold reference. Our results show that LLMs effectively assess instruction-following but struggle with correctness, while domain-specific metrics provide complementary insights. We find that a hybrid approach combining LLM-as-a-judge evaluation and task-specific metrics offers the most reliable assessment of revision quality.

翻译：评估科学写作中的文本修订仍然是一个挑战，因为传统指标如ROUGE和BERTScore主要关注相似性，而非捕捉有意义的改进。在本工作中，我们分析并识别了这些指标的局限性，并探索了与人类判断更一致的其他评估方法。我们首先进行了一项人工标注研究，以评估不同修订的质量。然后，我们调查了来自相关自然语言处理领域的无参考评估指标。此外，我们研究了LLM-as-a-judge方法，分析了其在有或没有黄金参考的情况下评估修订的能力。我们的结果表明，大语言模型能有效评估指令遵循情况，但在正确性方面存在困难，而领域特定指标则提供了补充性见解。我们发现，结合LLM-as-a-judge评估和任务特定指标的混合方法，为修订质量提供了最可靠的评估。

0

相关内容

231页pdf！最新《生成式基础模型的可信度——指南、评估与展望》

231页pdf！最新《生成式基础模型的可信度——指南、评估与展望》

专知会员服务

38+阅读 · 2025年2月23日

错误信息检测《对错误信息、宣传和谬论的综合注释进行稳健且可解释的识别》美军2023最新88页报告

错误信息检测《对错误信息、宣传和谬论的综合注释进行稳健且可解释的识别》美军2023最新88页报告

专知会员服务

29+阅读 · 2023年9月14日

【KDD2023】科技论文弱监督多标签分类

【KDD2023】科技论文弱监督多标签分类

专知会员服务

21+阅读 · 2023年7月6日

【文献综述】Text Detection and Recognition in the Wild: A Review 自然文本检测与识别

【文献综述】Text Detection and Recognition in the Wild: A Review 自然文本检测与识别

专知会员服务

46+阅读 · 2020年6月11日

还在修改博士论文？这份《博士论文写作技巧》为你指南

还在修改博士论文？这份《博士论文写作技巧》为你指南

专知会员服务

166+阅读 · 2020年6月9日

最近几种小样本元学习简明综述，A Concise Review of Recent Few-shot Meta-learning Methods

最近几种小样本元学习简明综述，A Concise Review of Recent Few-shot Meta-learning Methods

专知会员服务

35+阅读 · 2020年5月25日

【ACL2020-Google】BLEURT:一种基于迁移学习的自然语言生成度量

【ACL2020-Google】BLEURT:一种基于迁移学习的自然语言生成度量

专知会员服务

20+阅读 · 2020年5月12日

【ACL2020-Google】学习鲁棒度量的文本生成，BLEURT: Learning Robust Metrics for Text Generation

【ACL2020-Google】学习鲁棒度量的文本生成，BLEURT: Learning Robust Metrics for Text Generation

专知会员服务

17+阅读 · 2020年4月10日

【AAAI2020】Context-Transformer:上下文转换器:解决对象混淆的小样本检测，Context-Transformer: Tackling Object Confusion for Few-Shot Detection

【AAAI2020】Context-Transformer:上下文转换器:解决对象混淆的小样本检测，Context-Transformer: Tackling Object Confusion for Few-Shot Detection

专知会员服务

51+阅读 · 2020年3月17日

【CCL 2019】如何微调BERT进行文本分类？（How to Fine-Tune BERT for Text Classification?）

【CCL 2019】如何微调BERT进行文本分类？（How to Fine-Tune BERT for Text Classification?）

专知会员服务

84+阅读 · 2019年10月18日

[CVPR 2021] 序列到序列对比学习的文本识别

[CVPR 2021] 序列到序列对比学习的文本识别

专知

10+阅读 · 2021年4月14日

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

AINLP

19+阅读 · 2020年6月14日

基于LSTM模型的学生反馈文本学业情绪识别方法

基于LSTM模型的学生反馈文本学业情绪识别方法

MOOC

17+阅读 · 2019年5月18日

《小样本学习(Few-shot learning)》最新41页综述论文，来自港科大和第四范式

《小样本学习(Few-shot learning)》最新41页综述论文，来自港科大和第四范式

专知

363+阅读 · 2019年4月12日

disentangled-representation-papers

disentangled-representation-papers

CreateAMind

26+阅读 · 2018年9月12日

文本分类又来了，用 Scikit-Learn 解决多类文本分类问题

文本分类又来了，用 Scikit-Learn 解决多类文本分类问题

AI研习社

14+阅读 · 2018年7月22日

深度学习文本分类方法综述（代码）

深度学习文本分类方法综述（代码）

专知

11+阅读 · 2018年6月15日

计算文本相似度常用的四种方法

计算文本相似度常用的四种方法

论智

33+阅读 · 2018年5月18日

文本识别 OCR 浅析：特征篇

文本识别 OCR 浅析：特征篇

开源中国

16+阅读 · 2018年1月6日

微信OCR(1)——公众号图文识别中的文本检测

微信OCR(1)——公众号图文识别中的文本检测

微信AI

17+阅读 · 2017年11月22日

新型荧光DNA修饰碱基的分子设计及其分子识别能力的理论研究

国家自然科学基金

0+阅读 · 2015年12月31日

大型复杂医学领域本体质量评估理论研究

国家自然科学基金

1+阅读 · 2015年12月31日

多标记文本数据流分类方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

网络本体质量及适应性的评估研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于生态演替的文本大数据特征学习研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于业务流程再造的科技期刊数字化出版模式研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向任务成功性的可修系统重要度分析及优化

国家自然科学基金

0+阅读 · 2014年12月31日

面向词汇功能的学术文本语义识别与知识图谱构建

国家自然科学基金

5+阅读 · 2014年12月31日

基于深度学习的机器译文质量估计方法研究

国家自然科学基金

3+阅读 · 2014年12月31日

具有可靠性增长的系统可靠性试验鉴定方法研究

国家自然科学基金

10+阅读 · 2013年12月31日

Modelling and Classifying the Components of a Literature Review

Arxiv

0+阅读 · 2月9日

MedVAL: Toward Expert-Level Medical Text Validation with Language Models

Arxiv

0+阅读 · 2月6日

Grammatical Error Correction Evaluation by Optimally Transporting Edit Representation

Arxiv

0+阅读 · 2月5日

Argument Rarity-based Originality Assessment for AI-Assisted Writing

Arxiv

0+阅读 · 2月2日

EtCon: Edit-then-Consolidate for Reliable Knowledge Editing

Arxiv

0+阅读 · 1月30日

Beyond Correctness: Evaluating Subjective Writing Preferences Across Cultures

Arxiv

0+阅读 · 1月28日

VDE Bench: Evaluating The Capability of Image Editing Models to Modify Visual Documents

Arxiv

0+阅读 · 1月27日

Cross-Examination Framework: A Task-Agnostic Diagnostic for Information Fidelity in Text-to-Text Generation

Arxiv

0+阅读 · 1月27日

SurGE: A Benchmark and Evaluation Framework for Scientific Survey Generation

Arxiv

0+阅读 · 1月18日

Reward Modeling for Scientific Writing Evaluation

Arxiv

0+阅读 · 1月16日

VIP会员

文章信息

相关主题

大语言模型

相关VIP内容

231页pdf！最新《生成式基础模型的可信度——指南、评估与展望》

231页pdf！最新《生成式基础模型的可信度——指南、评估与展望》

专知会员服务

38+阅读 · 2025年2月23日

错误信息检测《对错误信息、宣传和谬论的综合注释进行稳健且可解释的识别》美军2023最新88页报告

错误信息检测《对错误信息、宣传和谬论的综合注释进行稳健且可解释的识别》美军2023最新88页报告

专知会员服务

29+阅读 · 2023年9月14日

【KDD2023】科技论文弱监督多标签分类

【KDD2023】科技论文弱监督多标签分类

专知会员服务

21+阅读 · 2023年7月6日

【文献综述】Text Detection and Recognition in the Wild: A Review 自然文本检测与识别

【文献综述】Text Detection and Recognition in the Wild: A Review 自然文本检测与识别

专知会员服务

46+阅读 · 2020年6月11日

还在修改博士论文？这份《博士论文写作技巧》为你指南

还在修改博士论文？这份《博士论文写作技巧》为你指南

专知会员服务

166+阅读 · 2020年6月9日

最近几种小样本元学习简明综述，A Concise Review of Recent Few-shot Meta-learning Methods

最近几种小样本元学习简明综述，A Concise Review of Recent Few-shot Meta-learning Methods

专知会员服务

35+阅读 · 2020年5月25日

【ACL2020-Google】BLEURT:一种基于迁移学习的自然语言生成度量

【ACL2020-Google】BLEURT:一种基于迁移学习的自然语言生成度量

专知会员服务

20+阅读 · 2020年5月12日

【ACL2020-Google】学习鲁棒度量的文本生成，BLEURT: Learning Robust Metrics for Text Generation

【ACL2020-Google】学习鲁棒度量的文本生成，BLEURT: Learning Robust Metrics for Text Generation

专知会员服务

17+阅读 · 2020年4月10日

【AAAI2020】Context-Transformer:上下文转换器:解决对象混淆的小样本检测，Context-Transformer: Tackling Object Confusion for Few-Shot Detection

【AAAI2020】Context-Transformer:上下文转换器:解决对象混淆的小样本检测，Context-Transformer: Tackling Object Confusion for Few-Shot Detection

专知会员服务

51+阅读 · 2020年3月17日

【CCL 2019】如何微调BERT进行文本分类？（How to Fine-Tune BERT for Text Classification?）

【CCL 2019】如何微调BERT进行文本分类？（How to Fine-Tune BERT for Text Classification?）

专知会员服务

84+阅读 · 2019年10月18日

热门VIP内容

开通专知VIP会员享更多权益服务

《可信人工智能赋能系统的支柱》

《从经典神经网络到不确定性下的拓扑神经网络：军事应用》2026最新40页报告

人工智能赋能边缘与自主系统：美陆军现代化进程聚焦威胁探测与战术边缘情报

《人工智能：对战略与力量的影响》slides

相关资讯

[CVPR 2021] 序列到序列对比学习的文本识别

[CVPR 2021] 序列到序列对比学习的文本识别

专知

10+阅读 · 2021年4月14日

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

AINLP

19+阅读 · 2020年6月14日

基于LSTM模型的学生反馈文本学业情绪识别方法

基于LSTM模型的学生反馈文本学业情绪识别方法

MOOC

17+阅读 · 2019年5月18日

《小样本学习(Few-shot learning)》最新41页综述论文，来自港科大和第四范式

《小样本学习(Few-shot learning)》最新41页综述论文，来自港科大和第四范式

专知

363+阅读 · 2019年4月12日

disentangled-representation-papers

disentangled-representation-papers

CreateAMind

26+阅读 · 2018年9月12日

文本分类又来了，用 Scikit-Learn 解决多类文本分类问题

文本分类又来了，用 Scikit-Learn 解决多类文本分类问题

AI研习社

14+阅读 · 2018年7月22日

深度学习文本分类方法综述（代码）

深度学习文本分类方法综述（代码）

专知

11+阅读 · 2018年6月15日

计算文本相似度常用的四种方法

计算文本相似度常用的四种方法

论智

33+阅读 · 2018年5月18日

文本识别 OCR 浅析：特征篇

文本识别 OCR 浅析：特征篇

开源中国

16+阅读 · 2018年1月6日

微信OCR(1)——公众号图文识别中的文本检测

微信OCR(1)——公众号图文识别中的文本检测

微信AI

17+阅读 · 2017年11月22日

相关论文

Modelling and Classifying the Components of a Literature Review

Arxiv

0+阅读 · 2月9日

MedVAL: Toward Expert-Level Medical Text Validation with Language Models

Arxiv

0+阅读 · 2月6日

Grammatical Error Correction Evaluation by Optimally Transporting Edit Representation

Arxiv

0+阅读 · 2月5日

Argument Rarity-based Originality Assessment for AI-Assisted Writing

Arxiv

0+阅读 · 2月2日

EtCon: Edit-then-Consolidate for Reliable Knowledge Editing

Arxiv

0+阅读 · 1月30日

Beyond Correctness: Evaluating Subjective Writing Preferences Across Cultures

Arxiv

0+阅读 · 1月28日

VDE Bench: Evaluating The Capability of Image Editing Models to Modify Visual Documents

Arxiv

0+阅读 · 1月27日

Cross-Examination Framework: A Task-Agnostic Diagnostic for Information Fidelity in Text-to-Text Generation

Arxiv

0+阅读 · 1月27日

SurGE: A Benchmark and Evaluation Framework for Scientific Survey Generation

Arxiv

0+阅读 · 1月18日

Reward Modeling for Scientific Writing Evaluation

Arxiv

0+阅读 · 1月16日

相关基金

新型荧光DNA修饰碱基的分子设计及其分子识别能力的理论研究

国家自然科学基金

0+阅读 · 2015年12月31日

大型复杂医学领域本体质量评估理论研究

国家自然科学基金

1+阅读 · 2015年12月31日

多标记文本数据流分类方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

网络本体质量及适应性的评估研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于生态演替的文本大数据特征学习研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于业务流程再造的科技期刊数字化出版模式研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向任务成功性的可修系统重要度分析及优化

国家自然科学基金

0+阅读 · 2014年12月31日

面向词汇功能的学术文本语义识别与知识图谱构建

国家自然科学基金

5+阅读 · 2014年12月31日

基于深度学习的机器译文质量估计方法研究

国家自然科学基金

3+阅读 · 2014年12月31日

具有可靠性增长的系统可靠性试验鉴定方法研究

国家自然科学基金

10+阅读 · 2013年12月31日

微信扫码咨询专知VIP会员