Assessing Reproducibility in Evolutionary Computation: A Case Study using Human- and LLM-based Assessment - 专知论文

会员服务 ·

0

可复现性 · 复现性 · 进化计算 · 论文 · 系统 ·

Assessing Reproducibility in Evolutionary Computation: A Case Study using Human- and LLM-based Assessment

翻译：评估进化计算中的可复现性：基于人工与LLM评估的案例研究

Francesca Da Ros,Tarik Začiragić,Aske Plaat,Thomas Bäck,Niki van Stein

Reproducibility is an important requirement in evolutionary computation, where results largely depend on computational experiments. In practice, reproducibility relies on how algorithms, experimental protocols, and artifacts are documented and shared. Despite growing awareness, there is still limited empirical evidence on the actual reproducibility levels of published work in the field. In this paper, we study the reproducibility practices in papers published in the Evolutionary Combinatorial Optimization and Metaheuristics track of the Genetic and Evolutionary Computation Conference over a ten-year period. We introduce a structured reproducibility checklist and apply it through a systematic manual assessment of the selected corpus. In addition, we propose RECAP (REproducibility Checklist Automation Pipeline), an LLM-based system that automatically evaluates reproducibility signals from paper text and associated code repositories. Our analysis shows that papers achieve an average completeness score of 0.62, and that 36.90% of them provide additional material beyond the manuscript itself. We demonstrate that automated assessment is feasible: RECAP achieves substantial agreement with human evaluators (Cohen's k of 0.67). Together, these results highlight persistent gaps in reproducibility reporting and suggest that automated tools can effectively support large-scale, systematic monitoring of reproducibility practices.

翻译：可复现性是进化计算领域的重要要求，该领域的研究结果在很大程度上依赖于计算实验。在实践中，可复现性取决于算法、实验方案及研究产物的记录与共享方式。尽管相关意识日益增强，但关于该领域已发表工作的实际可复现水平仍缺乏充分的实证证据。本文研究了遗传与进化计算会议中进化组合优化与元启发式专题十年间发表论文的可复现实践。我们引入结构化可复现性检查清单，通过对选定文献集的系统性人工评估加以应用。此外，我们提出了RECAP（可复现性检查清单自动化流程）——一个基于LLM的系统，可自动从论文文本及相关代码仓库中评估可复现性信号。分析表明，论文的平均完整性得分为0.62，其中36.90%的论文提供了稿件本身之外的补充材料。我们证明自动化评估具有可行性：RECAP与人工评估者达成显著一致性（Cohen's k系数为0.67）。这些结果共同揭示了可复现性报告中持续存在的缺口，并表明自动化工具能有效支持大规模、系统化的可复现实践监测。

0

相关内容

可复现性

《人工智能辅助决策中的数据可视化：系统性综述》

《人工智能辅助决策中的数据可视化：系统性综述》

专知会员服务

27+阅读 · 2025年8月22日

机器学习可解释如何客观评估？CMU-Yeh博士论文《可解释机器学习的客观标准》，148页pdf

机器学习可解释如何客观评估？CMU-Yeh博士论文《可解释机器学习的客观标准》，148页pdf

专知会员服务

79+阅读 · 2022年11月23日

什么是进化深度学习？东北大学等最新《进化深度学习:原理、算法、应用》综述，34页pdf阐述EDL概念以及技术体系

什么是进化深度学习？东北大学等最新《进化深度学习:原理、算法、应用》综述，34页pdf阐述EDL概念以及技术体系

专知会员服务

79+阅读 · 2022年9月1日

结合进化算法的深度强化学习方法研究综述

结合进化算法的深度强化学习方法研究综述

专知会员服务

81+阅读 · 2022年7月16日

阿姆斯特丹大学等最新ACL2022教程《自然语言处理可复现性研究》

阿姆斯特丹大学等最新ACL2022教程《自然语言处理可复现性研究》

专知会员服务

14+阅读 · 2022年5月27日

约束进化算法及其应用研究综述

专知会员服务

26+阅读 · 2021年4月21日

基于神经进化的深度学习模型研究综述

专知会员服务

41+阅读 · 2021年3月3日

机器学习的可解释性

机器学习的可解释性

专知会员服务

179+阅读 · 2020年8月27日

你的论文可复现么？这个视频报告《机器学习中的复现性:从理论到实践》带你做复现研究，84页ppt

你的论文可复现么？这个视频报告《机器学习中的复现性:从理论到实践》带你做复现研究，84页ppt

专知会员服务

48+阅读 · 2020年8月8日

可解释强化学习，Explainable Reinforcement Learning: A Survey

可解释强化学习，Explainable Reinforcement Learning: A Survey

专知会员服务

132+阅读 · 2020年5月14日

3D Human相关研究总结：人体、姿态估计、人体重建等

3D Human相关研究总结：人体、姿态估计、人体重建等

PaperWeekly

27+阅读 · 2021年3月1日

深度学习可解释性研究进展

深度学习可解释性研究进展

专知

19+阅读 · 2020年6月26日

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

AINLP

19+阅读 · 2020年6月14日

集大成者！可解释人工智能(XAI)研究最新进展万字综述论文: 概念体系机遇和挑战—构建负责任的人工智能

集大成者！可解释人工智能(XAI)研究最新进展万字综述论文: 概念体系机遇和挑战—构建负责任的人工智能

专知

38+阅读 · 2019年12月27日

【Awesome】最全的机器学习可解释性资料（machine-learning-interpretability）

【Awesome】最全的机器学习可解释性资料（machine-learning-interpretability）

专知

29+阅读 · 2019年3月1日

美国DARPA204页可解释人工智能文献综述论文《Explanation in Human-AI Systems》

美国DARPA204页可解释人工智能文献综述论文《Explanation in Human-AI Systems》

专知

11+阅读 · 2019年2月8日

类脑计算的前沿论文，看我们推荐的这7篇

类脑计算的前沿论文，看我们推荐的这7篇

人工智能前沿讲习班

21+阅读 · 2019年1月7日

复现一篇深度强化学习论文之后，我学到了什么

复现一篇深度强化学习论文之后，我学到了什么

论智

16+阅读 · 2018年4月11日

Uber AI实验室：遗传算法PK随机梯度下降，欢迎来到深度神经进化时代！

Uber AI实验室：遗传算法PK随机梯度下降，欢迎来到深度神经进化时代！

论智

10+阅读 · 2017年12月19日

GAFT：一个使用 Python 实现的遗传算法框架

GAFT：一个使用 Python 实现的遗传算法框架

Python开发者

10+阅读 · 2017年8月1日

微进化机制中群体基因组数据分析的新方法研究

国家自然科学基金

0+阅读 · 2016年12月31日

基于进化算法的大规模本体匹配问题研究

国家自然科学基金

3+阅读 · 2015年12月31日

人类转录因子基因家族调控网络进化模式研究

国家自然科学基金

0+阅读 · 2015年12月31日

复杂工程产品基于多可信度近似的设计优化研究

国家自然科学基金

0+阅读 · 2015年12月31日

个性化特征大数据支持下的交互式进化计算及其应用

国家自然科学基金

1+阅读 · 2015年12月31日

进化算法行为分析及应用

国家自然科学基金

1+阅读 · 2015年12月31日

云移植中遗留系统组件重用研究

国家自然科学基金

0+阅读 · 2014年12月31日

生命起源过程中“标签介导的遗传信息复制和表达的出现及演化”的计算机模拟研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向全生命周期的可信软件测度模型和过程改进工具研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向进化基因组学的高通量测序数据流形建模

国家自然科学基金

1+阅读 · 2014年12月31日

LLEMA: Evolutionary Search with LLMs for Multi-Objective Materials Discovery

Arxiv

0+阅读 · 3月5日

Learning to Evolve for Optimization via Stability-Inducing Neural Unrolling

Arxiv

0+阅读 · 3月3日

From Guidelines to Practice: Evaluating the Reproducibility of Methods in Computational Social Science

Arxiv

0+阅读 · 3月3日

Scaling Reproducibility: An AI-Assisted Workflow for Large-Scale Reanalysis

Arxiv

0+阅读 · 2月17日

Evolution With Purpose: Hierarchy-Informed Optimization of Whole-Brain Models

Arxiv

0+阅读 · 2月13日

Evolutionary Generative Optimization: Towards Fully Data-Driven Evolutionary Optimization via Generative Learning

Arxiv

0+阅读 · 2月13日

From Guidelines to Practice: Evaluating the Reproducibility of Methods in Computational Social Science

Arxiv

0+阅读 · 2月13日

Evolution With Purpose: Hierarchy-Informed Optimization of Whole-Brain Models

Arxiv

0+阅读 · 2月11日

Automating Computational Reproducibility in Social Science: Comparing Prompt-Based and Agent-Based Approaches

Arxiv

0+阅读 · 2月9日

Overcoming Barriers to Computational Reproducibility

Arxiv

0+阅读 · 1月27日

VIP会员

文章信息

相关主题

最新内容

【NTU博士论文】3D人体动作生成

【NTU博士论文】3D人体动作生成

专知会员服务

1+阅读 · 今天14:48

DeepSeek-V4：百万 Token 上下文背后，大模型正在进入“长程智能”时代（附中英文pdf版）

DeepSeek-V4：百万 Token 上下文背后，大模型正在进入“长程智能”时代（附中英文pdf版）

专知会员服务

1+阅读 · 今天14:38

以色列军事技术对美国军力发展的持续性赋能

以色列军事技术对美国军力发展的持续性赋能

专知会员服务

7+阅读 · 今天8:46

战场之外的较量：美伊冲突中的认知战与心理博弈

战场之外的较量：美伊冲突中的认知战与心理博弈

专知会员服务

5+阅读 · 今天7:41

俄乌战争中乌克兰防空能力演变与见解（中文版）

俄乌战争中乌克兰防空能力演变与见解（中文版）

专知会员服务

3+阅读 · 今天7:22

《面向巡飞弹药系统的情境感知深度强化学习自主非线性机动控制》

《面向巡飞弹药系统的情境感知深度强化学习自主非线性机动控制》

专知会员服务

8+阅读 · 今天6:04

《深度强化学习在兵棋推演中的应用》40页报告

《深度强化学习在兵棋推演中的应用》40页报告

专知会员服务

9+阅读 · 今天5:37

《多域作战面临复杂现实》

《多域作战面临复杂现实》

专知会员服务

7+阅读 · 今天5:35

《印度的多域作战：条令与能力发展》报告

《印度的多域作战：条令与能力发展》报告

专知会员服务

3+阅读 · 今天5:24

《是“修复情报”还是修复部队？阿富汗反叛乱行动中的美军情报调整》400页

《是“修复情报”还是修复部队？阿富汗反叛乱行动中的美军情报调整》400页

专知会员服务

3+阅读 · 今天5:18

美军的算法化军备库：无人机优势计划（DDP）、复制者倡议（Replicator）与联合全域指挥控制（JADC2）如何重写战争规则

美军的算法化军备库：无人机优势计划（DDP）、复制者倡议（Replicator）与联合全域指挥控制（JADC2）如何重写战争规则

专知会员服务

3+阅读 · 今天3:25

（中文版）美空军部发布《空军部数据战略》与《人工智能战略》两份战略：旨在加速建立军事优势

（中文版）美空军部发布《空军部数据战略》与《人工智能战略》两份战略：旨在加速建立军事优势

专知会员服务

17+阅读 · 今天2:55

【斯坦福博士论文】语言模型的机械可解释性与控制

【斯坦福博士论文】语言模型的机械可解释性与控制

专知会员服务

4+阅读 · 4月23日

大语言模型智能体长期记忆安全性综述：迈向记忆主权

大语言模型智能体长期记忆安全性综述：迈向记忆主权

专知会员服务

5+阅读 · 4月23日

美军被摧毁的空战装备：伊朗战争如何重创美国空中力量

美军被摧毁的空战装备：伊朗战争如何重创美国空中力量

专知会员服务

5+阅读 · 4月23日

相关VIP内容

《人工智能辅助决策中的数据可视化：系统性综述》

《人工智能辅助决策中的数据可视化：系统性综述》

专知会员服务

27+阅读 · 2025年8月22日

机器学习可解释如何客观评估？CMU-Yeh博士论文《可解释机器学习的客观标准》，148页pdf

机器学习可解释如何客观评估？CMU-Yeh博士论文《可解释机器学习的客观标准》，148页pdf

专知会员服务

79+阅读 · 2022年11月23日

什么是进化深度学习？东北大学等最新《进化深度学习:原理、算法、应用》综述，34页pdf阐述EDL概念以及技术体系

什么是进化深度学习？东北大学等最新《进化深度学习:原理、算法、应用》综述，34页pdf阐述EDL概念以及技术体系

专知会员服务

79+阅读 · 2022年9月1日

结合进化算法的深度强化学习方法研究综述

结合进化算法的深度强化学习方法研究综述

专知会员服务

81+阅读 · 2022年7月16日

阿姆斯特丹大学等最新ACL2022教程《自然语言处理可复现性研究》

阿姆斯特丹大学等最新ACL2022教程《自然语言处理可复现性研究》

专知会员服务

14+阅读 · 2022年5月27日

约束进化算法及其应用研究综述

专知会员服务

26+阅读 · 2021年4月21日

基于神经进化的深度学习模型研究综述

专知会员服务

41+阅读 · 2021年3月3日

机器学习的可解释性

机器学习的可解释性

专知会员服务

179+阅读 · 2020年8月27日

你的论文可复现么？这个视频报告《机器学习中的复现性:从理论到实践》带你做复现研究，84页ppt

你的论文可复现么？这个视频报告《机器学习中的复现性:从理论到实践》带你做复现研究，84页ppt

专知会员服务

48+阅读 · 2020年8月8日

可解释强化学习，Explainable Reinforcement Learning: A Survey

可解释强化学习，Explainable Reinforcement Learning: A Survey

专知会员服务

132+阅读 · 2020年5月14日

热门VIP内容

开通专知VIP会员享更多权益服务

DeepSeek-V4：百万 Token 上下文背后，大模型正在进入“长程智能”时代（附中英文pdf版）

战场之外的较量：美伊冲突中的认知战与心理博弈

【NTU博士论文】3D人体动作生成

以色列军事技术对美国军力发展的持续性赋能

相关资讯

3D Human相关研究总结：人体、姿态估计、人体重建等

3D Human相关研究总结：人体、姿态估计、人体重建等

PaperWeekly

27+阅读 · 2021年3月1日

深度学习可解释性研究进展

深度学习可解释性研究进展

专知

19+阅读 · 2020年6月26日

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

【NIPS2019】Infidelity and Sensitivity：模型可解释性方法的定量评估

AINLP

19+阅读 · 2020年6月14日

集大成者！可解释人工智能(XAI)研究最新进展万字综述论文: 概念体系机遇和挑战—构建负责任的人工智能

集大成者！可解释人工智能(XAI)研究最新进展万字综述论文: 概念体系机遇和挑战—构建负责任的人工智能

专知

38+阅读 · 2019年12月27日

【Awesome】最全的机器学习可解释性资料（machine-learning-interpretability）

【Awesome】最全的机器学习可解释性资料（machine-learning-interpretability）

专知

29+阅读 · 2019年3月1日

美国DARPA204页可解释人工智能文献综述论文《Explanation in Human-AI Systems》

美国DARPA204页可解释人工智能文献综述论文《Explanation in Human-AI Systems》

专知

11+阅读 · 2019年2月8日

类脑计算的前沿论文，看我们推荐的这7篇

类脑计算的前沿论文，看我们推荐的这7篇

人工智能前沿讲习班

21+阅读 · 2019年1月7日

复现一篇深度强化学习论文之后，我学到了什么

复现一篇深度强化学习论文之后，我学到了什么

论智

16+阅读 · 2018年4月11日

Uber AI实验室：遗传算法PK随机梯度下降，欢迎来到深度神经进化时代！

Uber AI实验室：遗传算法PK随机梯度下降，欢迎来到深度神经进化时代！

论智

10+阅读 · 2017年12月19日

GAFT：一个使用 Python 实现的遗传算法框架

GAFT：一个使用 Python 实现的遗传算法框架

Python开发者

10+阅读 · 2017年8月1日

相关论文

LLEMA: Evolutionary Search with LLMs for Multi-Objective Materials Discovery

Arxiv

0+阅读 · 3月5日

Learning to Evolve for Optimization via Stability-Inducing Neural Unrolling

Arxiv

0+阅读 · 3月3日

From Guidelines to Practice: Evaluating the Reproducibility of Methods in Computational Social Science

Arxiv

0+阅读 · 3月3日

Scaling Reproducibility: An AI-Assisted Workflow for Large-Scale Reanalysis

Arxiv

0+阅读 · 2月17日

Evolution With Purpose: Hierarchy-Informed Optimization of Whole-Brain Models

Arxiv

0+阅读 · 2月13日

Evolutionary Generative Optimization: Towards Fully Data-Driven Evolutionary Optimization via Generative Learning

Arxiv

0+阅读 · 2月13日

From Guidelines to Practice: Evaluating the Reproducibility of Methods in Computational Social Science

Arxiv

0+阅读 · 2月13日

Evolution With Purpose: Hierarchy-Informed Optimization of Whole-Brain Models

Arxiv

0+阅读 · 2月11日

Automating Computational Reproducibility in Social Science: Comparing Prompt-Based and Agent-Based Approaches

Arxiv

0+阅读 · 2月9日

Overcoming Barriers to Computational Reproducibility

Arxiv

0+阅读 · 1月27日

相关基金

微进化机制中群体基因组数据分析的新方法研究

国家自然科学基金

0+阅读 · 2016年12月31日

基于进化算法的大规模本体匹配问题研究

国家自然科学基金

3+阅读 · 2015年12月31日

人类转录因子基因家族调控网络进化模式研究

国家自然科学基金

0+阅读 · 2015年12月31日

复杂工程产品基于多可信度近似的设计优化研究

国家自然科学基金

0+阅读 · 2015年12月31日

个性化特征大数据支持下的交互式进化计算及其应用

国家自然科学基金

1+阅读 · 2015年12月31日

进化算法行为分析及应用

国家自然科学基金

1+阅读 · 2015年12月31日

云移植中遗留系统组件重用研究

国家自然科学基金

0+阅读 · 2014年12月31日

生命起源过程中“标签介导的遗传信息复制和表达的出现及演化”的计算机模拟研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向全生命周期的可信软件测度模型和过程改进工具研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向进化基因组学的高通量测序数据流形建模

国家自然科学基金

1+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员