报告LLM提示在自动化软件工程中的应用：基于当前实践与期望的指南 (Reporting LLM Prompting in Automated Software Engineering: A Guideline Based on Current Practices and Expectations) - 专知论文

会员服务 ·

0

软件 · 软件工程 · 指南 · 自动化 · 报告 ·

Reporting LLM Prompting in Automated Software Engineering: A Guideline Based on Current Practices and Expectations

翻译：报告LLM提示在自动化软件工程中的应用：基于当前实践与期望的指南

Alexander Korn,Lea Zaruchas,Chetan Arora,Andreas Metzger,Sven Smolka,Fanyu Wang,Andreas Vogelsang

from arxiv, To be published at The 3rd ACM International Conference on AI Foundation Models and Software Engineering FORGE 2026

Large Language Models, particularly decoder-only generative models such as GPT, are increasingly used to automate Software Engineering tasks. These models are primarily guided through natural language prompts, making prompt engineering a critical factor in system performance and behavior. Despite their growing role in SE research, prompt-related decisions are rarely documented in a systematic or transparent manner, hindering reproducibility and comparability across studies. To address this gap, we conducted a two-phase empirical study. First, we analyzed nearly 300 papers published at the top-3 SE conferences since 2022 to assess how prompt design, testing, and optimization are currently reported. Second, we surveyed 105 program committee members from these conferences to capture their expectations for prompt reporting in LLM-driven research. Based on the findings, we derived a structured guideline that distinguishes essential, desirable, and exceptional reporting elements. Our results reveal significant misalignment between current practices and reviewer expectations, particularly regarding version disclosure, prompt justification, and threats to validity. We present our guideline as a step toward improving transparency, reproducibility, and methodological rigor in LLM-based SE research.

翻译：大型语言模型，特别是仅解码器的生成模型（如GPT），正日益广泛地应用于自动化软件工程任务。这些模型主要通过自然语言提示进行引导，使得提示工程成为影响系统性能和行为的关键因素。尽管LLM在软件工程研究中的作用日益重要，但与提示相关的决策很少以系统或透明的方式记录，这阻碍了研究间的可复现性和可比性。为弥补这一不足，我们开展了一项两阶段的实证研究。首先，我们分析了自2022年以来在三大顶级软件工程会议上发表的近300篇论文，以评估当前如何报告提示设计、测试和优化。其次，我们调查了来自这些会议的105位程序委员会成员，以了解他们对LLM驱动研究中提示报告的期望。基于研究结果，我们制定了一份结构化指南，区分了必需、期望和卓越的报告要素。我们的研究揭示了当前实践与评审者期望之间存在显著偏差，尤其是在版本披露、提示理由说明以及有效性威胁方面。我们提出此指南，旨在推动基于LLM的软件工程研究在透明度、可复现性和方法严谨性方面取得进步。

0

相关内容

软件（中国大陆及香港用语，台湾作软体，英文：Software）是一系列按照特定顺序组织的计算机数据和指令的集合。一般来讲软件被划分为编程语言、系统软件、应用软件和介于这两者之间的中间件。软件就是程序加文档的集合体。

【新书】设计大型语言模型应用：一种面向LLMs的整体方法

【新书】设计大型语言模型应用：一种面向LLMs的整体方法

专知会员服务

55+阅读 · 2025年3月16日

从基础到突破的LLM微调终极指南：技术、研究、最佳实践、应用研究挑战与机遇的全面综述

从基础到突破的LLM微调终极指南：技术、研究、最佳实践、应用研究挑战与机遇的全面综述

专知会员服务

55+阅读 · 2024年11月17日

大型语言模型在不同自然语言处理任务中的提示工程方法综述

大型语言模型在不同自然语言处理任务中的提示工程方法综述

专知会员服务

60+阅读 · 2024年7月21日

《大型语言模型 (LLM) 对比研究》美海军最新报告

《大型语言模型 (LLM) 对比研究》美海军最新报告

专知会员服务

85+阅读 · 2024年6月28日

【新书】构建LLM应用：使用大型语言模型创建智能应用和代理，312页pdf

【新书】构建LLM应用：使用大型语言模型创建智能应用和代理，312页pdf

专知会员服务

100+阅读 · 2024年6月15日

【新书】ChatGPT与大型语言模型(LLMs)的提示工程：通过有效的提示设计增强ChatGPT响应

【新书】ChatGPT与大型语言模型(LLMs)的提示工程：通过有效的提示设计增强ChatGPT响应

专知会员服务

81+阅读 · 2024年3月25日

【NeurIPS2023】LLM 用于半自动数据科学：介绍 CAAFE，一种具有上下文感知的自动特征工程方法

【NeurIPS2023】LLM 用于半自动数据科学：介绍 CAAFE，一种具有上下文感知的自动特征工程方法

专知会员服务

37+阅读 · 2023年10月3日

【2023新书】《开发人员的LLM提示工程：揭开LLM真正潜力的艺术与科学》，302页pdf

【2023新书】《开发人员的LLM提示工程：揭开LLM真正潜力的艺术与科学》，302页pdf

专知会员服务

151+阅读 · 2023年9月22日

大模型如何革新软件工程？华中科大等最新《面向软件工程的大型语言模型》综述，回顾229篇文献综述LLM+SE技术体系

大模型如何革新软件工程？华中科大等最新《面向软件工程的大型语言模型》综述，回顾229篇文献综述LLM+SE技术体系

专知会员服务

103+阅读 · 2023年8月31日

ChatGPT中的提示工程(Prompt)怎么做？DAIR.AI最新《提示工程指南》，全面讲述提示技术，附书册课件视频

ChatGPT中的提示工程(Prompt)怎么做？DAIR.AI最新《提示工程指南》，全面讲述提示技术，附书册课件视频

专知会员服务

235+阅读 · 2023年3月20日

【ChatGPT系列报告】ChatGPT/GPT-4 如何赋能应用，31页pdf

【ChatGPT系列报告】ChatGPT/GPT-4 如何赋能应用，31页pdf

专知

29+阅读 · 2023年4月9日

194篇文献调研ChatGPT最新研究进展！最新《ChatGPT/GPT-4研究综述及对大型语言模型未来的展望》国内外研究者编著

194篇文献调研ChatGPT最新研究进展！最新《ChatGPT/GPT-4研究综述及对大型语言模型未来的展望》国内外研究者编著

专知

25+阅读 · 2023年4月7日

从T5到GPT-4最新最全梳理，人大等《大型语言模型综述》，51页pdf详述大模型进展

从T5到GPT-4最新最全梳理，人大等《大型语言模型综述》，51页pdf详述大模型进展

专知

25+阅读 · 2023年4月4日

最新必读【预训练语言模型(BERT/XLNet等)】论文，Google/微软/华为ICLR2020提交论文

最新必读【预训练语言模型(BERT/XLNet等)】论文，Google/微软/华为ICLR2020提交论文

专知

36+阅读 · 2019年9月29日

【清华大学NLP】预训练语言模型（PLM）必读论文清单，附论文PDF、源码和模型链接

【清华大学NLP】预训练语言模型（PLM）必读论文清单，附论文PDF、源码和模型链接

专知

40+阅读 · 2019年9月27日

概述自动机器学习（AutoML）

概述自动机器学习（AutoML）

人工智能学家

19+阅读 · 2019年8月11日

NLP-Progress记录NLP最新数据集、论文和代码: 助你紧跟NLP前沿

NLP-Progress记录NLP最新数据集、论文和代码: 助你紧跟NLP前沿

专知

17+阅读 · 2018年11月15日

自然语言处理中的语言模型预训练方法

自然语言处理中的语言模型预训练方法

PaperWeekly

14+阅读 · 2018年10月21日

NLG ≠ 机器写作 | 专家专栏

NLG ≠ 机器写作 | 专家专栏

量子位

13+阅读 · 2018年9月10日

模型汇总24 - 深度学习中Attention Mechanism详细介绍：原理、分类及应用

模型汇总24 - 深度学习中Attention Mechanism详细介绍：原理、分类及应用

深度学习与NLP

12+阅读 · 2017年11月30日

软件定义网络（SDN）环境下基于机器学习的路由预规划研究

国家自然科学基金

6+阅读 · 2015年12月31日

数据驱动关键性能指标相关的故障诊断方法研究

国家自然科学基金

4+阅读 · 2015年12月31日

面向Bug报告的软件故障重现方法研究

国家自然科学基金

4+阅读 · 2015年12月31日

基于犹豫模糊语言信息的定性决策理论与方法

国家自然科学基金

2+阅读 · 2015年12月31日

工业过程动态数据的多模型在线重构研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于代数结构及公理语义的泛型约束方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向全生命周期的可信软件测度模型和过程改进工具研究

国家自然科学基金

0+阅读 · 2014年12月31日

千万自由度量级并行有限元模态和振动分析软件研发

国家自然科学基金

0+阅读 · 2014年12月31日

基于构件的可信软件构造及其行为动态可信测评

国家自然科学基金

1+阅读 · 2014年12月31日

支持软件可信演化的故障定位研究

国家自然科学基金

0+阅读 · 2014年12月31日

Failure-Aware Enhancements for Large Language Model (LLM) Code Generation: An Empirical Study on Decision Framework

Arxiv

0+阅读 · 2月2日

LLM-AutoDP: Automatic Data Processing via LLM Agents for Model Fine-tuning

Arxiv

0+阅读 · 1月28日

Promptware Engineering: Software Engineering for Prompt-Enabled Systems

Arxiv

0+阅读 · 1月27日

REprompt: Prompt Generation for Intelligent Software Development Guided by Requirements Engineering

Arxiv

0+阅读 · 1月23日

LLM Prompt Evaluation for Educational Applications

Arxiv

0+阅读 · 1月22日

Guidelines to Prompt Large Language Models for Code Generation: An Empirical Characterization

Arxiv

0+阅读 · 1月19日

LLM-Based Agentic Systems for Software Engineering: Challenges and Opportunities

Arxiv

0+阅读 · 1月14日

STELP: Secure Transpilation and Execution of LLM-Generated Programs

Arxiv

0+阅读 · 1月13日

Modular Autonomy with Conversational Interaction: An LLM-driven Framework for Decision Making in Autonomous Driving

Arxiv

0+阅读 · 1月9日

STELP: Secure Transpilation and Execution of LLM-Generated Programs

Arxiv

0+阅读 · 1月9日

VIP会员

文章信息

相关主题

相关VIP内容

【新书】设计大型语言模型应用：一种面向LLMs的整体方法

【新书】设计大型语言模型应用：一种面向LLMs的整体方法

专知会员服务

55+阅读 · 2025年3月16日

从基础到突破的LLM微调终极指南：技术、研究、最佳实践、应用研究挑战与机遇的全面综述

从基础到突破的LLM微调终极指南：技术、研究、最佳实践、应用研究挑战与机遇的全面综述

专知会员服务

55+阅读 · 2024年11月17日

大型语言模型在不同自然语言处理任务中的提示工程方法综述

大型语言模型在不同自然语言处理任务中的提示工程方法综述

专知会员服务

60+阅读 · 2024年7月21日

《大型语言模型 (LLM) 对比研究》美海军最新报告

《大型语言模型 (LLM) 对比研究》美海军最新报告

专知会员服务

85+阅读 · 2024年6月28日

【新书】构建LLM应用：使用大型语言模型创建智能应用和代理，312页pdf

【新书】构建LLM应用：使用大型语言模型创建智能应用和代理，312页pdf

专知会员服务

100+阅读 · 2024年6月15日

【新书】ChatGPT与大型语言模型(LLMs)的提示工程：通过有效的提示设计增强ChatGPT响应

【新书】ChatGPT与大型语言模型(LLMs)的提示工程：通过有效的提示设计增强ChatGPT响应

专知会员服务

81+阅读 · 2024年3月25日

【NeurIPS2023】LLM 用于半自动数据科学：介绍 CAAFE，一种具有上下文感知的自动特征工程方法

【NeurIPS2023】LLM 用于半自动数据科学：介绍 CAAFE，一种具有上下文感知的自动特征工程方法

专知会员服务

37+阅读 · 2023年10月3日

【2023新书】《开发人员的LLM提示工程：揭开LLM真正潜力的艺术与科学》，302页pdf

【2023新书】《开发人员的LLM提示工程：揭开LLM真正潜力的艺术与科学》，302页pdf

专知会员服务

151+阅读 · 2023年9月22日

大模型如何革新软件工程？华中科大等最新《面向软件工程的大型语言模型》综述，回顾229篇文献综述LLM+SE技术体系

大模型如何革新软件工程？华中科大等最新《面向软件工程的大型语言模型》综述，回顾229篇文献综述LLM+SE技术体系

专知会员服务

103+阅读 · 2023年8月31日

ChatGPT中的提示工程(Prompt)怎么做？DAIR.AI最新《提示工程指南》，全面讲述提示技术，附书册课件视频

ChatGPT中的提示工程(Prompt)怎么做？DAIR.AI最新《提示工程指南》，全面讲述提示技术，附书册课件视频

专知会员服务

235+阅读 · 2023年3月20日

热门VIP内容

开通专知VIP会员享更多权益服务

【CMU博士论文】基于自适应表征的高效视觉建模

《多域作战中融合网络、电子战与动能机动》

AI智能体时代大模型安全风险与攻防新挑战

迈向个性化大语言模型驱动的智能体：基础、评估与未来方向

相关资讯

【ChatGPT系列报告】ChatGPT/GPT-4 如何赋能应用，31页pdf

【ChatGPT系列报告】ChatGPT/GPT-4 如何赋能应用，31页pdf

专知

29+阅读 · 2023年4月9日

194篇文献调研ChatGPT最新研究进展！最新《ChatGPT/GPT-4研究综述及对大型语言模型未来的展望》国内外研究者编著

194篇文献调研ChatGPT最新研究进展！最新《ChatGPT/GPT-4研究综述及对大型语言模型未来的展望》国内外研究者编著

专知

25+阅读 · 2023年4月7日

从T5到GPT-4最新最全梳理，人大等《大型语言模型综述》，51页pdf详述大模型进展

从T5到GPT-4最新最全梳理，人大等《大型语言模型综述》，51页pdf详述大模型进展

专知

25+阅读 · 2023年4月4日

最新必读【预训练语言模型(BERT/XLNet等)】论文，Google/微软/华为ICLR2020提交论文

最新必读【预训练语言模型(BERT/XLNet等)】论文，Google/微软/华为ICLR2020提交论文

专知

36+阅读 · 2019年9月29日

【清华大学NLP】预训练语言模型（PLM）必读论文清单，附论文PDF、源码和模型链接

【清华大学NLP】预训练语言模型（PLM）必读论文清单，附论文PDF、源码和模型链接

专知

40+阅读 · 2019年9月27日

概述自动机器学习（AutoML）

概述自动机器学习（AutoML）

人工智能学家

19+阅读 · 2019年8月11日

NLP-Progress记录NLP最新数据集、论文和代码: 助你紧跟NLP前沿

NLP-Progress记录NLP最新数据集、论文和代码: 助你紧跟NLP前沿

专知

17+阅读 · 2018年11月15日

自然语言处理中的语言模型预训练方法

自然语言处理中的语言模型预训练方法

PaperWeekly

14+阅读 · 2018年10月21日

NLG ≠ 机器写作 | 专家专栏

NLG ≠ 机器写作 | 专家专栏

量子位

13+阅读 · 2018年9月10日

模型汇总24 - 深度学习中Attention Mechanism详细介绍：原理、分类及应用

模型汇总24 - 深度学习中Attention Mechanism详细介绍：原理、分类及应用

深度学习与NLP

12+阅读 · 2017年11月30日

相关论文

Failure-Aware Enhancements for Large Language Model (LLM) Code Generation: An Empirical Study on Decision Framework

Arxiv

0+阅读 · 2月2日

LLM-AutoDP: Automatic Data Processing via LLM Agents for Model Fine-tuning

Arxiv

0+阅读 · 1月28日

Promptware Engineering: Software Engineering for Prompt-Enabled Systems

Arxiv

0+阅读 · 1月27日

REprompt: Prompt Generation for Intelligent Software Development Guided by Requirements Engineering

Arxiv

0+阅读 · 1月23日

LLM Prompt Evaluation for Educational Applications

Arxiv

0+阅读 · 1月22日

Guidelines to Prompt Large Language Models for Code Generation: An Empirical Characterization

Arxiv

0+阅读 · 1月19日

LLM-Based Agentic Systems for Software Engineering: Challenges and Opportunities

Arxiv

0+阅读 · 1月14日

STELP: Secure Transpilation and Execution of LLM-Generated Programs

Arxiv

0+阅读 · 1月13日

Modular Autonomy with Conversational Interaction: An LLM-driven Framework for Decision Making in Autonomous Driving

Arxiv

0+阅读 · 1月9日

STELP: Secure Transpilation and Execution of LLM-Generated Programs

Arxiv

0+阅读 · 1月9日

相关基金

软件定义网络（SDN）环境下基于机器学习的路由预规划研究

国家自然科学基金

6+阅读 · 2015年12月31日

数据驱动关键性能指标相关的故障诊断方法研究

国家自然科学基金

4+阅读 · 2015年12月31日

面向Bug报告的软件故障重现方法研究

国家自然科学基金

4+阅读 · 2015年12月31日

基于犹豫模糊语言信息的定性决策理论与方法

国家自然科学基金

2+阅读 · 2015年12月31日

工业过程动态数据的多模型在线重构研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于代数结构及公理语义的泛型约束方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向全生命周期的可信软件测度模型和过程改进工具研究

国家自然科学基金

0+阅读 · 2014年12月31日

千万自由度量级并行有限元模态和振动分析软件研发

国家自然科学基金

0+阅读 · 2014年12月31日

基于构件的可信软件构造及其行为动态可信测评

国家自然科学基金

1+阅读 · 2014年12月31日

支持软件可信演化的故障定位研究

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员