报告与评审人机交互中LLM集成系统：挑战与考量 (Reporting and Reviewing LLM-Integrated Systems in HCI: Challenges and Considerations) - 专知论文

会员服务 ·

0

交互 · 集成 · 集成系统 · 系统 · 人机交互 ·

Reporting and Reviewing LLM-Integrated Systems in HCI: Challenges and Considerations

翻译：报告与评审人机交互中LLM集成系统：挑战与考量

Karla Felix Navarro,Eugene Syriani,Ian Arawjo

from arxiv, 18 pages, 1 figure, 2 tables. For proposed reporting guidelines, see https://ianarawjo.github.io/Guidelines-for-Reporting-LLM-Integrated-Systems-in-HCI/

What should HCI scholars consider when reporting and reviewing papers that involve LLM-integrated systems? We interview 18 authors of LLM-integrated system papers on their authoring and reviewing experiences. We find that norms of trust-building between authors and reviewers appear to be eroded by the uncertainty of LLM behavior and hyperbolic rhetoric surrounding AI. Authors perceive that reviewers apply uniquely skeptical and inconsistent standards towards papers that report LLM-integrated systems, and mitigate mistrust by adding technical evaluations, justifying usage, and de-emphasizing LLM presence. Authors' views challenge blanket directives to report all prompts and use open models, arguing that prompt reporting is context-dependent and justifying proprietary model usage despite ethical concerns. Finally, some tensions in peer review appear to stem from clashes between the norms and values of HCI and ML/NLP communities, particularly around what constitutes a contribution and an appropriate level of technical rigor. Based on our findings and additional feedback from six expert HCI researchers, we present a set of guidelines and considerations for authors, reviewers, and HCI communities around reporting and reviewing papers that involve LLM-integrated systems.

翻译：人机交互学者在报告和评审涉及LLM集成系统的论文时应考虑哪些因素？我们访谈了18位LLM集成系统论文作者，了解其写作与评审经验。研究发现，由于LLM行为的不确定性及围绕人工智能的夸张论述，作者与评审者之间的信任构建规范似乎受到侵蚀。作者认为评审者对报告LLM集成系统的论文采用了异常怀疑且不一致的标准，并通过增加技术评估、论证使用合理性、弱化LLM存在感等方式缓解不信任。作者的观点挑战了要求报告所有提示词和使用开源模型的笼统指令，主张提示词报告需结合具体情境，并为使用具有伦理争议的专有模型提供辩护。最后，同行评审中的某些矛盾似乎源于人机交互与机器学习/自然语言处理领域在规范与价值观上的冲突，特别是在何为学术贡献以及何种技术严谨程度合适等问题上。基于研究发现及六位人机交互专家的补充反馈，我们为作者、评审者及人机交互学界提出了一套关于报告和评审LLM集成系统论文的指南与考量框架。

0

相关内容

人机协同作战规划：来自美海军陆战队的大语言模型（LLM）使用教训

人机协同作战规划：来自美海军陆战队的大语言模型（LLM）使用教训

专知会员服务

24+阅读 · 2025年10月16日

LLMs与生成式智能体模拟：复杂系统研究的新范式

LLMs与生成式智能体模拟：复杂系统研究的新范式

专知会员服务

27+阅读 · 2025年6月15日

利用多个大型语言模型：关于LLM集成的调研

利用多个大型语言模型：关于LLM集成的调研

专知会员服务

35+阅读 · 2025年2月27日

《以人为中心的大型语言模型（LLM）研究综述》

《以人为中心的大型语言模型（LLM）研究综述》

专知会员服务

41+阅读 · 2024年11月25日

从基础到突破的LLM微调终极指南：技术、研究、最佳实践、应用研究挑战与机遇的全面综述

从基础到突破的LLM微调终极指南：技术、研究、最佳实践、应用研究挑战与机遇的全面综述

专知会员服务

55+阅读 · 2024年11月17日

《美国防部对人工智能和 LLM 编写评估因素的信心与偏见》2024最新275页论文

《美国防部对人工智能和 LLM 编写评估因素的信心与偏见》2024最新275页论文

专知会员服务

63+阅读 · 2024年3月4日

RAG+LLM=？同济大学等最新《大型语言模型的检索增强生成》综述

RAG+LLM=？同济大学等最新《大型语言模型的检索增强生成》综述

专知会员服务

110+阅读 · 2023年12月19日

【LLM/大模型】战争与和平(WarAgent)：基于大模型的世界大战多智能体模拟

【LLM/大模型】战争与和平(WarAgent)：基于大模型的世界大战多智能体模拟

专知会员服务

63+阅读 · 2023年12月6日

如何检测LLM内容？UCSB等最新首篇《LLM生成内容检测》综述

如何检测LLM内容？UCSB等最新首篇《LLM生成内容检测》综述

专知会员服务

49+阅读 · 2023年10月29日

人机协作《评估影响信任校准的因素：信任战略和风险的影响》美空军21页报告

人机协作《评估影响信任校准的因素：信任战略和风险的影响》美空军21页报告

专知会员服务

31+阅读 · 2023年7月18日

【美国陆军】《人工智能系统能否提高陆军任务指挥过程中的信息收集效率？》39页技术报告

【美国陆军】《人工智能系统能否提高陆军任务指挥过程中的信息收集效率？》39页技术报告

专知

50+阅读 · 2022年8月31日

【AI+军事】《用于威胁评估的人工智能工具》加拿大国防研究和发展部技术报告，附中文版pdf

【AI+军事】《用于威胁评估的人工智能工具》加拿大国防研究和发展部技术报告，附中文版pdf

专知

90+阅读 · 2022年4月17日

解读！10篇人机交互领域高引论文合集

解读！10篇人机交互领域高引论文合集

THU数据派

11+阅读 · 2019年11月14日

最新必读【预训练语言模型(BERT/XLNet等)】论文，Google/微软/华为ICLR2020提交论文

最新必读【预训练语言模型(BERT/XLNet等)】论文，Google/微软/华为ICLR2020提交论文

专知

36+阅读 · 2019年9月29日

SMP 2019 第三届中文人机对话技术评测顺利落幕

SMP 2019 第三届中文人机对话技术评测顺利落幕

哈工大SCIR

12+阅读 · 2019年8月19日

人机交互顶级会议CHI2019最佳论文奖出炉！29篇最佳论文！119篇最佳提名论文！

人机交互顶级会议CHI2019最佳论文奖出炉！29篇最佳论文！119篇最佳提名论文！

专知

70+阅读 · 2019年3月17日

干货|85页最新《人机对话系统》神经方法综述论文，微软与谷歌研究员联合出品：

干货|85页最新《人机对话系统》神经方法综述论文，微软与谷歌研究员联合出品：

专知

35+阅读 · 2018年10月7日

深思考人工智能蝉联SMP2018多轮语义对话冠军，报告解读多轮人机对话实现过程

深思考人工智能蝉联SMP2018多轮语义对话冠军，报告解读多轮人机对话实现过程

人工智能学家

15+阅读 · 2018年8月4日

最新人机对话系统简略综述

最新人机对话系统简略综述

专知

26+阅读 · 2018年3月10日

【干货】一文读懂智能对话系统，当前研究综述和未来趋势

【干货】一文读懂智能对话系统，当前研究综述和未来趋势

新智元

13+阅读 · 2018年1月23日

共融机器人战略规划研究和学术交流

国家自然科学基金

13+阅读 · 2016年12月31日

基于人机交互的数据驱动式人群行为建模与仿真研究

国家自然科学基金

4+阅读 · 2015年12月31日

面向聋儿言语康复的多模态人机交互模型及技术研究

国家自然科学基金

3+阅读 · 2015年12月31日

基于不确定性计算的鲁棒风险评估关键技术研究

国家自然科学基金

8+阅读 · 2015年12月31日

随机环境下多个体系统集体行为分析、调控与优化

国家自然科学基金

0+阅读 · 2015年12月31日

基于犹豫模糊语言信息的定性决策理论与方法

国家自然科学基金

2+阅读 · 2015年12月31日

面向交互式问答的省略恢复技术研究

国家自然科学基金

5+阅读 · 2015年12月31日

高速铁路信号系统安全评估基础理论与方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

多语言大数据环境下的复杂网络行为分析、预测和干预

国家自然科学基金

4+阅读 · 2014年12月31日

支持多信息融合的装备体系作战效能评估方法研究

国家自然科学基金

36+阅读 · 2008年12月31日

Key Considerations for Domain Expert Involvement in LLM Design and Evaluation: An Ethnographic Study

Arxiv

0+阅读 · 2月16日

Partnering with Generative AI: Experimental Evaluation of Human-Led and Model-Led Interaction in Human-AI Co-Creation

Arxiv

0+阅读 · 2月9日

Authorship Drift: How Self-Efficacy and Trust Evolve During LLM-Assisted Writing

Arxiv

0+阅读 · 2月5日

HumanLLM: Benchmarking and Improving LLM Anthropomorphism via Human Cognitive Patterns

Arxiv

0+阅读 · 1月30日

HELM: A Human-Centered Evaluation Framework for LLM-Powered Recommender Systems

Arxiv

0+阅读 · 1月27日

Automated structural testing of LLM-based agents: methods, framework, and case studies

Arxiv

0+阅读 · 1月25日

LLM or Human? Perceptions of Trust and Information Quality in Research Summaries

Arxiv

0+阅读 · 1月22日

User Perceptions vs. Proxy LLM Judges: Privacy and Helpfulness in LLM Responses to Privacy-Sensitive Scenarios

Arxiv

0+阅读 · 1月15日

Position on LLM-Assisted Peer Review: Addressing Reviewer Gap through Mentoring and Feedback

Arxiv

0+阅读 · 1月14日

LLM Review: Enhancing Creative Writing via Blind Peer Review Feedback

Arxiv

0+阅读 · 1月12日

VIP会员

文章信息

相关主题

相关VIP内容

人机协同作战规划：来自美海军陆战队的大语言模型（LLM）使用教训

人机协同作战规划：来自美海军陆战队的大语言模型（LLM）使用教训

专知会员服务

24+阅读 · 2025年10月16日

LLMs与生成式智能体模拟：复杂系统研究的新范式

LLMs与生成式智能体模拟：复杂系统研究的新范式

专知会员服务

27+阅读 · 2025年6月15日

利用多个大型语言模型：关于LLM集成的调研

利用多个大型语言模型：关于LLM集成的调研

专知会员服务

35+阅读 · 2025年2月27日

《以人为中心的大型语言模型（LLM）研究综述》

《以人为中心的大型语言模型（LLM）研究综述》

专知会员服务

41+阅读 · 2024年11月25日

从基础到突破的LLM微调终极指南：技术、研究、最佳实践、应用研究挑战与机遇的全面综述

从基础到突破的LLM微调终极指南：技术、研究、最佳实践、应用研究挑战与机遇的全面综述

专知会员服务

55+阅读 · 2024年11月17日

《美国防部对人工智能和 LLM 编写评估因素的信心与偏见》2024最新275页论文

《美国防部对人工智能和 LLM 编写评估因素的信心与偏见》2024最新275页论文

专知会员服务

63+阅读 · 2024年3月4日

RAG+LLM=？同济大学等最新《大型语言模型的检索增强生成》综述

RAG+LLM=？同济大学等最新《大型语言模型的检索增强生成》综述

专知会员服务

110+阅读 · 2023年12月19日

【LLM/大模型】战争与和平(WarAgent)：基于大模型的世界大战多智能体模拟

【LLM/大模型】战争与和平(WarAgent)：基于大模型的世界大战多智能体模拟

专知会员服务

63+阅读 · 2023年12月6日

如何检测LLM内容？UCSB等最新首篇《LLM生成内容检测》综述

如何检测LLM内容？UCSB等最新首篇《LLM生成内容检测》综述

专知会员服务

49+阅读 · 2023年10月29日

人机协作《评估影响信任校准的因素：信任战略和风险的影响》美空军21页报告

人机协作《评估影响信任校准的因素：信任战略和风险的影响》美空军21页报告

专知会员服务

31+阅读 · 2023年7月18日

热门VIP内容

开通专知VIP会员享更多权益服务

《可信人工智能赋能系统的支柱》

《从经典神经网络到不确定性下的拓扑神经网络：军事应用》2026最新40页报告

人工智能赋能边缘与自主系统：美陆军现代化进程聚焦威胁探测与战术边缘情报

《人工智能：对战略与力量的影响》slides

相关资讯

【美国陆军】《人工智能系统能否提高陆军任务指挥过程中的信息收集效率？》39页技术报告

【美国陆军】《人工智能系统能否提高陆军任务指挥过程中的信息收集效率？》39页技术报告

专知

50+阅读 · 2022年8月31日

【AI+军事】《用于威胁评估的人工智能工具》加拿大国防研究和发展部技术报告，附中文版pdf

【AI+军事】《用于威胁评估的人工智能工具》加拿大国防研究和发展部技术报告，附中文版pdf

专知

90+阅读 · 2022年4月17日

解读！10篇人机交互领域高引论文合集

解读！10篇人机交互领域高引论文合集

THU数据派

11+阅读 · 2019年11月14日

最新必读【预训练语言模型(BERT/XLNet等)】论文，Google/微软/华为ICLR2020提交论文

最新必读【预训练语言模型(BERT/XLNet等)】论文，Google/微软/华为ICLR2020提交论文

专知

36+阅读 · 2019年9月29日

SMP 2019 第三届中文人机对话技术评测顺利落幕

SMP 2019 第三届中文人机对话技术评测顺利落幕

哈工大SCIR

12+阅读 · 2019年8月19日

人机交互顶级会议CHI2019最佳论文奖出炉！29篇最佳论文！119篇最佳提名论文！

人机交互顶级会议CHI2019最佳论文奖出炉！29篇最佳论文！119篇最佳提名论文！

专知

70+阅读 · 2019年3月17日

干货|85页最新《人机对话系统》神经方法综述论文，微软与谷歌研究员联合出品：

干货|85页最新《人机对话系统》神经方法综述论文，微软与谷歌研究员联合出品：

专知

35+阅读 · 2018年10月7日

深思考人工智能蝉联SMP2018多轮语义对话冠军，报告解读多轮人机对话实现过程

深思考人工智能蝉联SMP2018多轮语义对话冠军，报告解读多轮人机对话实现过程

人工智能学家

15+阅读 · 2018年8月4日

最新人机对话系统简略综述

最新人机对话系统简略综述

专知

26+阅读 · 2018年3月10日

【干货】一文读懂智能对话系统，当前研究综述和未来趋势

【干货】一文读懂智能对话系统，当前研究综述和未来趋势

新智元

13+阅读 · 2018年1月23日

相关论文

Key Considerations for Domain Expert Involvement in LLM Design and Evaluation: An Ethnographic Study

Arxiv

0+阅读 · 2月16日

Partnering with Generative AI: Experimental Evaluation of Human-Led and Model-Led Interaction in Human-AI Co-Creation

Arxiv

0+阅读 · 2月9日

Authorship Drift: How Self-Efficacy and Trust Evolve During LLM-Assisted Writing

Arxiv

0+阅读 · 2月5日

HumanLLM: Benchmarking and Improving LLM Anthropomorphism via Human Cognitive Patterns

Arxiv

0+阅读 · 1月30日

HELM: A Human-Centered Evaluation Framework for LLM-Powered Recommender Systems

Arxiv

0+阅读 · 1月27日

Automated structural testing of LLM-based agents: methods, framework, and case studies

Arxiv

0+阅读 · 1月25日

LLM or Human? Perceptions of Trust and Information Quality in Research Summaries

Arxiv

0+阅读 · 1月22日

User Perceptions vs. Proxy LLM Judges: Privacy and Helpfulness in LLM Responses to Privacy-Sensitive Scenarios

Arxiv

0+阅读 · 1月15日

Position on LLM-Assisted Peer Review: Addressing Reviewer Gap through Mentoring and Feedback

Arxiv

0+阅读 · 1月14日

LLM Review: Enhancing Creative Writing via Blind Peer Review Feedback

Arxiv

0+阅读 · 1月12日

相关基金

共融机器人战略规划研究和学术交流

国家自然科学基金

13+阅读 · 2016年12月31日

基于人机交互的数据驱动式人群行为建模与仿真研究

国家自然科学基金

4+阅读 · 2015年12月31日

面向聋儿言语康复的多模态人机交互模型及技术研究

国家自然科学基金

3+阅读 · 2015年12月31日

基于不确定性计算的鲁棒风险评估关键技术研究

国家自然科学基金

8+阅读 · 2015年12月31日

随机环境下多个体系统集体行为分析、调控与优化

国家自然科学基金

0+阅读 · 2015年12月31日

基于犹豫模糊语言信息的定性决策理论与方法

国家自然科学基金

2+阅读 · 2015年12月31日

面向交互式问答的省略恢复技术研究

国家自然科学基金

5+阅读 · 2015年12月31日

高速铁路信号系统安全评估基础理论与方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

多语言大数据环境下的复杂网络行为分析、预测和干预

国家自然科学基金

4+阅读 · 2014年12月31日

支持多信息融合的装备体系作战效能评估方法研究

国家自然科学基金

36+阅读 · 2008年12月31日

微信扫码咨询专知VIP会员