多模态大语言模型能否生成类人反馈用于多模态简答题评分？ (Can MLLMs generate human-like feedback in grading multimodal short answers?) - 专知论文

会员服务 ·

0

多模 · 模态 · 多模态 · 语言模型 · 包含 ·

Can MLLMs generate human-like feedback in grading multimodal short answers?

翻译：多模态大语言模型能否生成类人反馈用于多模态简答题评分？

Pritam Sil,Pushpak Bhattacharyya,Pawan Goyal,Ganesh Ramakrishnan

In education, the traditional Automatic Short Answer Grading (ASAG) with feedback problem has focused primarily on evaluating text-only responses. However, real-world assessments often include multimodal responses containing both diagrams and text. To address this limitation, we introduce the Multimodal Short Answer Grading with Feedback (MMSAF) problem, which requires jointly evaluating textual and diagrammatic content while also providing explanatory feedback. Collecting data representative of such multimodal responses is challenging due to both scale and logistical constraints. To mitigate this, we develop an automated data generation framework that leverages LLM hallucinations to mimic common student errors, thereby constructing a dataset of 2,197 instances. We evaluate 4 Multimodal Large Language Models (MLLMs) across 3 STEM subjects, showing that MLLMs achieve accuracies of up to 62.5% in predicting answer correctness (correct/partially correct/incorrect) and up to 80.36% in assessing image relevance. This also includes a human evaluation with 9 annotators across 5 parameters, including a rubric-based approach. The rubrics also serve as a way to evaluate the feedback quality semantically rather than using overlap-based approaches. Our findings highlight which MLLMs are better suited for such tasks while also pointing out to drawbacks of the remaining MLLMs.

翻译：在教育领域，传统的自动简答题评分与反馈问题主要集中于评估纯文本回答。然而，现实世界中的评估常包含同时涵盖图表与文本的多模态回答。为应对这一局限，我们提出了多模态简答题评分与反馈问题，该问题要求同时评估文本与图表内容，并提供解释性反馈。由于规模与实施限制，收集具有代表性的此类多模态回答数据颇具挑战。为此，我们开发了一个自动化数据生成框架，该框架利用大语言模型的幻觉来模拟常见的学生错误，从而构建了一个包含2,197个实例的数据集。我们在3个STEM学科中评估了4种多模态大语言模型，结果显示，在预测答案正确性（正确/部分正确/错误）方面，MLLMs的准确率最高可达62.5%；在评估图像相关性方面，最高可达80.36%。研究还包括一项由9名标注者参与、涵盖5个参数的人工评估，其中采用了基于评分量规的方法。这些评分量规也作为一种方式，用于从语义层面而非基于重叠度的方法来评估反馈质量。我们的研究结果明确了哪些MLLMs更适合此类任务，同时也指出了其余MLLMs的不足之处。

0

相关内容

多模态大型语言模型：综述

多模态大型语言模型：综述

专知会员服务

45+阅读 · 2025年6月14日

《多模态大语言模型在基于模型的系统工程中的视觉问答能力探索》最新报告

《多模态大语言模型在基于模型的系统工程中的视觉问答能力探索》最新报告

专知会员服务

21+阅读 · 2025年5月20日

大语言模型在多模态推荐系统中的应用综述

大语言模型在多模态推荐系统中的应用综述

专知会员服务

17+阅读 · 2025年5月17日

大规模多模态模型数据集、应用类别与分类学综述

大规模多模态模型数据集、应用类别与分类学综述

专知会员服务

58+阅读 · 2024年12月25日

浅谈多模态大模型幻觉缓解方法

浅谈多模态大模型幻觉缓解方法

专知会员服务

24+阅读 · 2024年12月17日

大模型如何多模态偏好对齐？最新《基于人类反馈的语言、语音和视觉任务偏好优化》综述

大模型如何多模态偏好对齐？最新《基于人类反馈的语言、语音和视觉任务偏好优化》综述

专知会员服务

29+阅读 · 2024年9月22日

多模态大规模语言模型基准的综述

多模态大规模语言模型基准的综述

专知会员服务

41+阅读 · 2024年8月25日

大型语言模型遇上文本中心的多模态情感分析：综述

大型语言模型遇上文本中心的多模态情感分析：综述

专知会员服务

25+阅读 · 2024年6月13日

多模态如何用于AI4Science？微软人大最新《生物分子和自然语言的多模态学习》综述

多模态如何用于AI4Science？微软人大最新《生物分子和自然语言的多模态学习》综述

专知会员服务

27+阅读 · 2024年3月5日

使用多模态语言模型生成图像

使用多模态语言模型生成图像

专知会员服务

32+阅读 · 2023年8月23日

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

专知

10+阅读 · 2023年4月6日

超50篇论文串联起从VQA到多模态预训练大模型的前世今生—Part 1

超50篇论文串联起从VQA到多模态预训练大模型的前世今生—Part 1

PaperWeekly

16+阅读 · 2022年4月29日

论文浅尝 | 基于用户反馈的交互式自然语言回答系统提升机制

论文浅尝 | 基于用户反馈的交互式自然语言回答系统提升机制

开放知识图谱

20+阅读 · 2019年10月12日

基于LSTM模型的学生反馈文本学业情绪识别方法

基于LSTM模型的学生反馈文本学业情绪识别方法

MOOC

17+阅读 · 2019年5月18日

这可能是「多模态机器学习」最通俗易懂的介绍

这可能是「多模态机器学习」最通俗易懂的介绍

计算机视觉life

113+阅读 · 2018年12月20日

论文浅尝 | 常识用于回答生成式多跳问题

论文浅尝 | 常识用于回答生成式多跳问题

开放知识图谱

16+阅读 · 2018年11月24日

问答 | 多输出回归问题如何用神经网络模型来实现？

问答 | 多输出回归问题如何用神经网络模型来实现？

AI研习社

12+阅读 · 2018年10月8日

【论文笔记】对话模型新方法，条件DialogWAE生成多模态回答

【论文笔记】对话模型新方法，条件DialogWAE生成多模态回答

专知

15+阅读 · 2018年6月11日

【论文推荐】最新六篇自动问答（QA）相关论文—复杂序列问答、注意力机制、长短时记忆、文本推理、多因素注意力、主动的问答智能体

【论文推荐】最新六篇自动问答（QA）相关论文—复杂序列问答、注意力机制、长短时记忆、文本推理、多因素注意力、主动的问答智能体

专知

18+阅读 · 2018年2月22日

【论文推荐】最新5篇自动问答相关论文——多关系自动问答、知识图谱联合实体和关系、生物医学问题、维基百科语料数据、多句式旅游推荐

【论文推荐】最新5篇自动问答相关论文——多关系自动问答、知识图谱联合实体和关系、生物医学问题、维基百科语料数据、多句式旅游推荐

专知

23+阅读 · 2018年1月17日

基于身心共融运动训练的肢体康复机器人多模态反馈方法研究

国家自然科学基金

0+阅读 · 2017年12月31日

基于反馈型级联连接模型的多模态语义SFM方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于人脸表情、身体姿态和语音的多模态情感识别方法研究

国家自然科学基金

10+阅读 · 2015年12月31日

面向聋儿言语康复的多模态人机交互模型及技术研究

国家自然科学基金

3+阅读 · 2015年12月31日

三类多尺度问题的多尺度算法

国家自然科学基金

1+阅读 · 2015年12月31日

面向交互式问答的省略恢复技术研究

国家自然科学基金

5+阅读 · 2015年12月31日

心理与教育测量中项目反应时间数据的统计建模及其应用

国家自然科学基金

0+阅读 · 2015年12月31日

面向大规模多步学习问题的学习分类元系统技术研究

国家自然科学基金

5+阅读 · 2015年12月31日

半监督进化文本聚类算法在动态多源文本分析上的研究

国家自然科学基金

2+阅读 · 2014年12月31日

多语言大数据环境下的复杂网络行为分析、预测和干预

国家自然科学基金

4+阅读 · 2014年12月31日

Improving MLLMs in Embodied Exploration and Question Answering with Human-Inspired Memory Modeling

Arxiv

0+阅读 · 2月17日

Modal Aphasia: Can Unified Multimodal Models Describe Images From Memory?

Arxiv

0+阅读 · 2月13日

From Correspondence to Actions: Human-Like Multi-Image Spatial Reasoning in Multi-modal Large Language Models

Arxiv

0+阅读 · 2月10日

AI-Assisted Model for Generating Multiple-Choice Questions

Arxiv

0+阅读 · 2月9日

Evaluating and Calibrating LLM Confidence on Questions with Multiple Correct Answers

Arxiv

0+阅读 · 2月8日

Polyglots or Multitudes? Multilingual LLM Answers to Value-laden Multiple-Choice Questions

Polyglots or Multitudes? Multilingual LLM Answers to Value-laden Multiple-Choice Questions

Arxiv

0+阅读 · 2月5日

Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?

Arxiv

0+阅读 · 2月2日

Integrating Multi-Label Classification and Generative AI for Scalable Analysis of User Feedback

Arxiv

0+阅读 · 1月30日

Human-Aligned Enhancement of Programming Answers with LLMs Guided by User Feedback

Arxiv

0+阅读 · 1月24日

LLM-based Multimodal Feedback Produces Equivalent Learning and Better Student Perceptions than Educator Feedback

Arxiv

0+阅读 · 1月21日

VIP会员

文章信息

相关主题

相关VIP内容

多模态大型语言模型：综述

多模态大型语言模型：综述

专知会员服务

45+阅读 · 2025年6月14日

《多模态大语言模型在基于模型的系统工程中的视觉问答能力探索》最新报告

《多模态大语言模型在基于模型的系统工程中的视觉问答能力探索》最新报告

专知会员服务

21+阅读 · 2025年5月20日

大语言模型在多模态推荐系统中的应用综述

大语言模型在多模态推荐系统中的应用综述

专知会员服务

17+阅读 · 2025年5月17日

大规模多模态模型数据集、应用类别与分类学综述

大规模多模态模型数据集、应用类别与分类学综述

专知会员服务

58+阅读 · 2024年12月25日

浅谈多模态大模型幻觉缓解方法

浅谈多模态大模型幻觉缓解方法

专知会员服务

24+阅读 · 2024年12月17日

大模型如何多模态偏好对齐？最新《基于人类反馈的语言、语音和视觉任务偏好优化》综述

大模型如何多模态偏好对齐？最新《基于人类反馈的语言、语音和视觉任务偏好优化》综述

专知会员服务

29+阅读 · 2024年9月22日

多模态大规模语言模型基准的综述

多模态大规模语言模型基准的综述

专知会员服务

41+阅读 · 2024年8月25日

大型语言模型遇上文本中心的多模态情感分析：综述

大型语言模型遇上文本中心的多模态情感分析：综述

专知会员服务

25+阅读 · 2024年6月13日

多模态如何用于AI4Science？微软人大最新《生物分子和自然语言的多模态学习》综述

多模态如何用于AI4Science？微软人大最新《生物分子和自然语言的多模态学习》综述

专知会员服务

27+阅读 · 2024年3月5日

使用多模态语言模型生成图像

使用多模态语言模型生成图像

专知会员服务

32+阅读 · 2023年8月23日

热门VIP内容

开通专知VIP会员享更多权益服务

智能体记忆深度剖析：评价指标与系统局限性的分类体系及实证分析

《可信人工智能赋能系统的支柱》

【CMU博士论文】可靠轨迹预测的分层基石：数据、评估与方法

人工智能赋能边缘与自主系统：美陆军现代化进程聚焦威胁探测与战术边缘情报

相关资讯

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

专知

10+阅读 · 2023年4月6日

超50篇论文串联起从VQA到多模态预训练大模型的前世今生—Part 1

超50篇论文串联起从VQA到多模态预训练大模型的前世今生—Part 1

PaperWeekly

16+阅读 · 2022年4月29日

论文浅尝 | 基于用户反馈的交互式自然语言回答系统提升机制

论文浅尝 | 基于用户反馈的交互式自然语言回答系统提升机制

开放知识图谱

20+阅读 · 2019年10月12日

基于LSTM模型的学生反馈文本学业情绪识别方法

基于LSTM模型的学生反馈文本学业情绪识别方法

MOOC

17+阅读 · 2019年5月18日

这可能是「多模态机器学习」最通俗易懂的介绍

这可能是「多模态机器学习」最通俗易懂的介绍

计算机视觉life

113+阅读 · 2018年12月20日

论文浅尝 | 常识用于回答生成式多跳问题

论文浅尝 | 常识用于回答生成式多跳问题

开放知识图谱

16+阅读 · 2018年11月24日

问答 | 多输出回归问题如何用神经网络模型来实现？

问答 | 多输出回归问题如何用神经网络模型来实现？

AI研习社

12+阅读 · 2018年10月8日

【论文笔记】对话模型新方法，条件DialogWAE生成多模态回答

【论文笔记】对话模型新方法，条件DialogWAE生成多模态回答

专知

15+阅读 · 2018年6月11日

【论文推荐】最新六篇自动问答（QA）相关论文—复杂序列问答、注意力机制、长短时记忆、文本推理、多因素注意力、主动的问答智能体

【论文推荐】最新六篇自动问答（QA）相关论文—复杂序列问答、注意力机制、长短时记忆、文本推理、多因素注意力、主动的问答智能体

专知

18+阅读 · 2018年2月22日

【论文推荐】最新5篇自动问答相关论文——多关系自动问答、知识图谱联合实体和关系、生物医学问题、维基百科语料数据、多句式旅游推荐

【论文推荐】最新5篇自动问答相关论文——多关系自动问答、知识图谱联合实体和关系、生物医学问题、维基百科语料数据、多句式旅游推荐

专知

23+阅读 · 2018年1月17日

相关论文

Improving MLLMs in Embodied Exploration and Question Answering with Human-Inspired Memory Modeling

Arxiv

0+阅读 · 2月17日

Modal Aphasia: Can Unified Multimodal Models Describe Images From Memory?

Arxiv

0+阅读 · 2月13日

From Correspondence to Actions: Human-Like Multi-Image Spatial Reasoning in Multi-modal Large Language Models

Arxiv

0+阅读 · 2月10日

AI-Assisted Model for Generating Multiple-Choice Questions

Arxiv

0+阅读 · 2月9日

Evaluating and Calibrating LLM Confidence on Questions with Multiple Correct Answers

Arxiv

0+阅读 · 2月8日

Polyglots or Multitudes? Multilingual LLM Answers to Value-laden Multiple-Choice Questions

Polyglots or Multitudes? Multilingual LLM Answers to Value-laden Multiple-Choice Questions

Arxiv

0+阅读 · 2月5日

Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?

Arxiv

0+阅读 · 2月2日

Integrating Multi-Label Classification and Generative AI for Scalable Analysis of User Feedback

Arxiv

0+阅读 · 1月30日

Human-Aligned Enhancement of Programming Answers with LLMs Guided by User Feedback

Arxiv

0+阅读 · 1月24日

LLM-based Multimodal Feedback Produces Equivalent Learning and Better Student Perceptions than Educator Feedback

Arxiv

0+阅读 · 1月21日

相关基金

基于身心共融运动训练的肢体康复机器人多模态反馈方法研究

国家自然科学基金

0+阅读 · 2017年12月31日

基于反馈型级联连接模型的多模态语义SFM方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于人脸表情、身体姿态和语音的多模态情感识别方法研究

国家自然科学基金

10+阅读 · 2015年12月31日

面向聋儿言语康复的多模态人机交互模型及技术研究

国家自然科学基金

3+阅读 · 2015年12月31日

三类多尺度问题的多尺度算法

国家自然科学基金

1+阅读 · 2015年12月31日

面向交互式问答的省略恢复技术研究

国家自然科学基金

5+阅读 · 2015年12月31日

心理与教育测量中项目反应时间数据的统计建模及其应用

国家自然科学基金

0+阅读 · 2015年12月31日

面向大规模多步学习问题的学习分类元系统技术研究

国家自然科学基金

5+阅读 · 2015年12月31日

半监督进化文本聚类算法在动态多源文本分析上的研究

国家自然科学基金

2+阅读 · 2014年12月31日

多语言大数据环境下的复杂网络行为分析、预测和干预

国家自然科学基金

4+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员