On the Wings of Imagination: Conflicting Script-based Multi-role Framework for Humor Caption Generation - 专知论文

会员服务 ·

0

语言模型 · 多模 · 模态 · 大语言模型 · 检索增强 ·

On the Wings of Imagination: Conflicting Script-based Multi-role Framework for Humor Caption Generation

翻译：基于想象之翼：面向幽默字幕生成的冲突脚本多角色框架

Wenbo Shang,Yuxi Sun,Jing Ma,Xin Huang

from arxiv, Paper accepted as a conference paper at ICLR 2026

Humor is a commonly used and intricate human language in daily life. Humor generation, especially in multi-modal scenarios, is a challenging task for large language models (LLMs), which is typically as funny caption generation for images, requiring visual understanding, humor reasoning, creative imagination, and so on. Existing LLM-based approaches rely on reasoning chains or self-improvement, which suffer from limited creativity and interpretability. To address these bottlenecks, we develop a novel LLM-based humor generation mechanism based on a fundamental humor theory, GTVH. To produce funny and script-opposite captions, we introduce a humor-theory-driven multi-role LLM collaboration framework augmented with humor retrieval (HOMER). The framework consists of three LLM-based roles: (1) conflicting-script extractor that grounds humor in key script oppositions, forming the basis of caption generation; (2) retrieval-augmented hierarchical imaginator that identifies key humor targets and expands the creative space of them through diverse associations structured as imagination trees; and (3) caption generator that produces funny and diverse captions conditioned on the obtained knowledge. Extensive experiments on two New Yorker Cartoon benchmarking datasets show that HOMER outperforms state-of-the-art baselines and powerful LLM reasoning strategies on multi-modal humor captioning.

翻译：幽默是日常生活中一种常用且复杂的人类语言。幽默生成，尤其是在多模态场景下，对于大型语言模型而言是一项具有挑战性的任务，通常体现为图像生成幽默字幕，这需要视觉理解、幽默推理、创造性想象等多方面能力。现有基于大型语言模型的方法依赖于推理链或自我改进，存在创造力有限和可解释性不足的问题。为应对这些瓶颈，我们基于基础幽默理论GTVH，开发了一种新颖的基于大型语言模型的幽默生成机制。为生成有趣且脚本对立的字幕，我们引入了一种由幽默理论驱动的、结合幽默检索增强的多角色大型语言模型协作框架。该框架包含三个基于大型语言模型的角色：(1) 冲突脚本提取器，将幽默锚定于关键脚本对立，构成字幕生成的基础；(2) 检索增强的分层想象器，识别关键幽默目标，并通过构建为想象树的多样化联想扩展其创意空间；(3) 字幕生成器，基于所获知识生成有趣且多样化的字幕。在两个《纽约客》漫画基准数据集上的大量实验表明，HOMER在多模态幽默字幕生成任务上优于最先进的基线模型和强大的大型语言模型推理策略。

0

相关内容

语言模型

面向战斗模拟空间推理的大语言模型指挥官智能体框架

面向战斗模拟空间推理的大语言模型指挥官智能体框架

专知会员服务

23+阅读 · 3月18日

大型语言模型赋能科研创意生成：创造力导向的研究综述

大型语言模型赋能科研创意生成：创造力导向的研究综述

专知会员服务

19+阅读 · 2025年11月13日

大型语言模型遇上文本属性图：一种融合框架与应用的综述

大型语言模型遇上文本属性图：一种融合框架与应用的综述

专知会员服务

10+阅读 · 2025年10月27日

《知识增强型大语言模型及面向创造力支持的人机协作框架》233页

《知识增强型大语言模型及面向创造力支持的人机协作框架》233页

专知会员服务

33+阅读 · 2025年9月29日

多模态大型语言模型：综述

多模态大型语言模型：综述

专知会员服务

46+阅读 · 2025年6月14日

【斯坦福博士论文】在语言模型融合多模态知识，225页pdf

【斯坦福博士论文】在语言模型融合多模态知识，225页pdf

专知会员服务

50+阅读 · 2024年4月10日

《多模态大型语言模型进化》最新综述

《多模态大型语言模型进化》最新综述

专知会员服务

105+阅读 · 2024年2月23日

【伯克利博士论文】通过生成式模型实现视觉与语言理解，109页pdf

【伯克利博士论文】通过生成式模型实现视觉与语言理解，109页pdf

专知会员服务

41+阅读 · 2024年1月20日

大模型哪家强？清华最新《大语言模型综合性能评估报告》权威评测，26页ppt

大模型哪家强？清华最新《大语言模型综合性能评估报告》权威评测，26页ppt

专知会员服务

157+阅读 · 2023年8月8日

中科大腾讯最新《多模态大型语言模型》综述，详述多模态指令微调、上下文学习、思维链和辅助视觉推理技术

中科大腾讯最新《多模态大型语言模型》综述，详述多模态指令微调、上下文学习、思维链和辅助视觉推理技术

专知会员服务

105+阅读 · 2023年6月27日

【ChatGPT系列报告】人工智能行业专题报告：多模态AI研究框架，17页ppt

【ChatGPT系列报告】人工智能行业专题报告：多模态AI研究框架，17页ppt

专知

23+阅读 · 2023年4月8日

自然语言生成资源列表

自然语言生成资源列表

专知

17+阅读 · 2020年1月4日

NLP+CV《桥接视觉与语言的研究综述》，带你全面了解视觉+语言最新应用和方法

NLP+CV《桥接视觉与语言的研究综述》，带你全面了解视觉+语言最新应用和方法

中国人工智能学会

27+阅读 · 2019年7月24日

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

AI科技评论

12+阅读 · 2019年5月2日

强化学习与文本生成

强化学习与文本生成

微信AI

41+阅读 · 2019年4月4日

基于深度学习的文本生成【附217页PPT下载】

基于深度学习的文本生成【附217页PPT下载】

专知

35+阅读 · 2018年11月24日

深思考人工智能蝉联SMP2018多轮语义对话冠军，报告解读多轮人机对话实现过程

深思考人工智能蝉联SMP2018多轮语义对话冠军，报告解读多轮人机对话实现过程

人工智能学家

15+阅读 · 2018年8月4日

免费 | 从文本匹配到图文匹配:所见所想所找 - 基于生成模型的多模态检索

免费 | 从文本匹配到图文匹配:所见所想所找 - 基于生成模型的多模态检索

AI研习社

44+阅读 · 2018年3月23日

最新人机对话系统简略综述

最新人机对话系统简略综述

专知

26+阅读 · 2018年3月10日

白翔：趣谈“捕文捉字”-- 场景文字检测 | VALSE2017之十

白翔：趣谈“捕文捉字”-- 场景文字检测 | VALSE2017之十

深度学习大讲堂

19+阅读 · 2017年9月4日

基于多源语义表示学习的社交媒体文本属性情感分类研究

国家自然科学基金

4+阅读 · 2017年12月31日

基于知识库构建的图像和视频角色语义关系的研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于人脸表情、身体姿态和语音的多模态情感识别方法研究

国家自然科学基金

10+阅读 · 2015年12月31日

随机映射框架下的图像语义分析与提取技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于复杂语义的个性化图像集摘要研究

国家自然科学基金

0+阅读 · 2015年12月31日

读者视角的跨领域隐式情感分析理论及关键技术研究

国家自然科学基金

1+阅读 · 2015年12月31日

强调与对比影响语篇理解的认知过程及其神经机制

国家自然科学基金

4+阅读 · 2015年12月31日

基于框架提升变换的多源图像融合研究

国家自然科学基金

1+阅读 · 2015年12月31日

多域网络安全的异构策略语义形态与验证机制

国家自然科学基金

0+阅读 · 2014年12月31日

多语言大数据环境下的复杂网络行为分析、预测和干预

国家自然科学基金

4+阅读 · 2014年12月31日

PlotTwist: A Creative Plot Generation Framework with Small Language Models

Arxiv

0+阅读 · 3月17日

Framework of Thoughts: A Foundation Framework for Dynamic and Optimized Reasoning based on Chains, Trees, and Graphs

Arxiv

0+阅读 · 2月18日

CreativityPrism: A Holistic Evaluation Framework for Large Language Model Creativity

Arxiv

0+阅读 · 2月17日

Automatic Funny Scene Extraction from Long-form Cinematic Videos

Arxiv

0+阅读 · 2月17日

Thinking with Drafting: Optical Decompression via Logical Reconstruction

Arxiv

0+阅读 · 2月12日

MetaphorStar: Image Metaphor Understanding and Reasoning with End-to-End Visual Reinforcement Learning

Arxiv

0+阅读 · 2月11日

Jokeasy: Exploring Human-AI Collaboration in Thematic Joke Generation

Arxiv

0+阅读 · 2月10日

HER: Human-like Reasoning and Reinforcement Learning for LLM Role-playing

Arxiv

0+阅读 · 2月8日

StoryBox: Collaborative Multi-Agent Simulation for Hybrid Bottom-Up Long-Form Story Generation Using Large Language Models

Arxiv

0+阅读 · 2月7日

Persona Generators: Generating Diverse Synthetic Personas at Scale

Arxiv

0+阅读 · 2月3日

VIP会员

文章信息

相关主题

大语言模型

最新内容

全面的反无人机系统培训计划

全面的反无人机系统培训计划

专知会员服务

0+阅读 · 24分钟前

数字孪生在军事领域的应用综述：陆地、海上、空中、太空和网络空间多域赋能

数字孪生在军事领域的应用综述：陆地、海上、空中、太空和网络空间多域赋能

专知会员服务

2+阅读 · 42分钟前

《美国首席数字与人工智能办公室（CDAO）人工智能治理与采办流程效能评估》报告

《美国首席数字与人工智能办公室（CDAO）人工智能治理与采办流程效能评估》报告

专知会员服务

5+阅读 · 今天3:36

算法战加速推进：五角大楼项目、供应商生态体系与军事创新的战略重塑

算法战加速推进：五角大楼项目、供应商生态体系与军事创新的战略重塑

专知会员服务

3+阅读 · 今天3:23

探秘Palantir：驱动美情报的科技巨头

探秘Palantir：驱动美情报的科技巨头

专知会员服务

2+阅读 · 今天3:14

《从技术突破到战场应用：发挥原型开发效能的最佳实践》报告

《从技术突破到战场应用：发挥原型开发效能的最佳实践》报告

专知会员服务

4+阅读 · 今天3:09

《美国海军军事海运司令部 2026年手册》

《美国海军军事海运司令部 2026年手册》

专知会员服务

3+阅读 · 今天3:05

别再只盯着“杀手机器人”了：人工智能真正变革现代战争的三种方式

别再只盯着“杀手机器人”了：人工智能真正变革现代战争的三种方式

专知会员服务

3+阅读 · 今天2:36

《人工智能使能系统可靠性框架》

《人工智能使能系统可靠性框架》

专知会员服务

6+阅读 · 今天2:28

2026“人工智能+”行业发展蓝皮书（附下载）

2026“人工智能+”行业发展蓝皮书（附下载）

专知会员服务

15+阅读 · 4月26日

《强化学习数学基础》

《强化学习数学基础》

专知会员服务

12+阅读 · 4月26日

何为下一代指挥与控制？美陆军选择第四步兵师进行快速原型NGC2开发

何为下一代指挥与控制？美陆军选择第四步兵师进行快速原型NGC2开发

专知会员服务

7+阅读 · 4月26日

《低成本自杀式无人机战争的军事战略影响：以乌克兰和伊朗为案例研究》

《低成本自杀式无人机战争的军事战略影响：以乌克兰和伊朗为案例研究》

专知会员服务

9+阅读 · 4月26日

深入Maven智能系统：Palantir基于Claude打造的军事大脑

深入Maven智能系统：Palantir基于Claude打造的军事大脑

专知会员服务

13+阅读 · 4月26日

“Maven计划”的发展演变之“Maven智能系统”应用

“Maven计划”的发展演变之“Maven智能系统”应用

专知会员服务

10+阅读 · 4月26日

相关VIP内容

面向战斗模拟空间推理的大语言模型指挥官智能体框架

面向战斗模拟空间推理的大语言模型指挥官智能体框架

专知会员服务

23+阅读 · 3月18日

大型语言模型赋能科研创意生成：创造力导向的研究综述

大型语言模型赋能科研创意生成：创造力导向的研究综述

专知会员服务

19+阅读 · 2025年11月13日

大型语言模型遇上文本属性图：一种融合框架与应用的综述

大型语言模型遇上文本属性图：一种融合框架与应用的综述

专知会员服务

10+阅读 · 2025年10月27日

《知识增强型大语言模型及面向创造力支持的人机协作框架》233页

《知识增强型大语言模型及面向创造力支持的人机协作框架》233页

专知会员服务

33+阅读 · 2025年9月29日

多模态大型语言模型：综述

多模态大型语言模型：综述

专知会员服务

46+阅读 · 2025年6月14日

【斯坦福博士论文】在语言模型融合多模态知识，225页pdf

【斯坦福博士论文】在语言模型融合多模态知识，225页pdf

专知会员服务

50+阅读 · 2024年4月10日

《多模态大型语言模型进化》最新综述

《多模态大型语言模型进化》最新综述

专知会员服务

105+阅读 · 2024年2月23日

【伯克利博士论文】通过生成式模型实现视觉与语言理解，109页pdf

【伯克利博士论文】通过生成式模型实现视觉与语言理解，109页pdf

专知会员服务

41+阅读 · 2024年1月20日

大模型哪家强？清华最新《大语言模型综合性能评估报告》权威评测，26页ppt

大模型哪家强？清华最新《大语言模型综合性能评估报告》权威评测，26页ppt

专知会员服务

157+阅读 · 2023年8月8日

中科大腾讯最新《多模态大型语言模型》综述，详述多模态指令微调、上下文学习、思维链和辅助视觉推理技术

中科大腾讯最新《多模态大型语言模型》综述，详述多模态指令微调、上下文学习、思维链和辅助视觉推理技术

专知会员服务

105+阅读 · 2023年6月27日

热门VIP内容

开通专知VIP会员享更多权益服务

数字孪生在军事领域的应用综述：陆地、海上、空中、太空和网络空间多域赋能

算法战加速推进：五角大楼项目、供应商生态体系与军事创新的战略重塑

全面的反无人机系统培训计划

《美国首席数字与人工智能办公室（CDAO）人工智能治理与采办流程效能评估》报告

相关资讯

【ChatGPT系列报告】人工智能行业专题报告：多模态AI研究框架，17页ppt

【ChatGPT系列报告】人工智能行业专题报告：多模态AI研究框架，17页ppt

专知

23+阅读 · 2023年4月8日

自然语言生成资源列表

自然语言生成资源列表

专知

17+阅读 · 2020年1月4日

NLP+CV《桥接视觉与语言的研究综述》，带你全面了解视觉+语言最新应用和方法

NLP+CV《桥接视觉与语言的研究综述》，带你全面了解视觉+语言最新应用和方法

中国人工智能学会

27+阅读 · 2019年7月24日

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

AI科技评论

12+阅读 · 2019年5月2日

强化学习与文本生成

强化学习与文本生成

微信AI

41+阅读 · 2019年4月4日

基于深度学习的文本生成【附217页PPT下载】

基于深度学习的文本生成【附217页PPT下载】

专知

35+阅读 · 2018年11月24日

深思考人工智能蝉联SMP2018多轮语义对话冠军，报告解读多轮人机对话实现过程

深思考人工智能蝉联SMP2018多轮语义对话冠军，报告解读多轮人机对话实现过程

人工智能学家

15+阅读 · 2018年8月4日

免费 | 从文本匹配到图文匹配:所见所想所找 - 基于生成模型的多模态检索

免费 | 从文本匹配到图文匹配:所见所想所找 - 基于生成模型的多模态检索

AI研习社

44+阅读 · 2018年3月23日

最新人机对话系统简略综述

最新人机对话系统简略综述

专知

26+阅读 · 2018年3月10日

白翔：趣谈“捕文捉字”-- 场景文字检测 | VALSE2017之十

白翔：趣谈“捕文捉字”-- 场景文字检测 | VALSE2017之十

深度学习大讲堂

19+阅读 · 2017年9月4日

相关论文

PlotTwist: A Creative Plot Generation Framework with Small Language Models

Arxiv

0+阅读 · 3月17日

Framework of Thoughts: A Foundation Framework for Dynamic and Optimized Reasoning based on Chains, Trees, and Graphs

Arxiv

0+阅读 · 2月18日

CreativityPrism: A Holistic Evaluation Framework for Large Language Model Creativity

Arxiv

0+阅读 · 2月17日

Automatic Funny Scene Extraction from Long-form Cinematic Videos

Arxiv

0+阅读 · 2月17日

Thinking with Drafting: Optical Decompression via Logical Reconstruction

Arxiv

0+阅读 · 2月12日

MetaphorStar: Image Metaphor Understanding and Reasoning with End-to-End Visual Reinforcement Learning

Arxiv

0+阅读 · 2月11日

Jokeasy: Exploring Human-AI Collaboration in Thematic Joke Generation

Arxiv

0+阅读 · 2月10日

HER: Human-like Reasoning and Reinforcement Learning for LLM Role-playing

Arxiv

0+阅读 · 2月8日

StoryBox: Collaborative Multi-Agent Simulation for Hybrid Bottom-Up Long-Form Story Generation Using Large Language Models

Arxiv

0+阅读 · 2月7日

Persona Generators: Generating Diverse Synthetic Personas at Scale

Arxiv

0+阅读 · 2月3日

相关基金

基于多源语义表示学习的社交媒体文本属性情感分类研究

国家自然科学基金

4+阅读 · 2017年12月31日

基于知识库构建的图像和视频角色语义关系的研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于人脸表情、身体姿态和语音的多模态情感识别方法研究

国家自然科学基金

10+阅读 · 2015年12月31日

随机映射框架下的图像语义分析与提取技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于复杂语义的个性化图像集摘要研究

国家自然科学基金

0+阅读 · 2015年12月31日

读者视角的跨领域隐式情感分析理论及关键技术研究

国家自然科学基金

1+阅读 · 2015年12月31日

强调与对比影响语篇理解的认知过程及其神经机制

国家自然科学基金

4+阅读 · 2015年12月31日

基于框架提升变换的多源图像融合研究

国家自然科学基金

1+阅读 · 2015年12月31日

多域网络安全的异构策略语义形态与验证机制

国家自然科学基金

0+阅读 · 2014年12月31日

多语言大数据环境下的复杂网络行为分析、预测和干预

国家自然科学基金

4+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员