Sora as a World Model? A Complete Survey on Text-to-Video Generation - 专知论文

会员服务 ·

0

视频 · 文本到视频生成 · 视频生成 · 一致 · Sora ·

Sora as a World Model? A Complete Survey on Text-to-Video Generation

翻译：Sora 作为世界模型？文本到视频生成的全面综述

Fachrina Dewi Puspitasari,Chaoning Zhang,Joseph Cho,Adnan Haider,Noor Ul Eman,Omer Amin,Alexis Mankowski,Muhammad Umair,Jingyao Zheng,Sheng Zheng,Lik-Hang Lee,Caiyan Qin,Tae-Ho Kim,Choong Seon Hong,Yang Yang,Heng Tao Shen

from arxiv, First complete survey on Text-to-Video Generation from World Model perspective, 35 pages

The evolution of video generation from text, from animating MNIST to simulating the world with Sora, has progressed at a breakneck speed. Here, we systematically discuss how far text-to-video generation technology supports essential requirements in world modeling. We curate 250+ studies on text-based video synthesis and world modeling. We then observe that recent models increasingly support spatial, action, and strategic intelligences in world modeling through adherence to completeness, consistency, invention, as well as human interaction and control. We conclude that text-to-video generation is adept at world modeling, although homework in several aspects, such as the diversity-consistency trade-offs, remains to be addressed.

翻译：从动画化 MNIST 到使用 Sora 模拟世界，基于文本的视频生成技术正以惊人的速度演进。本文系统性地探讨了文本到视频生成技术在多大程度上支持世界建模的核心要求。我们整理了 250 余项关于基于文本的视频合成与世界建模的研究，并观察到近期模型通过遵循完整性、一致性、创造性以及人机交互与控制等原则，正日益支持世界建模中的空间智能、行为智能与策略智能。我们的结论是：文本到视频生成技术已胜任世界建模任务，但在多样性-一致性权衡等多个方面仍有待完善。

0

相关内容

视频

理解世界还是预测未来？世界模型的综合综述

理解世界还是预测未来？世界模型的综合综述

专知会员服务

78+阅读 · 2024年11月26日

从Sora中我们能看到什么：文本生成视频的综述

从Sora中我们能看到什么：文本生成视频的综述

专知会员服务

45+阅读 · 2024年6月2日

Sora是世界模拟器吗? 世界模型及其以后的综述

Sora是世界模拟器吗? 世界模型及其以后的综述

专知会员服务

41+阅读 · 2024年5月9日

Sora如何复现? 百万级真实提示库数据集，用于文本到视频扩散模型

Sora如何复现? 百万级真实提示库数据集，用于文本到视频扩散模型

专知会员服务

33+阅读 · 2024年3月13日

Sora 作为 AGI 世界模型？关于《文本到视频生成》完整综述

Sora 作为 AGI 世界模型？关于《文本到视频生成》完整综述

专知会员服务

48+阅读 · 2024年3月11日

Sora背后的技术，最新《可控生成与文本到图像扩散模型》综述

Sora背后的技术，最新《可控生成与文本到图像扩散模型》综述

专知会员服务

69+阅读 · 2024年3月9日

Sora的前世今生：从文生图到文生视频

Sora的前世今生：从文生图到文生视频

专知会员服务

49+阅读 · 2024年2月22日

文生视频模型Sora面世，AI生视频技术持续革新

文生视频模型Sora面世，AI生视频技术持续革新

专知会员服务

65+阅读 · 2024年2月20日

Sora视频生成模型相关论文集合！《视频生成模型作为世界模拟器》中引用的所有论文集合

Sora视频生成模型相关论文集合！《视频生成模型作为世界模拟器》中引用的所有论文集合

专知会员服务

57+阅读 · 2024年2月20日

OpenAI发布文生视频模型Sora，系统报告

OpenAI发布文生视频模型Sora，系统报告

专知会员服务

81+阅读 · 2024年2月19日

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

专知

12+阅读 · 2022年10月31日

超50篇论文串联起从VQA到多模态预训练大模型的前世今生—Part 1

超50篇论文串联起从VQA到多模态预训练大模型的前世今生—Part 1

PaperWeekly

16+阅读 · 2022年4月29日

最新《知识驱动的文本生成》综述论文，44页pdf

最新《知识驱动的文本生成》综述论文，44页pdf

专知

26+阅读 · 2020年10月14日

Video Description视频描述综述论文-方法、数据集和评估指标，UWA

Video Description视频描述综述论文-方法、数据集和评估指标，UWA

专知

38+阅读 · 2020年3月5日

文本+视觉，多篇 Visual/Video BERT 论文介绍

文本+视觉，多篇 Visual/Video BERT 论文介绍

AI科技评论

22+阅读 · 2019年8月30日

【综述】短文本主题建模最新综述（附17页全文下载）

【综述】短文本主题建模最新综述（附17页全文下载）

专知

33+阅读 · 2019年4月17日

视频生成的前沿论文，看我们推荐的7篇就够了

视频生成的前沿论文，看我们推荐的7篇就够了

人工智能前沿讲习班

34+阅读 · 2018年12月30日

Image Captioning 36页最新综述， 161篇参考文献

Image Captioning 36页最新综述， 161篇参考文献

专知

90+阅读 · 2018年10月23日

【论文推荐】最新八篇视频描述生成相关论文—在线视频理解、联合定位和描述事件、生成视频、跨模态注意力机制、联合事件检测和描述

【论文推荐】最新八篇视频描述生成相关论文—在线视频理解、联合定位和描述事件、生成视频、跨模态注意力机制、联合事件检测和描述

专知

11+阅读 · 2018年6月4日

【论文推荐】最新六篇图像描述生成相关论文—视频摘要、注意力张量积、非自回归神经序列模型、副词识别、多主体、多样性度量

【论文推荐】最新六篇图像描述生成相关论文—视频摘要、注意力张量积、非自回归神经序列模型、副词识别、多主体、多样性度量

专知

10+阅读 · 2018年3月2日

基于知识库构建的图像和视频角色语义关系的研究

国家自然科学基金

1+阅读 · 2015年12月31日

融合稀疏层次模型的内容辨识研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于复杂语义的个性化图像集摘要研究

国家自然科学基金

0+阅读 · 2015年12月31日

实验室模拟大气中羰基化合物与硫酸铵/胺液相反应形成SOA的研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于生态演替的文本大数据特征学习研究

国家自然科学基金

1+阅读 · 2015年12月31日

自由视点三维视频中纹理-深度图像联合建模及应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于DEM样本的交互式地形合成方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于概率图的文本检索模型及算法研究

国家自然科学基金

2+阅读 · 2014年12月31日

基于深度学习的三维模型检索技术

国家自然科学基金

13+阅读 · 2014年12月31日

面向时空变化的GIS数据模型

国家自然科学基金

6+阅读 · 2014年12月31日

Simulating the Real World: A Unified Survey of Multimodal Generative Models

Arxiv

0+阅读 · 2月16日

ALIVE: Animate Your World with Lifelike Audio-Video Generation

Arxiv

0+阅读 · 2月10日

ALIVE: Animate Your World with Lifelike Audio-Video Generation

Arxiv

0+阅读 · 2月9日

World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy

Arxiv

0+阅读 · 2月6日

RISE-Video: Can Video Generators Decode Implicit World Rules?

Arxiv

0+阅读 · 2月5日

Grounding Generated Videos in Feasible Plans via World Models

Arxiv

0+阅读 · 2月2日

Astra: General Interactive World Model with Autoregressive Denoising

Arxiv

0+阅读 · 1月27日

Rethinking Video Generation Model for the Embodied World

Arxiv

0+阅读 · 1月21日

StableWorld: Towards Stable and Consistent Long Interactive Video Generation

Arxiv

0+阅读 · 1月21日

World Craft: Agentic Framework to Create Visualizable Worlds via Text

Arxiv

0+阅读 · 1月21日

VIP会员

文章信息

相关主题

文本到视频生成

最新内容

何为下一代指挥与控制？美陆军选择第四步兵师进行快速原型NGC2开发

何为下一代指挥与控制？美陆军选择第四步兵师进行快速原型NGC2开发

专知会员服务

1+阅读 · 今天10:06

《低成本自杀式无人机战争的军事战略影响：以乌克兰和伊朗为案例研究》

《低成本自杀式无人机战争的军事战略影响：以乌克兰和伊朗为案例研究》

专知会员服务

1+阅读 · 今天9:11

深入Maven智能系统：Palantir基于Claude打造的军事大脑

深入Maven智能系统：Palantir基于Claude打造的军事大脑

专知会员服务

5+阅读 · 今天8:18

“Maven计划”的发展演变之“Maven智能系统”应用

“Maven计划”的发展演变之“Maven智能系统”应用

专知会员服务

4+阅读 · 今天8:03

伊朗的无人机蜂群策略如何挑战美国防御系统：人工智能驱动的无人机战争与现代冲突的转型

伊朗的无人机蜂群策略如何挑战美国防御系统：人工智能驱动的无人机战争与现代冲突的转型

专知会员服务

5+阅读 · 今天7:39

《将小型无人机系统与巡飞弹集成至连及以下级别战术机动》（美陆军最新报告中文版）

《将小型无人机系统与巡飞弹集成至连及以下级别战术机动》（美陆军最新报告中文版）

专知会员服务

2+阅读 · 今天6:58

加拿大国防部发布项目需求：用于高级态势决策的多模态人工智能

加拿大国防部发布项目需求：用于高级态势决策的多模态人工智能

专知会员服务

3+阅读 · 今天6:54

《无人机革命：来自俄乌战场的启示》（报告）

《无人机革命：来自俄乌战场的启示》（报告）

专知会员服务

5+阅读 · 今天6:48

《实现联合作战能力所需的技术》58页报告

《实现联合作战能力所需的技术》58页报告

专知会员服务

2+阅读 · 今天6:30

《算法化目标定位：人工智能在以色列加沙打击行动中的作用及其伦理影响》（中文版）

《算法化目标定位：人工智能在以色列加沙打击行动中的作用及其伦理影响》（中文版）

专知会员服务

5+阅读 · 今天6:22

以色列运用人工智能优化空袭警报系统

以色列运用人工智能优化空袭警报系统

专知会员服务

3+阅读 · 今天6:20

以色列在多条战线部署AI智能体

以色列在多条战线部署AI智能体

专知会员服务

4+阅读 · 今天6:12

《将形式化方法工具应用于电子战代码库（经验报告）》

《将形式化方法工具应用于电子战代码库（经验报告）》

专知会员服务

4+阅读 · 今天6:09

2025年大语言模型进展报告

2025年大语言模型进展报告

专知会员服务

19+阅读 · 4月25日

多智能体协作机制

多智能体协作机制

专知会员服务

15+阅读 · 4月25日

相关VIP内容

理解世界还是预测未来？世界模型的综合综述

理解世界还是预测未来？世界模型的综合综述

专知会员服务

78+阅读 · 2024年11月26日

从Sora中我们能看到什么：文本生成视频的综述

从Sora中我们能看到什么：文本生成视频的综述

专知会员服务

45+阅读 · 2024年6月2日

Sora是世界模拟器吗? 世界模型及其以后的综述

Sora是世界模拟器吗? 世界模型及其以后的综述

专知会员服务

41+阅读 · 2024年5月9日

Sora如何复现? 百万级真实提示库数据集，用于文本到视频扩散模型

Sora如何复现? 百万级真实提示库数据集，用于文本到视频扩散模型

专知会员服务

33+阅读 · 2024年3月13日

Sora 作为 AGI 世界模型？关于《文本到视频生成》完整综述

Sora 作为 AGI 世界模型？关于《文本到视频生成》完整综述

专知会员服务

48+阅读 · 2024年3月11日

Sora背后的技术，最新《可控生成与文本到图像扩散模型》综述

Sora背后的技术，最新《可控生成与文本到图像扩散模型》综述

专知会员服务

69+阅读 · 2024年3月9日

Sora的前世今生：从文生图到文生视频

Sora的前世今生：从文生图到文生视频

专知会员服务

49+阅读 · 2024年2月22日

文生视频模型Sora面世，AI生视频技术持续革新

文生视频模型Sora面世，AI生视频技术持续革新

专知会员服务

65+阅读 · 2024年2月20日

Sora视频生成模型相关论文集合！《视频生成模型作为世界模拟器》中引用的所有论文集合

Sora视频生成模型相关论文集合！《视频生成模型作为世界模拟器》中引用的所有论文集合

专知会员服务

57+阅读 · 2024年2月20日

OpenAI发布文生视频模型Sora，系统报告

OpenAI发布文生视频模型Sora，系统报告

专知会员服务

81+阅读 · 2024年2月19日

热门VIP内容

开通专知VIP会员享更多权益服务

《低成本自杀式无人机战争的军事战略影响：以乌克兰和伊朗为案例研究》

“Maven计划”的发展演变之“Maven智能系统”应用

何为下一代指挥与控制？美陆军选择第四步兵师进行快速原型NGC2开发

深入Maven智能系统：Palantir基于Claude打造的军事大脑

相关资讯

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

港科大浙大最新《深度生成模型三维表示》综述，20页pdf全面阐述3D生成进展

专知

12+阅读 · 2022年10月31日

超50篇论文串联起从VQA到多模态预训练大模型的前世今生—Part 1

超50篇论文串联起从VQA到多模态预训练大模型的前世今生—Part 1

PaperWeekly

16+阅读 · 2022年4月29日

最新《知识驱动的文本生成》综述论文，44页pdf

最新《知识驱动的文本生成》综述论文，44页pdf

专知

26+阅读 · 2020年10月14日

Video Description视频描述综述论文-方法、数据集和评估指标，UWA

Video Description视频描述综述论文-方法、数据集和评估指标，UWA

专知

38+阅读 · 2020年3月5日

文本+视觉，多篇 Visual/Video BERT 论文介绍

文本+视觉，多篇 Visual/Video BERT 论文介绍

AI科技评论

22+阅读 · 2019年8月30日

【综述】短文本主题建模最新综述（附17页全文下载）

【综述】短文本主题建模最新综述（附17页全文下载）

专知

33+阅读 · 2019年4月17日

视频生成的前沿论文，看我们推荐的7篇就够了

视频生成的前沿论文，看我们推荐的7篇就够了

人工智能前沿讲习班

34+阅读 · 2018年12月30日

Image Captioning 36页最新综述， 161篇参考文献

Image Captioning 36页最新综述， 161篇参考文献

专知

90+阅读 · 2018年10月23日

【论文推荐】最新八篇视频描述生成相关论文—在线视频理解、联合定位和描述事件、生成视频、跨模态注意力机制、联合事件检测和描述

【论文推荐】最新八篇视频描述生成相关论文—在线视频理解、联合定位和描述事件、生成视频、跨模态注意力机制、联合事件检测和描述

专知

11+阅读 · 2018年6月4日

【论文推荐】最新六篇图像描述生成相关论文—视频摘要、注意力张量积、非自回归神经序列模型、副词识别、多主体、多样性度量

【论文推荐】最新六篇图像描述生成相关论文—视频摘要、注意力张量积、非自回归神经序列模型、副词识别、多主体、多样性度量

专知

10+阅读 · 2018年3月2日

相关论文

Simulating the Real World: A Unified Survey of Multimodal Generative Models

Arxiv

0+阅读 · 2月16日

ALIVE: Animate Your World with Lifelike Audio-Video Generation

Arxiv

0+阅读 · 2月10日

ALIVE: Animate Your World with Lifelike Audio-Video Generation

Arxiv

0+阅读 · 2月9日

World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy

Arxiv

0+阅读 · 2月6日

RISE-Video: Can Video Generators Decode Implicit World Rules?

Arxiv

0+阅读 · 2月5日

Grounding Generated Videos in Feasible Plans via World Models

Arxiv

0+阅读 · 2月2日

Astra: General Interactive World Model with Autoregressive Denoising

Arxiv

0+阅读 · 1月27日

Rethinking Video Generation Model for the Embodied World

Arxiv

0+阅读 · 1月21日

StableWorld: Towards Stable and Consistent Long Interactive Video Generation

Arxiv

0+阅读 · 1月21日

World Craft: Agentic Framework to Create Visualizable Worlds via Text

Arxiv

0+阅读 · 1月21日

相关基金

基于知识库构建的图像和视频角色语义关系的研究

国家自然科学基金

1+阅读 · 2015年12月31日

融合稀疏层次模型的内容辨识研究

国家自然科学基金

2+阅读 · 2015年12月31日

基于复杂语义的个性化图像集摘要研究

国家自然科学基金

0+阅读 · 2015年12月31日

实验室模拟大气中羰基化合物与硫酸铵/胺液相反应形成SOA的研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于生态演替的文本大数据特征学习研究

国家自然科学基金

1+阅读 · 2015年12月31日

自由视点三维视频中纹理-深度图像联合建模及应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于DEM样本的交互式地形合成方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于概率图的文本检索模型及算法研究

国家自然科学基金

2+阅读 · 2014年12月31日

基于深度学习的三维模型检索技术

国家自然科学基金

13+阅读 · 2014年12月31日

面向时空变化的GIS数据模型

国家自然科学基金

6+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员