我们介绍了 HourVideo,一个用于小时级视频-语言理解的基准数据集。该数据集包含一个全新的任务套件,涵盖了摘要生成、感知(回忆、跟踪)、视觉推理(空间、时间、预测、因果、反事实)以及导航(从房间到房间、对象检索)任务。HourVideo 包含了从 Ego4D 数据集中精心挑选的500个第一人称视频,时长从20分钟到120分钟不等,涵盖了12,976道高质量的五选一多项选择题。基准测试结果显示,多模态模型(包括 GPT-4 和 LLaVA-NeXT)仅比随机猜测略有提升。与之形成鲜明对比的是,人类专家的表现显著优于当前最先进的长上下文多模态模型 Gemini Pro 1.5(85.0% 对比 37.3%),这突显出多模态能力上的巨大差距。我们的基准数据集、评估工具包、提示和文档已在 hourvideo.stanford.edu 上发布。

成为VIP会员查看完整内容
30

相关内容

【2022新书】Python数据分析第三版,579页pdf
专知会员服务
257+阅读 · 2022年8月31日
南洋理工最新《视频自然语言定位》2022综述
专知会员服务
25+阅读 · 2022年1月29日
【干货书】R语言探索性数据分析,218页pdf
专知会员服务
63+阅读 · 2021年9月14日
深度学习自然语言处理概述,116页ppt,Jiří Materna
专知会员服务
81+阅读 · 2020年3月10日
【2022新书】Python数据分析第三版,579页pdf
专知
19+阅读 · 2022年8月31日
【Tutorial】计算机视觉中的Transformer,98页ppt
专知
21+阅读 · 2021年10月25日
PointNet系列论文解读
人工智能前沿讲习班
17+阅读 · 2019年5月3日
国家自然科学基金
9+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
14+阅读 · 2015年12月31日
国家自然科学基金
7+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
47+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
5+阅读 · 2014年12月31日
国家自然科学基金
8+阅读 · 2014年12月31日
Arxiv
176+阅读 · 2023年4月20日
A Survey of Large Language Models
Arxiv
501+阅读 · 2023年3月31日
Arxiv
83+阅读 · 2023年3月26日
Arxiv
182+阅读 · 2023年3月24日
Arxiv
27+阅读 · 2023年3月17日
VIP会员
最新内容
《无人机脆弱性利用:网络空间力量的新域》
专知会员服务
2+阅读 · 今天4:08
美空军如何将人工智能从战场部署至后方机关
专知会员服务
11+阅读 · 7月31日
《史诗怒火行动:多域前瞻评估》49页报告
专知会员服务
7+阅读 · 7月31日
《英国防部:未来空战系统数字化战略》33页
专知会员服务
5+阅读 · 7月31日
《面向自主飞行网络的智能体人工智能架构》
专知会员服务
7+阅读 · 7月31日
“史诗怒火”行动:现代多域作战的重要节点
专知会员服务
8+阅读 · 7月30日
《下一代无线网络中的多无人机通信资源管理》
相关基金
国家自然科学基金
9+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
14+阅读 · 2015年12月31日
国家自然科学基金
7+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
47+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
5+阅读 · 2014年12月31日
国家自然科学基金
8+阅读 · 2014年12月31日
微信扫码咨询专知VIP会员