Measuring Iterative Temporal Reasoning with Time Puzzles - 专知论文

会员服务 ·

0

时序 · 基准 · 工具 · 约束 · 推断 ·

Measuring Iterative Temporal Reasoning with Time Puzzles

翻译：时序谜题：一种衡量迭代时序推理能力的基准

Zhengxiang Wang,Zeyu Dong

We introduce Time Puzzles, a constraint-based date inference task for evaluating iterative temporal reasoning. Each puzzle combines factual temporal anchors with (cross-cultural) calendar relations, admits one or multiple valid solution dates, and is algorithmically generated for controlled, dynamic, and continual evaluation. Across 13 diverse LLMs, Time Puzzles well distinguishes their iterative temporal reasoning capabilities and remains challenging without tools: GPT-5 reaches only 49.3% accuracy and all other models stay below 31%, despite the dataset's simplicity. Web search consistently yields substantial gains and using code interpreter shows mixed effects, but all models perform much better when constraints are rewritten with explicit dates, revealing a gap in reliable tool use. Overall, Time Puzzles presents a simple, cost-effective diagnostic for tool-augmented iterative temporal reasoning.

翻译：我们提出时序谜题，一种基于约束的日期推断任务，用于评估迭代时序推理能力。每个谜题将事实性时间锚点与（跨文化）日历关系相结合，允许存在一个或多个有效解日期，并通过算法生成以实现受控、动态和持续的评估。在13种不同的大型语言模型中，时序谜题有效区分了它们的迭代时序推理能力，且在无工具辅助时仍具挑战性：尽管数据集设计简洁，GPT-5的准确率仅为49.3%，其余所有模型均低于31%。网络搜索能持续带来显著提升，使用代码解释器则效果不一；但当约束条件被改写为显式日期时，所有模型表现均大幅改善，这揭示了可靠工具使用能力的差距。总体而言，时序谜题为工具增强的迭代时序推理提供了一种简单、经济高效的诊断基准。

0

相关内容

【AAAI2026】NeSTR：一种用于大型语言模型的神经-符号可溯因框架，用于时间推理

【AAAI2026】NeSTR：一种用于大型语言模型的神经-符号可溯因框架，用于时间推理

专知会员服务

17+阅读 · 2025年12月10日

大语言模型在时间序列中的推理与智能体系统综述

大语言模型在时间序列中的推理与智能体系统综述

专知会员服务

30+阅读 · 2025年9月16日

基于大语言模型的时序知识图谱推理模型蒸馏方法

基于大语言模型的时序知识图谱推理模型蒸馏方法

专知会员服务

38+阅读 · 2025年1月10日

时序知识图谱表示与推理的研究进展与趋势

时序知识图谱表示与推理的研究进展与趋势

专知会员服务

33+阅读 · 2024年10月14日

时序多模态知识图谱如何推理？国防科大最新《知识图谱推理:静态、时序和多模态》综述论文，全面阐述知识图谱推理技术进展

时序多模态知识图谱如何推理？国防科大最新《知识图谱推理:静态、时序和多模态》综述论文，全面阐述知识图谱推理技术进展

专知会员服务

107+阅读 · 2022年12月14日

【AAAI2023】基于历史对比学习的时序知识图谱推理

【AAAI2023】基于历史对比学习的时序知识图谱推理

专知会员服务

35+阅读 · 2022年11月23日

南大《时间序列分析（Time Series Analysis）》课程，推荐！

南大《时间序列分析（Time Series Analysis）》课程，推荐！

专知会员服务

156+阅读 · 2022年3月31日

【Google-BryanLim等】可解释深度学习时序预测

【Google-BryanLim等】可解释深度学习时序预测

专知会员服务

64+阅读 · 2021年12月19日

时间序列预测方法综述

专知会员服务

237+阅读 · 2020年12月15日

【牛津大学】深度学习时间序列预测，Time Series Forecasting With Deep Learning: A Survey

【牛津大学】深度学习时间序列预测，Time Series Forecasting With Deep Learning: A Survey

专知会员服务

142+阅读 · 2020年4月30日

【干货书】基于统计和机器学习的实用时间序列分析预测，Time Series Analysis Prediction

【干货书】基于统计和机器学习的实用时间序列分析预测，Time Series Analysis Prediction

专知

18+阅读 · 2022年4月9日

【经典书】时间序列分析与预测导论，671页pdf

【经典书】时间序列分析与预测导论，671页pdf

专知

16+阅读 · 2022年4月1日

【Manning新书】 Python中时间序列预测，222页pdf手把手教你实战时序建模

【Manning新书】 Python中时间序列预测，222页pdf手把手教你实战时序建模

专知

28+阅读 · 2022年3月29日

时空序列预测方法综述

时空序列预测方法综述

专知

22+阅读 · 2020年10月19日

开源新书《时间序列分析，数据/方法/应用》，6章110页pdf带你了解最新进展，附下载

开源新书《时间序列分析，数据/方法/应用》，6章110页pdf带你了解最新进展，附下载

专知

92+阅读 · 2019年11月20日

论文浅尝 | 时序与因果关系联合推理

论文浅尝 | 时序与因果关系联合推理

开放知识图谱

36+阅读 · 2019年6月23日

时序异常检测算法概览

时序异常检测算法概览

论智

29+阅读 · 2018年8月30日

基于 Keras 用深度学习预测时间序列

基于 Keras 用深度学习预测时间序列

R语言中文社区

23+阅读 · 2018年7月27日

关系推理：基于表示学习和语义要素

关系推理：基于表示学习和语义要素

计算机研究与发展

19+阅读 · 2017年8月22日

回归预测&时间序列预测

回归预测&时间序列预测

GBASE数据工程部数据团队

44+阅读 · 2017年5月17日

求解时间依赖问题的隐式时空并行 Schwarz 算法研究

国家自然科学基金

0+阅读 · 2017年12月31日

逻辑等价算子在不确定性推理中的应用

国家自然科学基金

1+阅读 · 2015年12月31日

多尺度时空特征约束的犯罪预测方法—以入室盗窃为例

国家自然科学基金

0+阅读 · 2015年12月31日

通用时序逻辑表达下的视频时空行为理解研究与应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于时序空间关系的目标跟踪及遮挡识别研究

国家自然科学基金

6+阅读 · 2015年12月31日

稳健随机均值模型在时空数据分析中的应用

国家自然科学基金

1+阅读 · 2014年12月31日

线性时序关系下推理的概率计量化模型

国家自然科学基金

0+阅读 · 2014年12月31日

近似周期时间序列分析及其在程序化交易中的应用

国家自然科学基金

0+阅读 · 2014年12月31日

不确定性推理与语义网中知识表示的数学基础

国家自然科学基金

18+阅读 · 2012年12月31日

时间序列数据挖掘中的聚类模型与算法研究

国家自然科学基金

14+阅读 · 2008年12月31日

TimeOmni-1: Incentivizing Complex Reasoning with Time Series in Large Language Models

Arxiv

0+阅读 · 2月18日

MemoTime: Memory-Augmented Temporal Knowledge Graph Enhanced Large Language Model Reasoning

Arxiv

0+阅读 · 2月16日

MTBench: A Multimodal Time Series Benchmark for Temporal Reasoning and Question Answering

Arxiv

0+阅读 · 2月11日

DiffuReason: Bridging Latent Reasoning and Generative Refinement for Sequential Recommendation

Arxiv

0+阅读 · 2月10日

MMTS-BENCH: A Comprehensive Benchmark for Time Series Understanding and Reasoning

Arxiv

0+阅读 · 2月9日

Time Series Reasoning via Process-Verifiable Thinking Data Synthesis and Scheduling for Tailored LLM Reasoning

Arxiv

0+阅读 · 2月8日

Inference-Time Rethinking with Latent Thought Vectors for Math Reasoning

Arxiv

0+阅读 · 2月6日

Bridging Graph Structure and Knowledge-Guided Editing for Interpretable Temporal Knowledge Graph Reasoning

Arxiv

0+阅读 · 1月29日

SokoBench: Evaluating Long-Horizon Planning and Reasoning in Large Language Models

Arxiv

0+阅读 · 1月28日

TEMPO: A Realistic Multi-Domain Benchmark for Temporal Reasoning-Intensive Retrieval

Arxiv

0+阅读 · 1月14日

VIP会员

文章信息

相关主题

最新内容

ICML 2026 | VOTP：用视频基础模型与最优传输，让离线偏好强化学习只需少量反馈

ICML 2026 | VOTP：用视频基础模型与最优传输，让离线偏好强化学习只需少量反馈

专知会员服务

5+阅读 · 6月16日

多模态代码智能综述：从视觉输入到可执行代码系统

多模态代码智能综述：从视觉输入到可执行代码系统

专知会员服务

5+阅读 · 6月16日

美国马六甲“三重网”概念：安全网、威慑网与杀伤网

美国马六甲“三重网”概念：安全网、威慑网与杀伤网

专知会员服务

5+阅读 · 6月16日

《面向导弹有效发射时机的监督机器学习方法：基于超视距空战仿真》

《面向导弹有效发射时机的监督机器学习方法：基于超视距空战仿真》

专知会员服务

5+阅读 · 6月16日

《通用大语言模型：无人机指挥与控制接口》最新40页

《通用大语言模型：无人机指挥与控制接口》最新40页

专知会员服务

15+阅读 · 6月16日

《通过小型无人机系统将情报能力“作战化”》

《通过小型无人机系统将情报能力“作战化”》

专知会员服务

6+阅读 · 6月16日

《神经安全型有人–无人协同：面向认知自适应作战能力的参考架构》

《神经安全型有人–无人协同：面向认知自适应作战能力的参考架构》

专知会员服务

10+阅读 · 6月16日

《在指挥链中通过多准则决策分析传达指挥官意图：空战实验》

《在指挥链中通过多准则决策分析传达指挥官意图：空战实验》

专知会员服务

21+阅读 · 6月15日

消耗优势：美军的“精确规模化”概念

消耗优势：美军的“精确规模化”概念

专知会员服务

8+阅读 · 6月15日

五角大楼的AI优先战略及其对现代战争的启示：来自与伊朗冲突的经验教训

五角大楼的AI优先战略及其对现代战争的启示：来自与伊朗冲突的经验教训

专知会员服务

9+阅读 · 6月15日

《网络空间兵棋推演：挑战、局限性与混合路径》报告

《网络空间兵棋推演：挑战、局限性与混合路径》报告

专知会员服务

9+阅读 · 6月15日

《离线语言支持系统：面向空战战术决策》

《离线语言支持系统：面向空战战术决策》

专知会员服务

10+阅读 · 6月15日

《以通信为中心的6G–LLM架构：面向可扩展的战术自主防御车辆网络》

《以通信为中心的6G–LLM架构：面向可扩展的战术自主防御车辆网络》

专知会员服务

9+阅读 · 6月15日

ICML 2026｜ECA：面向开放式图文生成的高效持续对齐

ICML 2026｜ECA：面向开放式图文生成的高效持续对齐

专知会员服务

6+阅读 · 6月14日

可信智能体AI综述：安全、鲁棒性、隐私与系统安全

可信智能体AI综述：安全、鲁棒性、隐私与系统安全

专知会员服务

6+阅读 · 6月14日

相关VIP内容

【AAAI2026】NeSTR：一种用于大型语言模型的神经-符号可溯因框架，用于时间推理

【AAAI2026】NeSTR：一种用于大型语言模型的神经-符号可溯因框架，用于时间推理

专知会员服务

17+阅读 · 2025年12月10日

大语言模型在时间序列中的推理与智能体系统综述

大语言模型在时间序列中的推理与智能体系统综述

专知会员服务

30+阅读 · 2025年9月16日

基于大语言模型的时序知识图谱推理模型蒸馏方法

基于大语言模型的时序知识图谱推理模型蒸馏方法

专知会员服务

38+阅读 · 2025年1月10日

时序知识图谱表示与推理的研究进展与趋势

时序知识图谱表示与推理的研究进展与趋势

专知会员服务

33+阅读 · 2024年10月14日

时序多模态知识图谱如何推理？国防科大最新《知识图谱推理:静态、时序和多模态》综述论文，全面阐述知识图谱推理技术进展

时序多模态知识图谱如何推理？国防科大最新《知识图谱推理:静态、时序和多模态》综述论文，全面阐述知识图谱推理技术进展

专知会员服务

107+阅读 · 2022年12月14日

【AAAI2023】基于历史对比学习的时序知识图谱推理

【AAAI2023】基于历史对比学习的时序知识图谱推理

专知会员服务

35+阅读 · 2022年11月23日

南大《时间序列分析（Time Series Analysis）》课程，推荐！

南大《时间序列分析（Time Series Analysis）》课程，推荐！

专知会员服务

156+阅读 · 2022年3月31日

【Google-BryanLim等】可解释深度学习时序预测

【Google-BryanLim等】可解释深度学习时序预测

专知会员服务

64+阅读 · 2021年12月19日

时间序列预测方法综述

专知会员服务

237+阅读 · 2020年12月15日

【牛津大学】深度学习时间序列预测，Time Series Forecasting With Deep Learning: A Survey

【牛津大学】深度学习时间序列预测，Time Series Forecasting With Deep Learning: A Survey

专知会员服务

142+阅读 · 2020年4月30日

热门VIP内容

开通专知VIP会员享更多权益服务

多模态代码智能综述：从视觉输入到可执行代码系统

《面向导弹有效发射时机的监督机器学习方法：基于超视距空战仿真》

ICML 2026 | VOTP：用视频基础模型与最优传输，让离线偏好强化学习只需少量反馈

美国马六甲“三重网”概念：安全网、威慑网与杀伤网

相关资讯

【干货书】基于统计和机器学习的实用时间序列分析预测，Time Series Analysis Prediction

【干货书】基于统计和机器学习的实用时间序列分析预测，Time Series Analysis Prediction

专知

18+阅读 · 2022年4月9日

【经典书】时间序列分析与预测导论，671页pdf

【经典书】时间序列分析与预测导论，671页pdf

专知

16+阅读 · 2022年4月1日

【Manning新书】 Python中时间序列预测，222页pdf手把手教你实战时序建模

【Manning新书】 Python中时间序列预测，222页pdf手把手教你实战时序建模

专知

28+阅读 · 2022年3月29日

时空序列预测方法综述

时空序列预测方法综述

专知

22+阅读 · 2020年10月19日

开源新书《时间序列分析，数据/方法/应用》，6章110页pdf带你了解最新进展，附下载

开源新书《时间序列分析，数据/方法/应用》，6章110页pdf带你了解最新进展，附下载

专知

92+阅读 · 2019年11月20日

论文浅尝 | 时序与因果关系联合推理

论文浅尝 | 时序与因果关系联合推理

开放知识图谱

36+阅读 · 2019年6月23日

时序异常检测算法概览

时序异常检测算法概览

论智

29+阅读 · 2018年8月30日

基于 Keras 用深度学习预测时间序列

基于 Keras 用深度学习预测时间序列

R语言中文社区

23+阅读 · 2018年7月27日

关系推理：基于表示学习和语义要素

关系推理：基于表示学习和语义要素

计算机研究与发展

19+阅读 · 2017年8月22日

回归预测&时间序列预测

回归预测&时间序列预测

GBASE数据工程部数据团队

44+阅读 · 2017年5月17日

相关论文

TimeOmni-1: Incentivizing Complex Reasoning with Time Series in Large Language Models

Arxiv

0+阅读 · 2月18日

MemoTime: Memory-Augmented Temporal Knowledge Graph Enhanced Large Language Model Reasoning

Arxiv

0+阅读 · 2月16日

MTBench: A Multimodal Time Series Benchmark for Temporal Reasoning and Question Answering

Arxiv

0+阅读 · 2月11日

DiffuReason: Bridging Latent Reasoning and Generative Refinement for Sequential Recommendation

Arxiv

0+阅读 · 2月10日

MMTS-BENCH: A Comprehensive Benchmark for Time Series Understanding and Reasoning

Arxiv

0+阅读 · 2月9日

Time Series Reasoning via Process-Verifiable Thinking Data Synthesis and Scheduling for Tailored LLM Reasoning

Arxiv

0+阅读 · 2月8日

Inference-Time Rethinking with Latent Thought Vectors for Math Reasoning

Arxiv

0+阅读 · 2月6日

Bridging Graph Structure and Knowledge-Guided Editing for Interpretable Temporal Knowledge Graph Reasoning

Arxiv

0+阅读 · 1月29日

SokoBench: Evaluating Long-Horizon Planning and Reasoning in Large Language Models

Arxiv

0+阅读 · 1月28日

TEMPO: A Realistic Multi-Domain Benchmark for Temporal Reasoning-Intensive Retrieval

Arxiv

0+阅读 · 1月14日

相关基金

求解时间依赖问题的隐式时空并行 Schwarz 算法研究

国家自然科学基金

0+阅读 · 2017年12月31日

逻辑等价算子在不确定性推理中的应用

国家自然科学基金

1+阅读 · 2015年12月31日

多尺度时空特征约束的犯罪预测方法—以入室盗窃为例

国家自然科学基金

0+阅读 · 2015年12月31日

通用时序逻辑表达下的视频时空行为理解研究与应用

国家自然科学基金

0+阅读 · 2015年12月31日

基于时序空间关系的目标跟踪及遮挡识别研究

国家自然科学基金

6+阅读 · 2015年12月31日

稳健随机均值模型在时空数据分析中的应用

国家自然科学基金

1+阅读 · 2014年12月31日

线性时序关系下推理的概率计量化模型

国家自然科学基金

0+阅读 · 2014年12月31日

近似周期时间序列分析及其在程序化交易中的应用

国家自然科学基金

0+阅读 · 2014年12月31日

不确定性推理与语义网中知识表示的数学基础

国家自然科学基金

18+阅读 · 2012年12月31日

时间序列数据挖掘中的聚类模型与算法研究

国家自然科学基金

14+阅读 · 2008年12月31日

微信扫码咨询专知VIP会员