综述 | 面向时间序列的大模型智能体:任务体系、设计模式与未来方向

近年来,大语言模型智能体正在从通用问答、代码生成和网页操作,进入更强调连续观测、数值约束和闭环决策的时间序列场景。时间序列任务并不只是“把一段数据交给模型预测下一步”,它往往涉及数据诊断、模式检索、工具调用、候选方案比较、历史经验记忆、外部事件对齐以及在线反馈修正。 本文整理 arXiv 综述论文 LLM Agents for Time-Series: A Survey。论文由 Northwestern University、Datadog AI Research 与 Nokia 的研究者撰写,系统梳理了 47 个面向时间序列问题的大模型智能体系统。与按“规划、工具、记忆”等通用能力来分类不同,作者采用问题驱动视角,将现有工作归为预测与推理、增强与合成、异常检测与诊断、决策支持四类,并进一步分析不同任务如何塑造智能体架构、工具使用和记忆设计。

导读

这篇综述的核心价值在于,它把“时间序列 + 大模型智能体”从一个泛化概念拆成了可落地的系统设计问题。时间序列本身具有非平稳、噪声、缺失、周期性、多变量耦合、长短期依赖和流式更新等特征;智能体系统则强调规划、行动、工具调用、记忆和反馈。二者结合后,关键不再只是模型能否读懂曲线,而是能否在多步骤流程中持续收集证据、调用专业工具、维护可追溯记忆,并根据任务约束生成可验证输出。 论文给出三个贯穿全文的分析维度:架构、工具和记忆。架构回答“一个智能体做完,还是多个智能体分工/竞争/混合协作”;工具回答“哪些外部计算、检索、数据库、模拟器或优化器应被纳入流程”;记忆回答“中间证据、历史模式、分析策略和失败经验如何保存并复用”。在时间序列场景中,这三者往往比单个基础模型更能决定系统可靠性。 从任务侧看,论文将时间序列智能体分为四大类。预测与推理强调数值证据和上下文证据;增强与合成强调语义保持、文本控制与领域约束;异常检测与诊断强调可靠告警、证据质量和人机协同;交易、交通、电网等决策支持任务则强调可执行动作、风险偏好和闭环环境。 本文适合三类读者:一是关注大模型智能体系统设计的研究者,二是做时间序列预测、异常检测、金融/交通/能源决策的工程团队,三是希望理解“智能体能否真正改善时间序列分析”的读者。结论上,论文并不把 LLM 视为替代所有时间序列模型的万能预测器,而是强调它更适合作为工作流控制器、证据组织者、工具协调者和可解释决策组件。

1 Introduction | 引言

时间序列分析广泛存在于金融、交通、能源、气候、工业监控和医疗等场景。传统方法包括 ARIMA、ARCH/GARCH、HMM、LOF 等统计或经典机器学习模型,深度学习时代又出现了 LSTM、TCN、DeepAR、Transformer、PatchTST、TimesNet 等模型。这些方法在数值建模上非常重要,但在真实系统中仍然高度依赖专家来设计流程、选择特征、解释结果和处理异常情况。 大语言模型带来的变化是:它们不仅能作为文本接口,还可以作为智能体参与多步工作流。一个面向时间序列的 LLM Agent 通常要观察输入数据、选择分析步骤、调用工具、维护记忆、修正假设,并在必要时协调多个子智能体。对时间序列任务而言,这一点尤其重要,因为许多应用都不是静态预测,而是持续面对新观测、分布漂移、外部事件和行动反馈。 论文强调,现有时间序列 LLM 综述通常按模型能力或方法组件组织,例如提示、表征、对齐、预测、推理等;通用智能体综述则很少深入讨论时间序列特有问题,如流式输入、时间依赖、非平稳性、外部事件对齐和动作-数据耦合。因此,本综述选择以任务为主线:先定义时间序列智能体,再观察不同任务中的架构、工具和记忆设计。 作者的工作对象不是“所有使用 LLM 的时间序列系统”,而是有明确智能体特征的系统:LLM 至少要做出一个会改变多步时间序列流程的决策,例如选择工具、更新记忆、修正假设、协调阶段或产生可执行动作。单次提示、静态编码器、事后解释器,以及没有时间序列约束的通用智能体不属于主要范围。

2 Background and Foundations | 背景与基础

论文首先界定时间序列数据的基本形式。时间序列可以来自连续时间过程,但实际系统通常处理离散观测或 token 化索引。每个时间点可能包含多个通道、协变量或空间传感器信息。对于不规则、噪声大或缺失严重的数据,系统往往需要构造历史摘要来表示当前上下文。 时间序列建模的目标并不只有预测。它可以产生未来数值、异常分数、表示向量、解释摘要、控制动作或决策建议。统计模型通常显式编码依赖、平稳性、潜在状态和不确定性假设;深度模型更擅长从大规模数据中学习复杂模式;LLM 相关方法则尝试把数值序列转为语言、多模态或工具可处理的形式,让语言模型参与推理和解释。 但论文提醒,单独的 LLM 时间序列模型通常并不会主动选择工作流、调用工具、更新记忆或根据中间反馈修正假设。智能体系统的关键在于从“单次推理”走向“观察-行动-更新”的闭环。这个闭环既可以由一个智能体完成,也可以由多个具有不同角色的智能体协作完成。

3 Fundamental Design Dimensions | 三个基础设计维度

架构

论文把时间序列智能体架构分为单智能体和多智能体两大类。单智能体系统由一个 LLM 负责计划、工具调用、记忆维护和输出生成,优点是流程紧凑、实现成本低,适合任务边界清楚、工具链较短的场景。但当任务同时涉及数据清洗、模型选择、外部检索、解释、验证和决策时,单智能体容易出现上下文拥塞和职责混杂。 多智能体系统进一步分为合作式、竞争式和混合式。合作式系统把任务拆给互补角色,例如数据处理者、预测者、验证者、解释者、决策者;竞争式系统让多个智能体或候选方案生成不同假设,再通过评分、投票、辩论或裁判进行选择;混合式系统则在一个流程中同时包含角色分工和候选比较。对时间序列而言,竞争式架构常用于应对不同时间尺度、外部因素或模型假设之间的不确定性。

工具

时间序列智能体中的工具并不是附属功能,而是系统可靠性的基础。论文归纳了几类常见工具:数据库接口用于访问结构化观测和历史数据;检索接口用于查找相似片段、外部新闻、领域知识或历史案例;数据处理工具用于清洗、插值、分解、归一化和特征构造;统计与机器学习模型用于预测、异常检测、聚类、回归或不确定性估计;模拟器、求解器和优化器则用于交通、电网、交易等闭环控制场景。 这一设计思路很务实:LLM 不必替代专业时间序列模型,而是可以负责“何时调用什么工具、如何解释工具结果、如何把工具输出放回任务上下文”。在真实系统中,工具输出还提供了可审计证据,能够降低纯语言推理带来的幻觉风险。

记忆

时间序列智能体的记忆主要承担三类作用。第一类是证据日志,记录中间预测、检索片段、工具输出、候选动作、验证结果和失败原因,使系统输出具备可追溯性。第二类是模式库,保存历史案例、典型形态、相似序列片段、领域规则或策略模板,便于后续检索复用。第三类是分析策略记忆,保存过去有效或失败的分析路径,帮助智能体在长期运行中更新工作流。 时间序列任务特别依赖记忆,因为许多结论只有在比较历史模式、局部片段和外部事件后才成立。例如金融交易中的风险偏好、工业诊断中的故障案例、交通控制中的突发拥堵模式,都不是单个窗口内可以完整表达的。

4 Taxonomy | 任务分类体系

论文的核心贡献是问题驱动分类体系。作者认为,读者在实践中更关心“某类时间序列问题应该选择什么智能体设计”,而不是孤立讨论规划、工具或记忆。基于此,论文将 47 个代表性系统划分为四大类,并在每类内部讨论架构、工具和记忆如何服务任务需求。

预测与推理

预测与推理共享一个要求:输出不能只是语言上合理,还必须由明确的数值证据或上下文证据支撑。固定上下文窗口或粗粒度摘要通常不够,因为正确结论可能依赖局部时序模式、历史类比、可复用原型,或与新闻、天气、政策、市场事件等外部信息的对齐。 在时间序列预测中,智能体系统通常围绕多阶段流程和竞争假设展开。多阶段流程可能包括数据诊断、预处理、模型选择、上下文分析、预测生成、验证和校准。竞争假设则让不同智能体或候选策略关注不同信号、时间尺度或外生因素,再根据误差反馈或验证结果进行选择。相关代表系统包括 TimeSeriesScientist、TimeXL、TimeCAP、NewsTSForecasting、TRACE、FLAIRR-TS、Nexus 和 CastFlow 等。 时间序列推理则更强调解释、问答或分类,而不一定直接预测未来数值。关键挑战是领域知识、数值支持和多步推理可靠性。论文提到,许多系统会把规划和计算分离:主智能体负责协调任务,数值计算交给专业工具或子智能体。Agentic-RAG、TS-Agent、TS-Reasoner、ZARA、CLIMATEAGENT 和 FETA 等工作体现了检索、工具、领域知识和验证机制在推理中的作用。

增强与合成

增强与合成都是构造额外时间序列数据,但关注点不同。增强通常围绕目标序列生成扰动或文本注释,核心问题是保持任务相关语义;合成则从文本描述、场景条件或领域规则出发生成新序列,核心问题是文本控制和约束一致性。 在数值增强中,系统不能只生成“看起来像”的序列,还要保持趋势、周期、局部形状、变量相关性和下游标签语义。否则增强数据可能提高表面多样性,却破坏真正有用的判别结构。文本增强则要求智能体理解领域注释,把传感器、行为、事件或状态变化转化为可训练、可检索或可解释的文本表示。 在合成任务中,LLM 常扮演解析器、条件生成协调者或质量门控者。它需要将用户给出的场景描述转为结构化控制条件,再调用生成模型或领域工具产生序列,并检查输出是否满足物理、统计或业务约束。代表工作包括 TESSA、DCATS、MERIT、ChatTS、BRIDGE 和 GenAI4RiskModeling 等。

异常检测与诊断

异常检测关心“是否异常、何时异常”,诊断进一步关心“为什么异常、哪里异常、如何处理”。论文指出,这一类任务的难点不只是提高告警分数,而是保证证据质量、避免引入比基础检测器更差的结果,并支持持续监控中的更新与反馈。 在异常检测中,智能体通常需要整合原始序列、摘要统计、学习特征、检索片段和规则输出。可靠系统会把这些证据纳入提示或下游模块,而不是让 LLM 仅凭曲线描述判断异常。AD-AGENT、ARGOS、CALM、SLEP、SAGE 等工作展示了证据增强、检测器协同、审查智能体和反馈修正的不同路线。 诊断任务更接近真实运维和工业场景。一个系统可能先发现告警,再定位原因,随后提出缓解动作并把人类反馈写入流程。这里的智能体不仅要输出解释,还要将解释和传感器、日志、历史故障、规则库、控制动作相连。论文强调,人机协同在诊断中很重要,因为许多根因判断依赖领域知识和现场上下文。

决策支持

决策支持与预测、诊断不同,输出是可执行动作、计划或资源分配,而不是描述性判断。动作必须落在预定义动作空间中,并满足领域约束。论文主要讨论交易、交通控制和电网控制三个方向。 交易智能体需要处理新闻、财报、社交媒体、收益电话会、技术指标、价格序列和风险偏好。单个智能体很容易被异构证据淹没,因此多智能体分工常见:不同分析师处理不同信息源,经理智能体汇总策略,回测智能体检查历史表现。代表系统包括 ElliottAgents、TradingAgents、FinCon、FinAgent、FactorMAD、FinMem、FinRL-DeepSeek、ATLAS 等。 交通和电网控制则更强调闭环环境。智能体面对的是状态、动作、约束和奖励,而不是一次性答案。交通控制需要在事故、拥堵和信号相位之间作出实时决策;电网控制需要考虑安全约束、稳定性、成本和扰动。此时模拟器、求解器和优化器比普通文本检索更关键,LLM 的价值在于解释状态、选择策略、协调工具并处理异常场景。

5 Resources | 数据、基准与工具资源

论文进一步整理了实现和评估时间序列智能体的资源,分为数据集与仓库、基准、交互环境和工具包。 数据集与仓库提供训练和离线评估所需的原始观测。预测方向常见资源包括 Electricity、METR-LA、ETT、M4、M5、Monash TSF 等;异常检测方向包括 SWaT、SMAP/MSL、Yahoo、NAB、TSB-UAD 等;交通和能源方向还涉及带空间结构和控制约束的数据。 基准用于让不同方法在可比任务和指标下评估。预测任务常使用 MAE、MSE、RMSE、MAPE、SMAPE 等指标;分类和推理任务使用准确率、F1、Macro-F1;异常检测还会使用 point-wise F1、event-level F1、AUC、AUPR 等;交易任务关注累计收益、夏普比率、最大回撤、波动率和换手率;交通控制任务则常用平均通行时间、等待时间、排队长度等闭环指标。 交互环境对智能体尤其重要。预测或异常检测可以离线评估,但交易、交通、电网等任务必须检验智能体在状态变化、动作反馈和约束冲突中的表现。论文也强调,不同论文报告的成绩并不总是天然可比,因为时间窗口、数据切分、异常点调整规则、交易成本假设、模拟器配置都会影响结果。

6 Future Work | 未来方向

论文最后提出四个开放方向。

数值理解与领域知识

LLM 对数值信号和专业领域知识的理解仍然有限。即使引入外部工具,智能体仍要正确解释工具输出,并将其与领域机制相连接。未来系统需要更强的数值-语言对齐、更可靠的单位/尺度处理,以及面向金融、交通、能源、气候等领域的知识约束。

因果与反事实推理

许多时间序列智能体仍主要依赖相关性,而诊断和决策支持需要回答干预、延迟效应和反事实结果。如果系统无法区分相关、因果和共同驱动因素,就容易生成看似合理但不可执行的解释。未来研究需要将因果发现、结构假设、反事实模拟和智能体工具链结合起来。

在线适应与持续改进

异常检测、交易、交通和电网控制都不是一次性任务。真实系统会遇到分布漂移、新模式、反馈延迟和失败积累。未来智能体需要在部署后持续学习:记录失败、更新模式库、调整策略、校准风险,并保证这种更新不会破坏系统稳定性。

评估与可靠性

时间序列智能体的评估不能只看最终分数。论文主张同时检查中间证据、工具调用、记忆更新、约束满足和失败模式。一个预测更准但无法解释证据来源的系统,未必适合高风险应用;一个能给出漂亮解释但没有与数值证据对齐的系统,也可能在关键场景中误导决策。

结语

这篇综述的一个重要判断是:时间序列大模型智能体的竞争力,通常来自“强时间序列模型 + 可验证工具 + 任务化工作流 + 可追溯记忆”的组合,而不是让 LLM 单独替代所有专业模型。 对研究者而言,未来值得关注的是更细粒度的任务基准、可复现的智能体评估、面向流式数据的在线记忆,以及因果/反事实能力。对工程团队而言,更现实的路线是把 LLM 放在流程编排、证据组织、异常解释、工具协调和人机交互的位置上,让它成为时间序列系统中的“分析控制层”,而不是孤立的预测器。 原论文:LLM Agents for Time-Series: A Survey 论文链接:https://arxiv.org/abs/2608.26226

成为VIP会员查看完整内容
0

相关内容

时间序列(或称动态数列)是指将同一统计指标的数值按其发生的时间先后顺序排列而成的数列。时间序列分析的主要目的是根据已有的历史数据对未来进行预测。经济数据中大多数以时间序列的形式给出。根据观察时间的不同,时间序列中的时间可以是年份、季度、月份或其他任何时间形式。
VIP会员
最新内容
《国防技术管理》印度智库报告最新45页
专知会员服务
1+阅读 · 今天14:49
《美陆军最新条令:保障行动》
专知会员服务
1+阅读 · 今天14:39
算法战场:人工智能如何重新定义军事力量
专知会员服务
2+阅读 · 今天14:29
《北约联邦式电子战云架构》
专知会员服务
5+阅读 · 8月27日
《美陆军野战手册:空域管理战术》
专知会员服务
7+阅读 · 8月27日
微信扫码咨询专知VIP会员