时序预测基座模型研究发展进程与现状
引言
时间序列预测是数据科学中最古老也最实用的问题之一,从电力负荷、零售需求到金融风险管理无处不在。过去两年,随着大语言模型(LLM)范式的成功,"预训练+零样本泛化"的思路被大规模移植到时序领域,催生了一批"时序基座模型"(Time Series Foundation Model, TSFM)。本文梳理这一领域从统计方法到基座模型的演进脉络、当前的技术版图,以及围绕它的核心争议。
一、发展脉络:三个时代
1. 统计方法时代(20世纪中期—2018)
ARIMA、指数平滑(ETS)、Theta 等经典统计模型长期是时序预测的基石。它们参数量小、可解释性强、对短序列和规则性强的数据效果稳定,至今仍是工业界许多场景(尤其是低频、少量序列)的默认选择。2018 年的 M4 竞赛(Makridakis Competition)验证了这一时期的分水岭:冠军方案是"Hybrid ES-RNN"——统计模型(指数平滑)与神经网络(RNN)的混合体,而非纯统计或纯深度学习方法,说明当时纯深度学习尚未能稳定超越精调的统计基线。
2. 专用深度学习模型时代(2019—2023)
这一阶段的核心命题是:如何设计更适合时序结构(趋势、周期、多尺度依赖)的深度网络。代表性工作包括:
- N-BEATS(2019,ElementAI):纯深度学习架构,通过堆叠的全连接残差块反复做"回溯(Backcast)+预测(Forecast)"分解,在 M4 竞赛上取得当时最优成绩。
- Informer(2021,AAAI):提出 ProbSparse 自注意力机制解决长序列 Transformer 的计算瓶颈,开启了"Transformer 做长序列预测"的热潮,随后有 Autoformer、FEDformer 等改进。
- PatchTST(2023,ICLR):将 NLP 领域的 Patch 分段思想引入时序 Transformer,把连续时间片段而非单点作为最小建模单元,显著提升长序列预测效果,成为后续大多数时序基座模型 tokenization 方式的直接灵感来源。
- 与此同时,也出现了"简单模型打脸复杂架构"的反思声音——Zeng et al. 的论文《Are Transformers Effective for Time Series Forecasting?》(2022)指出,一个简单的线性模型 DLinear 在多个长序列预测基准上能匹敌甚至超过当时的主流 Transformer 变体,这一争论延续至今(见第四节)。
3. 基座模型时代(2023—至今)
受 GPT 系列"大规模预训练+零样本/少样本泛化"范式启发,研究者开始探索:能否用一个模型,不经任何任务特定训练,直接预测从未见过的时序数据?这标志着时序预测从"每个任务训一个模型"转向"预训练一个通用模型,推理时直接用"。这一转型的标志性节点:
- TimeGPT(Nixtla,2023):较早提出"时序领域的 GPT"概念,以商业 API 形式提供零样本预测服务。
- Lag-Llama(2024,ServiceNow/Mila):开源的概率时序基座模型,使用滞后特征(lag features)作为协变量,基于 Transformer 解码器架构。
- TimesFM(Google Research,2024):decoder-only、patch-based 架构,用真实与合成数据混合预训练,参数量约 2 亿,是较早证明"小而通用"基座模型可行性的工作之一。
- Chronos(Amazon,2024):把时序值当作"语言"来处理——通过缩放+分箱(scaling + quantization)将连续数值离散化为 token,直接复用 T5 等现成语言模型架构和训练方法,并引入 KernelSynth 生成合成训练数据缓解真实数据不足的问题。
- Moirai / Moirai-MoE(Salesforce,2024):masked encoder 架构,提出"any-variate attention"以统一处理不同变量数和频率的数据,并用多种 patch 尺寸适配不同采样频率;Moirai-MoE 进一步引入混合专家结构提升容量效率比。
- TTM / Tiny Time Mixers(IBM,2024):反其道而行之,用不到百万参数的轻量 MLP-Mixer 架构证明"以小博大"——在多个基准上媲美十亿参数级模型,同时可在 CPU 上快速推理,代表资源受限场景的技术路线。
- Time-MoE(2024):稀疏混合专家 + decoder-only 架构,将时序基座模型的参数规模推向数十亿级别,探索时序领域的 scaling law。
- Sundial(2025,清华大学):采用生成式/flow-matching 方法建模连续分布,试图摆脱传统的离散化分位数预测头,代表生成式建模在时序预测中的探索。
- Toto(2025,Datadog):面向可观测性(observability/ITOps)场景的时序基座模型,强调多变量场景下数值与类别信号的联合处理。
- Falcon-TST(鹰序)(2025,蚂蚁国际):业内首个将 Patch 分段与混合专家(MoE)结合、并借鉴 N-BEATS 残差分解思想的大规模时序基座模型,参数规模超过 25 亿,聚焦金融跨境支付、外汇风险预测场景,2025 年 11 月开源(详见文章二深度解析)。(来源)
- 第二代模型迭代(2025—2026):Chronos-2、TimesFM 2.5、Moirai-2.0 相继发布,普遍强化了原生多变量/协变量支持、更长上下文、更快推理速度。多项 2026 年的研究(如 Anchored-and-Agile Test-Time Adaptation 相关工作)显示,这些第二代模型在微调后仍能显著超越纯零样本表现,说明"零样本即最优"的叙事仍需谨慎看待(见第四节)。(来源)
二、技术路线分类
时序基座模型内部并非单一范式,可以从几个维度切分:
| 维度 | 路线 A | 路线 B | 代表 |
|---|---|---|---|
| 底层架构来源 | 直接复用/借壳预训练语言模型架构 | 从零训练时序原生架构 | Chronos(借壳 T5)vs. TimesFM/Moirai/TTM(原生设计) |
| Tokenization | Point-based(逐点离散化) | Patch-based(分段建模) | Chronos vs. PatchTST/TimesFM/Moirai/Falcon-TST |
| 输出形式 | 确定性点预测 | 概率/分位数分布预测 | 早期专用模型多为确定性 vs. 绝大多数基座模型默认概率输出 |
| 变量支持 | 仅单变量 | 多变量/协变量感知 | 第一代 TimesFM/Chronos vs. Moirai 的 any-variate attention、第二代模型 |
| 序列建模范式 | Decoder-only 自回归 | Masked Encoder / 双向全注意力 / 生成式扩散 | TimesFM/Time-MoE/Lag-Llama vs. Moirai vs. Sundial |
值得注意的是,多数"基座模型"并不是像 LLM 那样直接复用预训练语言模型权重做迁移(Chronos 是少数例外,它复用架构而非权重),而是借鉴 LLM 的训练范式(大规模、多域、自监督预训练)在时序原生架构上重新训练。这与 NLP 领域"一个预训练权重迁移到所有任务"的迁移学习模式有本质区别。
三、评测基准现状
- Monash Time Series Archive:长期作为时序预测的标准化数据集合(约 30+ 数据集),在基座模型出现之前就已是学界通用参照,但数据集多为公开可获取,也正是"数据污染"争议的源头之一。
- M4 / M5 竞赛:Makridakis 系列竞赛(M4 面向 10 万条单变量序列,M5 面向沃尔玛零售需求的层级预测)长期被视为检验预测方法实战能力的金标准,混合方法(统计+深度学习)历史上多次跑赢纯方法。
- GIFT-Eval(Salesforce,2024/2025):专门为标准化评测零样本基座模型而设计的综合基准,覆盖多域、多频率、多序列长度的任务分布,试图解决此前各家自行选数据集评测、结果难以横向比较的问题。
- TIME 基准(ICML 2026 投稿):包含 50 个"新鲜"数据集与 98 个预测任务,专门为严格零样本评测、避免数据泄露而设计——这个基准本身的出现,就是对现有评测体系可信度的一次直接回应。(来源)
这些基准各有局限:Monash/M4/M5 出现早于基座模型时代,其公开数据大概率已被后续模型的预训练语料吸收,用作"零样本"测试已不再干净;GIFT-Eval 虽然设计更严谨,但作为一个静态基准,本身也面临着被后续模型"刷榜式过拟合"的风险。
四、核心争议与挑战
1. 零样本预测的真实有效性存疑
多项 2025-2026 年的研究显示,看似"开箱即用"的零样本基座模型,在微调或轻量校准后仍有显著提升空间。例如涉及 Chronos-2、TimesFM 2.5、Moirai-2.0 的多篇测试时自适应(test-time adaptation)研究发现,微调版本在几乎所有测试场景下都优于对应的零样本版本;甚至有工作显示,一个只更新校准器(calibrator)参数、其余部分冻结的轻量方法就能超越零样本大模型的表现。(来源、来源)这提示零样本能力被过度渲染的可能性:基座模型提供的是"更好的初始化/更强的先验",而非真正意义上"无需任何领域适配就能媲美专用模型"。
2. 训练数据泄露/污染问题
时序基座模型的预训练语料通常大量爬取公开数据集(如 Monash 归档、各类开源传感器/金融/能源数据),而这些数据集又恰恰是学界用来做"零样本"评测的测试集。换言之,很多"零样本"跑分实际上可能是变相的"训练集内测试"。ICML 2026 的 TIME 基准正是针对这一问题,专门构建全新、未被污染的数据集来做"干净"的零样本评测——这个基准的存在本身,说明业内已经普遍意识到该问题的严重性。
3. 与传统方法/专用模型的对比争议:是否被过度炒作
- 一方面,有真实业务场景的证据支持基座模型的价值:例如智能电表(AMI)数据缺口填补场景中,Chronos 和 TimeGPT 相比 ARIMA 展现出有意义的精度提升,尤其在短缺口填补任务上。(来源)
- 另一方面,学界对当前深度学习时序预测的架构复杂度提出了系统性质疑。IDSIA(意瑞大学)与米兰理工大学在 2025 年底的论文《What Matters in Deep Learning for Time Series Forecasting?》中指出:大量"新颖架构"本质上只是把预测理论中早已明确的"局部/全局/混合建模"范式重新包装,很多被忽视的实现细节(而非核心建模层的选择)才是决定性能差异的关键;设计良好的简单架构(如 MLP)往往能匹敌复杂的最先进模型。该文呼吁重新思考当前存在缺陷的基准测试实践,并提出"预测模型卡片"模板以提升研究的透明度和可比性。(来源)这与 2022 年 DLinear 挑战复杂 Transformer 的争论一脉相承,说明"复杂架构是否值得其计算代价"在该领域始终未有定论。
- 现实的工业选择往往是折中的:精调后的统计方法(ARIMA/ETS)在数据量小、序列规则的场景依然极具性价比;基座模型的优势更多体现在"冷启动"(无历史数据/新序列)、多域迁移、以及作为下游微调起点的场景。
4. 部署与推理成本的现实约束
随着 Time-MoE、Falcon-TST 等模型把参数规模推向十亿甚至数十亿级别,其推理延迟和算力成本对高频、低延迟场景(如实时风控、高频交易)构成挑战。这也解释了为何 IBM TTM 坚持"小而快"(不到百万参数、可 CPU 推理)的反向路线——基座模型领域正在朝"通用大模型"和"专用轻量模型"两个方向分化,而非收敛到单一最优解。
五、2025—2026 年趋势方向
- 第二代模型集体换代:Chronos-2、TimesFM 2.5、Moirai-2.0 均在原生多变量/协变量支持、更长上下文、推理效率上做了系统性升级,反映出第一代基座模型"仅支持单变量、零样本能力有限"的痛点已被业界充分意识到。
- 垂直领域专用基座模型兴起:继通用基座模型之后,出现了 Falcon-TST(金融/跨境资金)、Toto(IT 可观测性)等针对特定领域外部信号(汇率、物流、天气、系统指标)深度整合的专用模型,说明"通用 vs. 垂直"的分化正在发生,垂直模型往往能引入更丰富的领域特定协变量(如 Falcon-TST 甚至纳入热带植物生长数据作为气候变化的先导指标)。
- MoE 架构从 LLM 向时序领域扩散:Time-MoE、Moirai-MoE、Falcon-TST 均采用混合专家结构,用于在扩大模型容量的同时控制推理成本,是 LLM 领域成熟技术在时序领域的复用。
- 生成式/连续分布建模的探索:Sundial 代表的 flow-matching 路线试图摆脱传统的离散分位数预测头,向更精细的概率建模演进。
- 评测体系走向严谨化:GIFT-Eval、TIME 基准的出现,以及"预测模型卡片"等透明化提案,反映该领域正从"野蛮生长、各自刷榜"走向更成熟的标准化评测阶段——这本身也是学科走向成熟的信号。
- 与 LLM/Agent 生态融合:如 ITFormer(上海交大等团队)等工作探索将时序编码器与大语言模型桥接,实现对传感器数据的自然语言问答式交互,预示时序基座模型未来可能进一步融入 Agent 工作流,而非作为孤立的预测服务存在。(来源)
参考来源
- 蚂蚁国际开源"鹰序"AI预测大模型 - 百家号
- Nishantha Ruwan - A2TTA (Anchored-and-Agile Test-Time Adaptation) - LinkedIn
- Anchored-and-Agile Test-Time Adaptation for Evolving Time Series - arXiv
- ICML 2026 TIME Benchmark claim logbook - Hugging Face Space
- Why your AMI gap-filling model is more accurate than you think - Energy Central
- What Matters in Deep Learning for Time Series Forecasting? - arXiv:2512.22702
- 航空发动机用上大模型:ITFormer 时序问答架构 - BAAI Hub
- Crossing-Free Probabilistic K-Line Forecasts (Moirai/Chronos-2/Kronos 综述性引用) - arXiv