---
title: "时序预测基座模型研究发展进程与现状"
description: "从统计方法到基座模型的演进脉络，涵盖TimesFM、Chronos、Moirai、Falcon-TST等模型，技术路线分类、评测基准及零样本有效性争议"
pubDate: 2026-08-05
tags: ["time-series","foundation-model","deep-learning","survey"]
category: "AI"
lang: "zh"
math: false
---

## 引言

时间序列预测是数据科学中最古老也最实用的问题之一，从电力负荷、零售需求到金融风险管理无处不在。过去两年，随着大语言模型（LLM）范式的成功，"预训练+零样本泛化"的思路被大规模移植到时序领域，催生了一批"时序基座模型"（Time Series Foundation Model, TSFM）。本文梳理这一领域从统计方法到基座模型的演进脉络、当前的技术版图，以及围绕它的核心争议。

## 一、发展脉络：三个时代

### 1. 统计方法时代（20世纪中期—2018）

ARIMA、指数平滑（ETS）、Theta 等经典统计模型长期是时序预测的基石。它们参数量小、可解释性强、对短序列和规则性强的数据效果稳定，至今仍是工业界许多场景（尤其是低频、少量序列）的默认选择。2018 年的 M4 竞赛（Makridakis Competition）验证了这一时期的分水岭：冠军方案是"Hybrid ES-RNN"——统计模型（指数平滑）与神经网络（RNN）的混合体，而非纯统计或纯深度学习方法，说明当时纯深度学习尚未能稳定超越精调的统计基线。

### 2. 专用深度学习模型时代（2019—2023）

这一阶段的核心命题是：如何设计更适合时序结构（趋势、周期、多尺度依赖）的深度网络。代表性工作包括：

- **N-BEATS**（2019，ElementAI）：纯深度学习架构，通过堆叠的全连接残差块反复做"回溯（Backcast）+预测（Forecast）"分解，在 M4 竞赛上取得当时最优成绩。
- **Informer**（2021，AAAI）：提出 ProbSparse 自注意力机制解决长序列 Transformer 的计算瓶颈，开启了"Transformer 做长序列预测"的热潮，随后有 Autoformer、FEDformer 等改进。
- **PatchTST**（2023，ICLR）：将 NLP 领域的 Patch 分段思想引入时序 Transformer，把连续时间片段而非单点作为最小建模单元，显著提升长序列预测效果，成为后续大多数时序基座模型 tokenization 方式的直接灵感来源。
- 与此同时，也出现了"简单模型打脸复杂架构"的反思声音——Zeng et al. 的论文《Are Transformers Effective for Time Series Forecasting?》（2022）指出，一个简单的线性模型 DLinear 在多个长序列预测基准上能匹敌甚至超过当时的主流 Transformer 变体，这一争论延续至今（见第四节）。

### 3. 基座模型时代（2023—至今）

受 GPT 系列"大规模预训练+零样本/少样本泛化"范式启发，研究者开始探索：能否用一个模型，不经任何任务特定训练，直接预测从未见过的时序数据？这标志着时序预测从"每个任务训一个模型"转向"预训练一个通用模型，推理时直接用"。这一转型的标志性节点：

- **TimeGPT**（Nixtla，2023）：较早提出"时序领域的 GPT"概念，以商业 API 形式提供零样本预测服务。
- **Lag-Llama**（2024，ServiceNow/Mila）：开源的概率时序基座模型，使用滞后特征（lag features）作为协变量，基于 Transformer 解码器架构。
- **TimesFM**（Google Research，2024）：decoder-only、patch-based 架构，用真实与合成数据混合预训练，参数量约 2 亿，是较早证明"小而通用"基座模型可行性的工作之一。
- **Chronos**（Amazon，2024）：把时序值当作"语言"来处理——通过缩放+分箱（scaling + quantization）将连续数值离散化为 token，直接复用 T5 等现成语言模型架构和训练方法，并引入 KernelSynth 生成合成训练数据缓解真实数据不足的问题。
- **Moirai / Moirai-MoE**（Salesforce，2024）：masked encoder 架构，提出"any-variate attention"以统一处理不同变量数和频率的数据，并用多种 patch 尺寸适配不同采样频率；Moirai-MoE 进一步引入混合专家结构提升容量效率比。
- **TTM / Tiny Time Mixers**（IBM，2024）：反其道而行之，用不到百万参数的轻量 MLP-Mixer 架构证明"以小博大"——在多个基准上媲美十亿参数级模型，同时可在 CPU 上快速推理，代表资源受限场景的技术路线。
- **Time-MoE**（2024）：稀疏混合专家 + decoder-only 架构，将时序基座模型的参数规模推向数十亿级别，探索时序领域的 scaling law。
- **Sundial**（2025，清华大学）：采用生成式/flow-matching 方法建模连续分布，试图摆脱传统的离散化分位数预测头，代表生成式建模在时序预测中的探索。
- **Toto**（2025，Datadog）：面向可观测性（observability/ITOps）场景的时序基座模型，强调多变量场景下数值与类别信号的联合处理。
- **Falcon-TST（鹰序）**（2025，蚂蚁国际）：业内首个将 Patch 分段与混合专家（MoE）结合、并借鉴 N-BEATS 残差分解思想的大规模时序基座模型，参数规模超过 25 亿，聚焦金融跨境支付、外汇风险预测场景，2025 年 11 月开源（详见文章二深度解析）。（[来源](https://baijiahao.baidu.com/s?id=1848578363040878310&wfr=spider&for=pc)）
- **第二代模型迭代**（2025—2026）：Chronos-2、TimesFM 2.5、Moirai-2.0 相继发布，普遍强化了原生多变量/协变量支持、更长上下文、更快推理速度。多项 2026 年的研究（如 Anchored-and-Agile Test-Time Adaptation 相关工作）显示，这些第二代模型在微调后仍能显著超越纯零样本表现，说明"零样本即最优"的叙事仍需谨慎看待（见第四节）。（[来源](https://www.linkedin.com/posts/nishantha-ruwan-15b301b2_a2tta-anchored-and-agile-test-time-adaptation-activity-7488228747998007296-ty1x)）

## 二、技术路线分类

时序基座模型内部并非单一范式，可以从几个维度切分：

| 维度 | 路线 A | 路线 B | 代表 |
|---|---|---|---|
| 底层架构来源 | 直接复用/借壳预训练语言模型架构 | 从零训练时序原生架构 | Chronos（借壳 T5）vs. TimesFM/Moirai/TTM（原生设计） |
| Tokenization | Point-based（逐点离散化） | Patch-based（分段建模） | Chronos vs. PatchTST/TimesFM/Moirai/Falcon-TST |
| 输出形式 | 确定性点预测 | 概率/分位数分布预测 | 早期专用模型多为确定性 vs. 绝大多数基座模型默认概率输出 |
| 变量支持 | 仅单变量 | 多变量/协变量感知 | 第一代 TimesFM/Chronos vs. Moirai 的 any-variate attention、第二代模型 |
| 序列建模范式 | Decoder-only 自回归 | Masked Encoder / 双向全注意力 / 生成式扩散 | TimesFM/Time-MoE/Lag-Llama vs. Moirai vs. Sundial |

值得注意的是，多数"基座模型"并不是像 LLM 那样直接复用预训练语言模型权重做迁移（Chronos 是少数例外，它复用架构而非权重），而是借鉴 LLM 的**训练范式**（大规模、多域、自监督预训练）在时序原生架构上重新训练。这与 NLP 领域"一个预训练权重迁移到所有任务"的迁移学习模式有本质区别。

## 三、评测基准现状

- **Monash Time Series Archive**：长期作为时序预测的标准化数据集合（约 30+ 数据集），在基座模型出现之前就已是学界通用参照，但数据集多为公开可获取，也正是"数据污染"争议的源头之一。
- **M4 / M5 竞赛**：Makridakis 系列竞赛（M4 面向 10 万条单变量序列，M5 面向沃尔玛零售需求的层级预测）长期被视为检验预测方法实战能力的金标准，混合方法（统计+深度学习）历史上多次跑赢纯方法。
- **GIFT-Eval**（Salesforce，2024/2025）：专门为标准化评测零样本基座模型而设计的综合基准，覆盖多域、多频率、多序列长度的任务分布，试图解决此前各家自行选数据集评测、结果难以横向比较的问题。
- **TIME 基准**（ICML 2026 投稿）：包含 50 个"新鲜"数据集与 98 个预测任务，专门为**严格零样本评测、避免数据泄露**而设计——这个基准本身的出现，就是对现有评测体系可信度的一次直接回应。（[来源](https://huggingface.co/spaces/abhishekkataria16/claim-79TgfXHbsK-logbook)）

这些基准各有局限：Monash/M4/M5 出现早于基座模型时代，其公开数据大概率已被后续模型的预训练语料吸收，用作"零样本"测试已不再干净；GIFT-Eval 虽然设计更严谨，但作为一个静态基准，本身也面临着被后续模型"刷榜式过拟合"的风险。

## 四、核心争议与挑战

### 1. 零样本预测的真实有效性存疑

多项 2025-2026 年的研究显示，看似"开箱即用"的零样本基座模型，在**微调或轻量校准**后仍有显著提升空间。例如涉及 Chronos-2、TimesFM 2.5、Moirai-2.0 的多篇测试时自适应（test-time adaptation）研究发现，微调版本在几乎所有测试场景下都优于对应的零样本版本；甚至有工作显示，一个只更新校准器（calibrator）参数、其余部分冻结的轻量方法就能超越零样本大模型的表现。（[来源](https://arxiv.org/html/2607.25875v1)、[来源](https://www.linkedin.com/posts/nishantha-ruwan-15b301b2_a2tta-anchored-and-agile-test-time-adaptation-activity-7488228747998007296-ty1x)）这提示零样本能力被过度渲染的可能性：基座模型提供的是"更好的初始化/更强的先验"，而非真正意义上"无需任何领域适配就能媲美专用模型"。

### 2. 训练数据泄露/污染问题

时序基座模型的预训练语料通常大量爬取公开数据集（如 Monash 归档、各类开源传感器/金融/能源数据），而这些数据集又恰恰是学界用来做"零样本"评测的测试集。换言之，很多"零样本"跑分实际上可能是变相的"训练集内测试"。ICML 2026 的 TIME 基准正是针对这一问题，专门构建全新、未被污染的数据集来做"干净"的零样本评测——这个基准的存在本身，说明业内已经普遍意识到该问题的严重性。

### 3. 与传统方法/专用模型的对比争议：是否被过度炒作

- 一方面，有真实业务场景的证据支持基座模型的价值：例如智能电表（AMI）数据缺口填补场景中，Chronos 和 TimeGPT 相比 ARIMA 展现出有意义的精度提升，尤其在短缺口填补任务上。（[来源](https://www.energycentral.com/energy-management/post/why-your-ami-gap-filling-model-is-more-accurate-than-you-think----and-xyPvh9TlxJgRsY0)）
- 另一方面，学界对当前深度学习时序预测的架构复杂度提出了系统性质疑。IDSIA（意瑞大学）与米兰理工大学在 2025 年底的论文《What Matters in Deep Learning for Time Series Forecasting?》中指出：大量"新颖架构"本质上只是把预测理论中早已明确的"局部/全局/混合建模"范式重新包装，很多被忽视的实现细节（而非核心建模层的选择）才是决定性能差异的关键；设计良好的简单架构（如 MLP）往往能匹敌复杂的最先进模型。该文呼吁重新思考当前存在缺陷的基准测试实践，并提出"预测模型卡片"模板以提升研究的透明度和可比性。（[来源](https://arxiv.org/abs/2512.22702)）这与 2022 年 DLinear 挑战复杂 Transformer 的争论一脉相承，说明"复杂架构是否值得其计算代价"在该领域始终未有定论。
- 现实的工业选择往往是折中的：精调后的统计方法（ARIMA/ETS）在数据量小、序列规则的场景依然极具性价比；基座模型的优势更多体现在"冷启动"（无历史数据/新序列）、多域迁移、以及作为下游微调起点的场景。

### 4. 部署与推理成本的现实约束

随着 Time-MoE、Falcon-TST 等模型把参数规模推向十亿甚至数十亿级别，其推理延迟和算力成本对高频、低延迟场景（如实时风控、高频交易）构成挑战。这也解释了为何 IBM TTM 坚持"小而快"（不到百万参数、可 CPU 推理）的反向路线——基座模型领域正在朝"通用大模型"和"专用轻量模型"两个方向分化，而非收敛到单一最优解。

## 五、2025—2026 年趋势方向

1. **第二代模型集体换代**：Chronos-2、TimesFM 2.5、Moirai-2.0 均在原生多变量/协变量支持、更长上下文、推理效率上做了系统性升级，反映出第一代基座模型"仅支持单变量、零样本能力有限"的痛点已被业界充分意识到。
2. **垂直领域专用基座模型兴起**：继通用基座模型之后，出现了 Falcon-TST（金融/跨境资金）、Toto（IT 可观测性）等针对特定领域外部信号（汇率、物流、天气、系统指标）深度整合的专用模型，说明"通用 vs. 垂直"的分化正在发生，垂直模型往往能引入更丰富的领域特定协变量（如 Falcon-TST 甚至纳入热带植物生长数据作为气候变化的先导指标）。
3. **MoE 架构从 LLM 向时序领域扩散**：Time-MoE、Moirai-MoE、Falcon-TST 均采用混合专家结构，用于在扩大模型容量的同时控制推理成本，是 LLM 领域成熟技术在时序领域的复用。
4. **生成式/连续分布建模的探索**：Sundial 代表的 flow-matching 路线试图摆脱传统的离散分位数预测头，向更精细的概率建模演进。
5. **评测体系走向严谨化**：GIFT-Eval、TIME 基准的出现，以及"预测模型卡片"等透明化提案，反映该领域正从"野蛮生长、各自刷榜"走向更成熟的标准化评测阶段——这本身也是学科走向成熟的信号。
6. **与 LLM/Agent 生态融合**：如 ITFormer（上海交大等团队）等工作探索将时序编码器与大语言模型桥接，实现对传感器数据的自然语言问答式交互，预示时序基座模型未来可能进一步融入 Agent 工作流，而非作为孤立的预测服务存在。（[来源](https://hub.baai.ac.cn/view/46904)）

## 参考来源

- [蚂蚁国际开源"鹰序"AI预测大模型 - 百家号](https://baijiahao.baidu.com/s?id=1848578363040878310&wfr=spider&for=pc)
- [Nishantha Ruwan - A2TTA (Anchored-and-Agile Test-Time Adaptation) - LinkedIn](https://www.linkedin.com/posts/nishantha-ruwan-15b301b2_a2tta-anchored-and-agile-test-time-adaptation-activity-7488228747998007296-ty1x)
- [Anchored-and-Agile Test-Time Adaptation for Evolving Time Series - arXiv](https://arxiv.org/html/2607.25875v1)
- [ICML 2026 TIME Benchmark claim logbook - Hugging Face Space](https://huggingface.co/spaces/abhishekkataria16/claim-79TgfXHbsK-logbook)
- [Why your AMI gap-filling model is more accurate than you think - Energy Central](https://www.energycentral.com/energy-management/post/why-your-ami-gap-filling-model-is-more-accurate-than-you-think----and-xyPvh9TlxJgRsY0)
- [What Matters in Deep Learning for Time Series Forecasting? - arXiv:2512.22702](https://arxiv.org/abs/2512.22702)
- [航空发动机用上大模型：ITFormer 时序问答架构 - BAAI Hub](https://hub.baai.ac.cn/view/46904)
- [Crossing-Free Probabilistic K-Line Forecasts (Moirai/Chronos-2/Kronos 综述性引用) - arXiv](https://arxiv.org/html/2607.26792v1)