---
title: "时序预测近两年研究综述:聚焦公共数据集(2023–2025)"
description: "系统梳理 2023–2025 年时序预测方向 89 篇代表性论文,覆盖 Transformer、线性/MLP、频域、基础模型、LLM、Mamba、扩散生成、评测基准等分支,聚焦公共数据集。"
pubDate: 2026-07-06
tags: ["时序预测","Time Series","综述","Foundation Model","LLM","Mamba","扩散模型"]
category: "AI / 机器学习"
lang: "zh"
math: false
---
> 本文是对 **2023–2025 年时序预测(Time Series Forecasting)** 方向的一次系统性梳理,聚焦于 **公共时序数据集**(即 GPT4TS / One-Fits-All 所使用的那批标准 benchmark)上的代表性工作。共深读整理 **89 篇论文**,覆盖 Transformer、线性/MLP、频域、基础模型、LLM、State-Space/Mamba、扩散生成、多变量相关性、非平稳、概率预测、时空、评测基准等十余个分支。每篇论文的独立研读笔记(中英混合)已打包为 zip,可在文末下载。
>
> **说明**:文中涉及的实验结论以各论文原文为准;为避免以讹传讹,凡未能逐一核实的精确 MSE/MAE/CRPS 数值,均以定性描述呈现或标注"具体数值见原文"。

## 一、引言:为什么此刻重看时序预测

自 2021 年 Informer 掀起"Transformer 做长期预测"的热潮以来,时序预测(尤其是 **Long-term Time Series Forecasting, LTSF**)经历了一轮又一轮的范式更替。2022 年 **DLinear**(*Are Transformers Effective for Time Series Forecasting?*)用一个线性层击败了一众复杂 Transformer,几乎让整个方向"停摆反思";而 2023–2025 年,这个领域非但没有降温,反而分化出前所未有的多条主线:

- **Transformer 阵营的自我修正**:以 iTransformer 为代表,通过"倒置"视角重新赢回 SOTA;
- **线性/MLP 阵营的极致轻量化**:FITS(10k 参数)、SparseTSF(1k 参数)把"简单即有效"推向极限;
- **基础模型(Foundation Model)的军备竞赛**:TimesFM、Moirai、Chronos、MOMENT、Time-MoE 等纷纷追求"一个模型零样本预测万物";
- **LLM 跨模态的兴起与祛魅**:从 Time-LLM 到 GPT4TS,再到 *Are Language Models Actually Useful for Time Series Forecasting?* 的当头一棒;
- **新架构的涌入**:Mamba/State-Space 与扩散生成模型大举进入时序领域。

与此同时,一批**评测基准(TFB、BasicTS+、GIFT-Eval、ProbTS、TSFM-Bench)** 开始严肃拷问:这些"SOTA"到底有多少是真实进步,又有多少是评测口径不一带来的幻觉?

本综述即以此为背景,力求把这幅快速演化的地图画清楚。

## 二、公共数据集与任务设定

理解这个领域,首先要理解它的"考卷"。近两年绝大多数工作都在以下公共数据集上评测:

### 长期预测(Long-term Forecasting)

| 数据集 | 变量数 | 采样粒度 | 领域 | 特点 |
|--------|--------|----------|------|------|
| **ETTh1/h2/m1/m2** | 7 | 1h / 15min | 电力变压器温度 | 最常用,强趋势+周期 |
| **Weather** | 21 | 10min | 气象 | 多变量弱相关 |
| **Electricity (ECL)** | 321 | 1h | 用电量 | 高维、强周期 |
| **Traffic** | 862 | 1h | 道路占用率 | 超高维、强空间相关 |
| **Exchange** | 8 | 1day | 汇率 | 近随机游走,弱周期 |
| **ILI** | 7 | 1week | 流感样病例 | 短序列 |
| **Solar-Energy** | 137 | 10min | 光伏 | 强日周期 |
| **PEMS03/04/07/08** | 170–883 | 5min | 交通流量 | 时空图结构 |

评测协议通常固定 look-back(常见 96 或 336),预测 horizon ∈ {96, 192, 336, 720},以 **MSE / MAE** 衡量。

### 其它任务

- **短期预测**:M4(单变量,多领域,sMAPE/OWA)、M5;
- **分类**:UEA(多变量)/ UCR(单变量);
- **异常检测**:SMD、MSL、SMAP、SWaT、PSM 五数据集(F1);
- **插补(Imputation)**:在上述数据集上按比例 mask;
- **概率预测**:GluonTS 套件(Solar、Electricity、Traffic、Exchange、Wikipedia 等,以 CRPS / CRPS_sum 衡量)。

**GPT4TS(One-Fits-All, NeurIPS 2023)** 的重要贡献之一,就是用同一个骨干统一刷了上述"长/短期预测 + 分类 + 异常 + 插补"五大任务,奠定了后续"通用时序模型"评测的模板。

## 三、方法分类体系(总览)

近两年方法可归纳为八大分支。下表给出速览:

| 分支 | 核心思想 | 代表作(本文收录) |
|------|----------|-------------------|
| **Transformer 类** | 改进 attention 的作用维度/对象 | iTransformer, CARD, Fredformer, TimeXer, Pathformer, SAMformer |
| **线性 / MLP 类** | 用极简结构 + 分解/混合取胜 | TimeMixer(++), FITS, SparseTSF, CycleNet, SOFTS, U-Mixer |
| **频域方法** | 在 Fourier/频域建模与做损失 | FreDF, FreqMoE, TSLANet, ATFNet, FilterNet, FAN, FredNormer, DERITS |
| **基础模型 / 预训练** | 大规模预训练 + 零样本 | TimesFM, Moirai(-MoE), Chronos(-Bolt), MOMENT, Timer(-XL), TTM, UniTS, Time-MoE |
| **LLM for TS** | 复用/重编程大语言模型 | Time-LLM, GPT4TS, TEMPO, AutoTimes, S2IP-LLM, TEST, UniTime, CALF, TimeCMA, LLM4TS |
| **State-Space / Mamba** | 用选择性状态空间做近线性长依赖 | S-Mamba, TimeMachine, MambaTS, Bi-Mamba+, SST, Chimera, Time-SSM 等 |
| **扩散 / 生成** | 概率预测与生成建模 | TSFlow, NsDiff, Diffusion-TS, mr-Diff, TMDM, MG-TSD, TACTiS-2 |
| **多变量相关性 / GNN** | 显式建模跨变量/跨节点依赖 | DUET, GinAR, MSGNet, SageFormer, STG-Mamba |

下面逐一展开。

## 四、方法演进(上):Transformer、线性/MLP、频域、多变量

### 4.1 Transformer 阵营的绝地反击

DLinear 的暴击之后,Transformer 阵营的反思集中在一个问题:**过去把"时间步"当 token 是否搞错了对象?**

- **iTransformer**(ICLR 2024 Spotlight)给出了最优雅的答案:不改任何组件,只把 attention/FFN 的作用维度**倒置**——每条变量的整段序列作为一个 *variate token*,attention 建模**跨变量相关性**,共享 FFN 学时序非线性。这一"换视角而非换结构"的操作让 Transformer 重回 SOTA,并能随 look-back 增长持续受益,现已成为时序领域最常用的 backbone 之一。
- **CARD**(ICLR 2024)针对 PatchTST 时代"通道独立(Channel Independence, CI)"策略丢弃跨变量信息的短板,提出 **channel-aligned attention** 在保留 CI 鲁棒性的同时受控地重新引入跨变量相关,并配合 signal-decay robust loss 抗过拟合。
- **Fredformer**(KDD 2024)识别并形式化了 Transformer 的**频率偏置(frequency bias)**——模型倾向于学低频而忽略关键高频细节,通过频域去偏与 Nyström 轻量近似兼顾精度与效率。
- **TimeXer**(NeurIPS 2024)把长期被忽视的**外生变量(exogenous variables)** 纳入 Transformer,用内生 patch token + 外生 variate token 的交叉注意力,贴近真实业务中"带协变量预测"的需求。
- **Pathformer**(ICLR 2024)引入**多尺度自适应路径**,按输入动态选择不同 patch 尺度的建模分支。
- **SAMformer**(ICML 2024)从优化角度切入,用 **Sharpness-Aware Minimization** 解决 Transformer 在时序上易陷入尖锐极小值、训练不稳的问题,以浅层通道注意力取得竞争力。

**小结**:Transformer 的复兴不是靠更复杂的结构,而是靠**换对建模对象(变量维)、修正频率偏置、稳住优化**。

### 4.2 线性 / MLP:简单即强大,轻量到极致

DLinear 的精神被这一支发扬光大:

- **TimeMixer**(ICLR 2024)用纯 MLP 的 **decomposable multiscale mixing**——过去混合(Past-Decomposable-Mixing)+ 未来混合(Future-Multipredictor-Mixing),在多尺度上分别 mix 季节与趋势;其升级版 **TimeMixer++**(ICLR 2025)进一步把"时间域多尺度 × 频域多分辨率"解耦为正交两轴,泛化成覆盖 8 类任务的**通用时序模式机(TSPM)**。
- **FITS**(ICLR 2024)以约 **10k 参数**在频域用一个复数线性层做插值,性能媲美重型模型;**SparseTSF**(ICML 2024 Oral)更进一步,用 **1k 参数**通过跨周期稀疏建模完成长期预测——这两者几乎把"参数效率"推到了理论下限,极具工程价值。
- **CycleNet**(NeurIPS 2024)显式建模可学习的**周期模式(Residual Cycle Forecasting)**,以极小代价提升周期性强的数据集表现。
- **SOFTS**(NeurIPS 2024)提出 **Series-Core Fusion**,用一个中心化的 series core 高效聚合跨变量信息,兼顾 MLP 的效率与跨变量建模。
- **U-Mixer**(AAAI 2024)把 MLP-Mixer 与 U-Net 结合并加平稳性校正。

### 4.3 频域方法:从"在频域建模"到"在频域做损失"

频域是近两年最活跃的切入点之一:

- **FreDF**(ICLR 2025)提出一个反直觉但重要的观察:主流方法在**时域计算损失**会强制模型拟合自相关噪声,改为**在频域计算预测损失**能显著解耦标签自相关,即插即用地提升多种骨干。
- **FreqMoE**(AISTATS 2025)把 MoE 的"分而治之"锚定到**频段语义**上——不同频段交给不同的轻量复数专家,动态门控组合。
- **FilterNet**(NeurIPS 2024)直接用可学习的**频率滤波器**(类信号处理)做预测;**TSLANet**(ICML 2024)用自适应频谱滤波替代注意力做通用表示。
- **ATFNet**(2024)时频双分支自适应集成;**DERITS**(IJCAI 2024)用频域导数学习应对非平稳。
- 归一化方向:**FAN**(NeurIPS 2024)做频率自适应归一化,**FredNormer** 在频域做实例归一化,均针对分布漂移。

### 4.4 多变量相关性:CI 与 CD 之争的和解

PatchTST 之后,"通道独立(CI)vs 通道依赖(CD)"成为核心争论。近两年的趋势是**寻找二者之间的中间地带**:

- **DUET**(KDD 2025)用**双聚类**——时间维聚类(TCM)应对异质分布 + 通道维频域软聚类稀疏化(CCM)选择性建模跨通道交互,提供比纯 CI/CD 更抗噪的方案。
- **GinAR**(KDD 2024)针对真实场景的**变量缺失**,用插值注意力 + 自适应图卷积做端到端鲁棒预测。
- **MSGNet**(AAAI 2024)、**SageFormer**(IoT-J 2024)用 GNN / series-aware 框架显式建模多尺度跨序列相关。

## 五、方法演进(下):基础模型、LLM、Mamba、扩散

### 5.1 时序基础模型:一个模型零样本预测万物

这是近两年**最热**的主线。核心配方是"大规模跨域预训练 + 零样本迁移":

| 模型 | 机构 | 架构 | 关键点 |
|------|------|------|--------|
| **TimesFM**(ICML 2024) | Google | Decoder-only | patch 输入,大规模真实+合成语料预训练 |
| **Moirai**(ICML 2024) | Salesforce | Encoder(masked) | 多 patch size、any-variate,LOTSA 大语料 |
| **Chronos**(TMLR 2024) | Amazon | T5(复用 NLP) | **tokenization**:缩放+量化成离散 token,几乎零时序专用改动 |
| **MOMENT**(ICML 2024) | CMU | Encoder(masked) | 开源、多任务,配 Time-Series Pile |
| **Timer / Timer-XL**(ICML/ICLR) | 清华 | Decoder-only | 生成式 LTSM;Timer-XL 用 TimeAttention 统一多变量+长上下文+协变量 |
| **UniTS**(NeurIPS 2024) | Harvard | 统一 token | 一套权重跨预测/分类/异常/插补多任务 |
| **TTM**(NeurIPS 2024) | IBM | 轻量 TSMixer | 极小模型也能强零/少样本,主打高效 |
| **Time-MoE**(ICLR 2025) | — | 稀疏 MoE | 首个 **billion 级**,容量与激活算力解耦,验证 scaling law |
| **Moirai-MoE**(ICML 2025) | Salesforce | 稀疏 MoE | 用 token 级专家替代人工 patch 启发式 |
| **Chronos-Bolt** | Amazon | patch+direct | 工程优化版,更快更准 |

**看点**:(1)**Chronos** 证明了"把时序当语言"——极简 tokenization + 复用成熟 NLP 生态即可获强零样本,其 42-dataset 零样本协议成为事实标准;(2)**Time-MoE** 把 LLM 的稀疏 MoE scaling 配方成功搬到时序,给出"扩容不涨推理成本"的证据;(3)**Chronos 的 42-dataset 零样本评测**与后续的 GIFT-Eval / TSFM-Bench 一起,把"零样本是否名副其实"推上台面。

### 5.2 LLM for TS:兴起、繁荣与祛魅

用大语言模型做时序,是一条充满争议的路线:

- **重编程 / 对齐路线**:**Time-LLM**(ICLR 2024)通过 reprogramming + Prompt-as-Prefix 把时序对齐进冻结 LLM;**GPT4TS/One-Fits-All** 冻结 GPT-2 大部分参数刷五大任务;**TEMPO**(ICLR 2024)用分解 + 软 prompt;**S2IP-LLM**(ICML 2024)做语义空间 prompt;**TEST**(ICLR 2024)用文本原型对齐激活 LLM;**CALF / TimeCMA**(AAAI 2025)聚焦**跨模态对齐**缩小文本-时序分布差,并解决 LLM 推理贵的痛点;**AutoTimes**(NeurIPS 2024)把 decoder-only LLM 变成自回归时序预测器;**UniTime / LLM4TS / aLLM4TS** 走跨域统一与数据高效路线。
- **祛魅的一击**:**Are Language Models Actually Useful for Time Series Forecasting?**(NeurIPS 2024)通过消融实验发现——**把 LLM 组件移除或替换成简单结构,性能往往不降反而持平/更好**,质疑了 LLM 在时序预测中的实际增益。这项工作促使整个子领域重新审视"LLM 到底贡献了什么"。

**判断**:LLM-for-TS 在**少样本/零样本、跨模态(带文本上下文)** 场景仍有独特价值,但在纯数值 LTSF 上,其相对轻量专用模型的优势尚存疑,需要更严谨的对照。

### 5.3 State-Space / Mamba:近线性长依赖的新宠

Mamba(选择性状态空间 S6)以近线性复杂度建模长依赖,2024 年密集涌入时序:

- **S-Mamba**(*Is Mamba Effective for TSF?*)系统验证 Mamba 在 LTSF 的有效性,成为该支的锚点;
- **TimeMachine**(ECAI 2024)"4 个 Mamba"多尺度协同;**MambaTS**(NeurIPS 2024)改进变量扫描顺序;**Bi-Mamba+** 双向建模;**SST** 做 Mamba×Transformer 多尺度混合专家;**Chimera**(NeurIPS 2024)用 2D SSM 同时建模时间与变量维;**Time-SSM / DTMamba / CMamba / MambaMixer / Mambaformer / SiMBA / Mamba4Cast** 各有侧重(统一理论、双塔、通道相关、双向选择、混合、零样本)。

**评价**:Mamba 系的最大卖点是**效率(近线性、低显存)**,在超高维数据集(Traffic/ECL)上尤具吸引力;但相对 iTransformer 的**精度增益并不总是稳定**,且论文间评测口径差异较大,需结合 TFB 等公平基准审视。

### 5.4 扩散 / 生成:概率预测的主场

当需求从"点预测"转向"带不确定性的概率预测"时,扩散/生成模型登场:

- **TSFlow**(ICLR 2025)用 **Gaussian Process 先验**替代白噪声做 Flow Matching,使先验贴合时序结构,同时提升样本质量与采样速度;
- **NsDiff**(ICML 2025 Spotlight)用 Location-Scale 噪声模型替代 DDPM 常方差假设,把**时变不确定性**注入扩散;
- **Diffusion-TS**(ICLR 2024)可解释地做通用时序生成;**mr-Diff**(ICLR 2024)多分辨率扩散;**TMDM**(ICLR 2024)Transformer 调制扩散;**MG-TSD**(ICLR 2024)多粒度引导;**LDT**(AAAI 2024)潜空间扩散;**CCDM** 通道感知条件扩散;
- **TACTiS-2**(ICLR 2024)用简化的注意力 copula(线性复杂度 + 两阶段课程)做多变量概率预测,兼顾预测/插补与不规则采样。

## 六、评测基准:进步还是幻觉?

近两年一个健康的信号,是**评测基准本身成为研究对象**:

- **TFB**(VLDB 2024):统一 pipeline,25 数据集 + 8000+ 单变量序列,公平对比统计/ML/DL 三类方法,发现**传统方法在部分场景不逊于深度学习**;
- **BasicTS+ / Exploring Progress**(TKDE 2024):强调数据集异质性,提供公平多变量对比;
- **GIFT-Eval**(2024):7 领域 23 数据集,认真对待**数据泄漏**,提供独立无泄漏预训练语料 + 公开榜;
- **ProbTS**(NeurIPS 2024):把**点预测与概率预测**统一到 NMAE + CRPS 双指标、多 horizon 的坐标系,揭示"分布刻画能力 vs 长程精度"的结构性权衡;
- **TSFM-Bench / FoundTS**(KDD 2025):统一评测 LLM-based 与 TS-pretrained 两类基础模型的 zero/few/full-shot;
- **Deep Time Series Models Survey**(2024):综述 + 基准。

**共识结论**:(1)**没有单一模型在所有 horizon、所有指标上通吃**;(2)方法优劣高度依赖数据的趋势/季节/平稳性特征;(3)评测口径(look-back、归一化、划分)的不一致,是过去"SOTA 泛滥"的重要原因。

## 七、趋势、争议与开放问题

**四大趋势**:
1. **基础模型与零样本**成为竞赛焦点,配方(大语料 + decoder-only/掩码 + tokenization/MoE)日趋 NLP 化;
2. **效率导向**回归:FITS/SparseTSF/TTM/Mamba 证明"小而美"在很多场景足够;
3. **频域**从建模手段扩展到**损失函数**(FreDF)与**归一化**(FAN);
4. **概率化**:从点预测走向带不确定性的分布预测。

**核心争议**:
- **线性 vs 复杂模型**:DLinear 之问至今未被彻底回答——复杂模型的增益在公平评测下常被压缩;
- **通道独立 vs 依赖**:并无普适赢家,DUET/CARD 式的"软性折中"成为趋势;
- **LLM 是否有用**:NeurIPS 2024 的批判性工作使这一路线进入冷静期;
- **评测可信度**:数据泄漏、look-back 不一致、cherry-picking 仍是隐患。

**开放问题**:真正的跨域零样本泛化、协变量/外生信息的有效利用、长上下文下的非平稳处理、概率预测的校准、以及一个被广泛接受的**公平评测标准**。

## 八、结语

如果说 2022 年 DLinear 的意义是"戳破泡沫",那么 2023–2025 年的意义就是**在废墟上重建多元的方法生态**:Transformer 学会了谦逊(换视角、修偏置),线性模型证明了极简的力量,基础模型点燃了零样本的野心,而评测基准则扮演了冷静的裁判。下一个真正的突破,或许不在于某个更花哨的架构,而在于**谁能在公平、无泄漏的评测下,拿出稳定且可迁移的泛化能力**。

---
## 九、论文清单(89 篇)

> 以下为本次深读整理的全部论文,按方向分组。每篇的完整研读笔记(中英混合)见文末 zip 下载。


### 1. Transformer 类（4）

1. **CARD: Channel Aligned Robust Blend Transformer for Time Series Forecasting** · ICLR 2024 · [arXiv](https://arxiv.org/abs/2305.12095)
2. **iTransformer: Inverted Transformers Are Effective for Time Series Forecasting** · ICLR 2024 (Spotlight) / 2024 · [arXiv](https://arxiv.org/abs/2310.06625)
3. **TimeBridge: Non-Stationarity Matters for Long-term Time Series Forecasting** · ICML 2025 / 2025 · [arXiv](https://arxiv.org/abs/2410.04442)
4. **TimeXer: Empowering Transformers for Time Series Forecasting with Exogenous Variables** · NeurIPS 2024 / 2024 · [arXiv](https://arxiv.org/abs/2402.19072)


### 2. 线性 / MLP（5）

5. **CycleNet: Enhancing Time Series Forecasting through Modeling Periodic Patterns** · NeurIPS 2024 / 2024 · [arXiv](https://arxiv.org/abs/2409.18479)
6. **HDMixer: Hierarchical Dependency with Extendable Patch for Multivariate Time Series Forecasting** · AAAI 2024 (Proceedings of the AAAI Conference on Artificial Intelligence, article 29155)
7. **SparseTSF: Modeling Long-term Time Series Forecasting with 1k Parameters** · ICML 2024 (Oral) / 2024 · [arXiv](https://arxiv.org/abs/2405.00946)
8. **TimeMixer: Decomposable Multiscale Mixing for Time Series Forecasting** · ICLR 2024 · [arXiv](https://arxiv.org/abs/2405.14616)
9. **U-Mixer: An Unet-Mixer Architecture with Stationarity Correction for Time Series Forecasting** · AAAI 2024 / 2024 · [arXiv](https://arxiv.org/abs/2401.02236)


### 2b. 多变量相关性 / GNN（3）

10. **DUET: Dual Clustering Enhanced Multivariate Time Series Forecasting** · KDD 2025 (Research Track) / 2025 · [arXiv](https://arxiv.org/abs/2412.10859)
11. **MSGNet: Learning Multi-Scale Inter-Series Correlations for Multivariate Time Series Forecasting** · AAAI 2024 · [arXiv](https://arxiv.org/abs/2401.00423)
12. **SAMformer: Unlocking the Potential of Transformers in Time Series Forecasting with Sharpness-Aware Minimization and Channel-Wise Attention** · ICML 2024 / 2024 · [arXiv](https://arxiv.org/abs/2402.10198)


### 2c. 分块 / 多尺度 / token化（5）

13. **Learning to Embed Time Series Patches Independently** · ICLR 2024 · [arXiv](https://arxiv.org/abs/2312.16427)
14. **MTST: Multi-resolution Time-Series Transformer for Long-term Forecasting** · AISTATS 2024 · [arXiv](https://arxiv.org/abs/2311.04147)
15. **MultiResFormer: Transformer with Adaptive Multi-Resolution Modeling for General Time Series Forecasting** · arXiv / 2024 (v1 2023/11/30, v2 2024/02/08) · [arXiv](https://arxiv.org/abs/2311.18780)
16. **Pathformer: Multi-scale Transformers with Adaptive Pathways for Time Series Forecasting** · ICLR 2024 · [arXiv](https://arxiv.org/abs/2402.05956)
17. **TimeMixer++: A General Time Series Pattern Machine for Universal Predictive Analysis** · ICLR 2025 / 2025 · [arXiv](https://arxiv.org/abs/2410.16032)


### 3. 频域方法（8）

18. **ATFNet: Adaptive Time-Frequency Ensembled Network for Long-term Time Series Forecasting** · arXiv 2024 · [arXiv](https://arxiv.org/abs/2404.05192)
19. **FilterNet: Harnessing Frequency Filters for Time Series Forecasting** · NeurIPS 2024 · [arXiv](https://arxiv.org/abs/2411.01623)
20. **FITS: Modeling Time Series with 10k Parameters** · ICLR 2024 · [arXiv](https://arxiv.org/abs/2307.03756)
21. **FreDF: Learning to Forecast in the Frequency Domain** · ICLR 2025 · [arXiv](https://arxiv.org/abs/2402.02399)
22. **Fredformer: Frequency Debiased Transformer for Time Series Forecasting** · KDD 2024 · [arXiv](https://arxiv.org/abs/2406.09009)
23. **FreqMoE: Enhancing Time Series Forecasting through Frequency Decomposition Mixture of Experts** · AISTATS 2025 · [arXiv](https://arxiv.org/abs/2501.15125)
24. **Frequency Adaptive Normalization For Non-stationary Time Series Forecasting (FAN)** · NeurIPS 2024 · [arXiv](https://arxiv.org/abs/2409.20371)
25. **TSLANet: Rethinking Transformers for Time Series Representation Learning** · ICML 2024 · [arXiv](https://arxiv.org/abs/2404.08472)


### 4. 基础模型 / 预训练（15）

26. **A decoder-only foundation model for time-series forecasting (TimesFM)** · ICML 2024 / 2024 (arXiv v1: 2023-10) · [arXiv](https://arxiv.org/abs/2310.10688)
27. **Chronos-Bolt: Faster and More Accurate Chronos Forecasting** · 2024 / Technical report (AWS AI Blog, 2024-12-02)+ GitHub + AutoGluon-TimeSeries v1.2,无独立 arXiv 论文 · [arXiv](https://arxiv.org/abs/2403.07815)
28. **Chronos: Learning the Language of Time Series** · TMLR 2024 / 2024 · [arXiv](https://arxiv.org/abs/2403.07815)
29. **LLM4TS: Aligning Pre-Trained LLMs as Data-Efficient Time-Series Forecasters** · ACM TIST 2025(2024/2025 正式发表,arXiv 2023/08 首发,v6 更新至 2025/02) · [arXiv](https://arxiv.org/abs/2308.08469)
30. **Moirai-MoE: Empowering Time Series Foundation Models with Sparse Mixture of Experts** · arXiv 2024 (2410.10469, 提交于 2024-10-14;后被 ICML 2025 接收) · [arXiv](https://arxiv.org/abs/2410.10469)
31. **MOMENT: A Family of Open Time-series Foundation Models** · ICML 2024 / 2024 · [arXiv](https://arxiv.org/abs/2402.03885)
32. **ProbTS: Benchmarking Point and Distributional Forecasting across Diverse Prediction Horizons** · NeurIPS 2024 (Datasets & Benchmarks Track) / 2024 · [arXiv](https://arxiv.org/abs/2310.07446)
33. **Time-MoE: Billion-Scale Time Series Foundation Models with Mixture of Experts** · ICLR 2025 / 2025 · [arXiv](https://arxiv.org/abs/2409.16040)
34. **Timer-XL: Long-Context Transformers for Unified Time Series Forecasting** · ICLR 2025 · [arXiv](https://arxiv.org/abs/2410.04803)
35. **Timer: Generative Pre-trained Transformers Are Large Time Series Models** · ICML 2024 / 2024 · [arXiv](https://arxiv.org/abs/2402.02368)
36. **Tiny Time Mixers (TTMs): Fast Pre-trained Models for Enhanced Zero/Few-Shot Forecasting of Multivariate Time Series** · NeurIPS 2024 / 2024 · [arXiv](https://arxiv.org/abs/2401.03955)
37. **TSFM-Bench (原名 FoundTS): A Comprehensive and Unified Benchmark of Foundation Models for Time Series Forecasting** · KDD 2025 (arXiv 2024/10 首发,v6 2025/06 修订) · [arXiv](https://arxiv.org/abs/2410.11802)
38. **Unified Training of Universal Time Series Forecasting Transformers (Moirai)** · ICML 2024 (International Conference on Machine Learning) / 2024 · [arXiv](https://arxiv.org/abs/2402.02592)
39. **UniST: A Prompt-Empowered Universal Model for Urban Spatio-Temporal Prediction** · KDD 2024 · [arXiv](https://arxiv.org/abs/2402.11838)
40. **UniTS: A Unified Multi-Task Time Series Model** · NeurIPS 2024 / 2024 · [arXiv](https://arxiv.org/abs/2403.00131)


### 5. LLM for Time Series（10）

41. **Are Language Models Actually Useful for Time Series Forecasting?** · NeurIPS 2024 / 2024 · [arXiv](https://arxiv.org/abs/2406.16964)
42. **AutoTimes: Autoregressive Time Series Forecasters via Large Language Models** · NeurIPS 2024 / 2024（arXiv 首发 2024-02-04) · [arXiv](https://arxiv.org/abs/2402.02370)
43. **CALF: Aligning LLMs for Time Series Forecasting via Cross-modal Fine-Tuning** · AAAI 2025 (formerly *LLaTA*) · [arXiv](https://arxiv.org/abs/2403.07300)
44. **Multi-Patch Prediction: Adapting LLMs for Time Series Representation Learning (aLLM4TS)** · ICML 2024 / 2024（arXiv 首发 2024-02-07) · [arXiv](https://arxiv.org/abs/2402.04852)
45. **S2IP-LLM: Semantic Space Informed Prompt Learning with LLM for Time Series Forecasting** · ICML 2024 / 2024 · [arXiv](https://arxiv.org/abs/2403.05798)
46. **TEMPO: Prompt-based Generative Pre-trained Transformer for Time Series Forecasting** · ICLR 2024 · [arXiv](https://arxiv.org/abs/2310.04948)
47. **TEST: Text Prototype Aligned Embedding to Activate LLM's Ability for Time Series** · ICLR 2024 / 2024 (arXiv v1 2023-08) · [arXiv](https://arxiv.org/abs/2308.08241)
48. **Time-LLM: Time Series Forecasting by Reprogramming Large Language Models** · ICLR 2024 / 2024（arXiv 首发 2023-10) · [arXiv](https://arxiv.org/abs/2310.01728)
49. **TimeCMA: Towards LLM-Empowered Multivariate Time Series Forecasting via Cross-Modality Alignment** · AAAI 2025 / 2025(arXiv 首次提交 2024-06-03) · [arXiv](https://arxiv.org/abs/2406.01638)
50. **UniTime: A Language-Empowered Unified Model for Cross-Domain Time Series Forecasting** · WWW 2024 / 2024（arXiv 首发 2023-10-15) · [arXiv](https://arxiv.org/abs/2310.09751)


### 6. State-Space / Mamba（14）

51. **Bi-Mamba+: Bidirectional Mamba for Time Series Forecasting** · arXiv / 2024 (提交于 2024-04-24,v2 更新于 2024-06-27) · [arXiv](https://arxiv.org/abs/2404.15772)
52. **Chimera: Effectively Modeling Multivariate Time Series with 2-Dimensional State Space Models** · NeurIPS 2024 / 2024 · [arXiv](https://arxiv.org/abs/2406.04320)
53. **CMamba: Channel Correlation Enhanced State Space Models for Multivariate Time Series Forecasting** · arXiv preprint / 2024 (v1 2024-06-08,最新 v3 2024-09-26) · [arXiv](https://arxiv.org/abs/2406.05316)
54. **DTMamba: Dual Twin Mamba for Time Series Forecasting** · arXiv (preprint) / 2024 (v1: 2024-05-11) · [arXiv](https://arxiv.org/abs/2405.07022)
55. **Is Mamba Effective for Time Series Forecasting? (S-Mamba)** · arXiv 2024 (v1: 2024-03-17, v3: 2024-04-27);后被 Neurocomputing (2025) 收录 · [arXiv](https://arxiv.org/abs/2403.11144)
56. **Mamba4Cast: Efficient Zero-Shot Time Series Forecasting with State Space Models** · arXiv 2410.09385, 2024(NeurIPS 2024 "Time Series in the Age of Large Models" Workshop) · [arXiv](https://arxiv.org/abs/2410.09385)
57. **Mambaformer: Integrating Mamba and Transformer for Long-Short Range Time Series Forecasting** · arXiv preprint / 2024 (提交于 2024-04-23) · [arXiv](https://arxiv.org/abs/2404.14757)
58. **MambaMixer: Efficient Selective State Space Models with Dual Token and Channel Selection** · arXiv / 2024 (v1 2024-03-29, 后有多版更新) · [arXiv](https://arxiv.org/abs/2403.19888)
59. **MambaTS: Improved Selective State Space Models for Long-term Time Series Forecasting** · NeurIPS 2024 / 2024 · [arXiv](https://arxiv.org/abs/2405.16440)
60. **SiMBA: Simplified Mamba-Based Architecture for Vision and Multivariate Time Series** · arXiv (2024) · [arXiv](https://arxiv.org/abs/2403.15360)
61. **SST: Multi-Scale Hybrid Mamba-Transformer Experts for Time Series Forecasting** · arXiv / 2024(v1 提交 2024-04-23,后续修订至 v3,online date 2025-11-02) · [arXiv](https://arxiv.org/abs/2404.14757)
62. **STG-Mamba: Spatial-Temporal Graph Learning via Selective State Space Model** · arXiv preprint / 2024 · [arXiv](https://arxiv.org/abs/2403.12418)
63. **Time-SSM: Simplifying and Unifying State Space Models for Time Series Forecasting** · arXiv (preprint) / 2024 · [arXiv](https://arxiv.org/abs/2405.16312)
64. **TimeMachine: A Time Series is Worth 4 Mambas for Long-term Forecasting** · ECAI 2024 (27th European Conference on Artificial Intelligence) / 2024 · [arXiv](https://arxiv.org/abs/2403.09898)


### 7. 扩散 / 生成 / 概率预测（9）

65. **Channel-aware Contrastive Conditional Diffusion for Multivariate Probabilistic Time Series Forecasting (CCDM)** · arXiv (preprint) / 2024 · [arXiv](https://arxiv.org/abs/2410.02168)
66. **Diffusion-TS: Interpretable Diffusion for General Time Series Generation** · ICLR 2024 · [arXiv](https://arxiv.org/abs/2403.01742)
67. **Flow Matching with Gaussian Process Priors for Probabilistic Time Series Forecasting (TSFlow)** · ICLR 2025 / 2025 · [arXiv](https://arxiv.org/abs/2410.03024)
68. **Latent Diffusion Transformer for Probabilistic Time Series Forecasting (LDT)** · AAAI 2024 (Proceedings of the AAAI Conference on Artificial Intelligence, Vol. 38, No. 11, pp. 11979–11987)
69. **MG-TSD: Multi-Granularity Time Series Diffusion Models with Guided Learning Process** · ICLR 2024 · [arXiv](https://arxiv.org/abs/2403.05751)
70. **Multi-Resolution Diffusion Models for Time Series Forecasting (mr-Diff)** · ICLR 2024
71. **Non-stationary Diffusion for Probabilistic Time Series Forecasting (NsDiff)** · ICML 2025 (Spotlight Poster) / 2025 · [arXiv](https://arxiv.org/abs/2505.04278)
72. **TACTiS-2: Better, Faster, Simpler Attentional Copulas for Multivariate Time Series** · ICLR 2024 / 2024 · [arXiv](https://arxiv.org/abs/2310.01327)
73. **Transformer-Modulated Diffusion Models for Probabilistic Multivariate Time Series Forecasting (TMDM)** · ICLR 2024


### 8. 时空 / 城市 / 交通（6）

74. **GinAR: An End-to-End Multivariate Time Series Forecasting Model Suitable for Variable Missing** · KDD 2024 (Research Track) / 2024 · [arXiv](https://arxiv.org/abs/2405.11333)
75. **GraFITi: Graphs for Forecasting Irregularly Sampled Time Series** · AAAI 2024 / 2024 · [arXiv](https://arxiv.org/abs/2305.12932)
76. **ImputeFormer: Low Rankness-Induced Transformers for Generalizable Spatiotemporal Imputation** · KDD 2024 (DOI 10.1145/3637528.3671751) · [arXiv](https://arxiv.org/abs/7528.36717)
77. **Spatial-Temporal-Decoupled Masked Pre-training for Spatiotemporal Forecasting (STD-MAE)** · IJCAI 2024 / 2024 · [arXiv](https://arxiv.org/abs/2312.00516)
78. **TOTEM: TOkenized Time Series EMbeddings for General Time Series Analysis** · TMLR 2024 / 2024 · [arXiv](https://arxiv.org/abs/2402.16412)
79. **UrbanGPT: Spatio-Temporal Large Language Models** · KDD 2024 (Accepted as Full Paper) / 2024 · [arXiv](https://arxiv.org/abs/2403.00813)


### 9. 基准 / 评测 / 综述（4）

80. **Deep Time Series Models: A Comprehensive Survey and Benchmark** · arXiv preprint / 2024 · [arXiv](https://arxiv.org/abs/2407.13278)
81. **Exploring Progress in Multivariate Time Series Forecasting: Comprehensive Benchmarking and Heterogeneity Analysis (BasicTS+)** · IEEE TKDE 2024 (arXiv 预印本 2023/10) · [arXiv](https://arxiv.org/abs/2310.06119)
82. **GIFT-Eval: A Benchmark for General Time Series Forecasting Model Evaluation** · NeurIPS 2024 TSALM Workshop / ICLR 2025 · 2024 · [arXiv](https://arxiv.org/abs/2410.10393)
83. **TFB: Towards Comprehensive and Fair Benchmarking of Time Series Forecasting Methods** · VLDB 2024 (PVLDB Vol. 17) / 2024 · [arXiv](https://arxiv.org/abs/2403.20150)


### 10. 非平稳 / 在线自适应（4）

84. **Deep Frequency Derivative Learning for Non-stationary Time Series Forecasting (DERITS)** · IJCAI 2024 / 2024 · [arXiv](https://arxiv.org/abs/2407.00502)
85. **FredNormer: Frequency Domain Normalization for Non-stationary Time Series Forecasting** · arXiv 2024(投稿中 / ICLR 系) · [arXiv](https://arxiv.org/abs/2410.20818)
86. **Proactive Model Adaptation Against Concept Drift for Online Time Series Forecasting (Proceed)** · KDD 2025 · [arXiv](https://arxiv.org/abs/2412.08435)
87. **SOFTS: Efficient Multivariate Time Series Forecasting with Series-Core Fusion** · NeurIPS 2024 / 2024（arXiv v1 2024-04-22,online 2024-11-18) · [arXiv](https://arxiv.org/abs/2404.14197)


### 11. 其它（2）

88. **Periodicity Decoupling Framework for Long-term Series Forecasting** · ICLR 2024 (Poster)
89. **SageFormer: Series-Aware Framework for Long-term Multivariate Time Series Forecasting** · IEEE Internet of Things Journal (IoT-J), 2024 · [arXiv](https://arxiv.org/abs/2307.01616)

## 十、论文研读笔记下载

本次调研为**每一篇论文**都撰写了独立的中英混合研读笔记(结构:TL;DR / 背景动机 / 方法 / 实验 / 局限 / 相关工作 / 个人评述),共 89 篇,已打包为 zip:

**[📦 下载全部 89 篇研读笔记 (ts-forecasting-papers.zip)](/downloads/ts-forecasting-papers.zip)**

> 每份笔记均基于论文原文与公开信息整理;实验数值以原文为准。欢迎指正与补充。
