时序预测近两年研究综述:聚焦公共数据集(2023–2025)
本文是对 2023–2025 年时序预测(Time Series Forecasting) 方向的一次系统性梳理,聚焦于 公共时序数据集(即 GPT4TS / One-Fits-All 所使用的那批标准 benchmark)上的代表性工作。共深读整理 89 篇论文,覆盖 Transformer、线性/MLP、频域、基础模型、LLM、State-Space/Mamba、扩散生成、多变量相关性、非平稳、概率预测、时空、评测基准等十余个分支。每篇论文的独立研读笔记(中英混合)已打包为 zip,可在文末下载。
说明:文中涉及的实验结论以各论文原文为准;为避免以讹传讹,凡未能逐一核实的精确 MSE/MAE/CRPS 数值,均以定性描述呈现或标注"具体数值见原文"。
一、引言:为什么此刻重看时序预测
自 2021 年 Informer 掀起"Transformer 做长期预测"的热潮以来,时序预测(尤其是 Long-term Time Series Forecasting, LTSF)经历了一轮又一轮的范式更替。2022 年 DLinear(Are Transformers Effective for Time Series Forecasting?)用一个线性层击败了一众复杂 Transformer,几乎让整个方向"停摆反思";而 2023–2025 年,这个领域非但没有降温,反而分化出前所未有的多条主线:
- Transformer 阵营的自我修正:以 iTransformer 为代表,通过"倒置"视角重新赢回 SOTA;
- 线性/MLP 阵营的极致轻量化:FITS(10k 参数)、SparseTSF(1k 参数)把"简单即有效"推向极限;
- 基础模型(Foundation Model)的军备竞赛:TimesFM、Moirai、Chronos、MOMENT、Time-MoE 等纷纷追求"一个模型零样本预测万物";
- LLM 跨模态的兴起与祛魅:从 Time-LLM 到 GPT4TS,再到 Are Language Models Actually Useful for Time Series Forecasting? 的当头一棒;
- 新架构的涌入:Mamba/State-Space 与扩散生成模型大举进入时序领域。
与此同时,一批评测基准(TFB、BasicTS+、GIFT-Eval、ProbTS、TSFM-Bench) 开始严肃拷问:这些"SOTA"到底有多少是真实进步,又有多少是评测口径不一带来的幻觉?
本综述即以此为背景,力求把这幅快速演化的地图画清楚。
二、公共数据集与任务设定
理解这个领域,首先要理解它的"考卷"。近两年绝大多数工作都在以下公共数据集上评测:
长期预测(Long-term Forecasting)
| 数据集 | 变量数 | 采样粒度 | 领域 | 特点 |
|---|---|---|---|---|
| ETTh1/h2/m1/m2 | 7 | 1h / 15min | 电力变压器温度 | 最常用,强趋势+周期 |
| Weather | 21 | 10min | 气象 | 多变量弱相关 |
| Electricity (ECL) | 321 | 1h | 用电量 | 高维、强周期 |
| Traffic | 862 | 1h | 道路占用率 | 超高维、强空间相关 |
| Exchange | 8 | 1day | 汇率 | 近随机游走,弱周期 |
| ILI | 7 | 1week | 流感样病例 | 短序列 |
| Solar-Energy | 137 | 10min | 光伏 | 强日周期 |
| PEMS03/04/07/08 | 170–883 | 5min | 交通流量 | 时空图结构 |
评测协议通常固定 look-back(常见 96 或 336),预测 horizon ∈ {96, 192, 336, 720},以 MSE / MAE 衡量。
其它任务
- 短期预测:M4(单变量,多领域,sMAPE/OWA)、M5;
- 分类:UEA(多变量)/ UCR(单变量);
- 异常检测:SMD、MSL、SMAP、SWaT、PSM 五数据集(F1);
- 插补(Imputation):在上述数据集上按比例 mask;
- 概率预测:GluonTS 套件(Solar、Electricity、Traffic、Exchange、Wikipedia 等,以 CRPS / CRPS_sum 衡量)。
GPT4TS(One-Fits-All, NeurIPS 2023) 的重要贡献之一,就是用同一个骨干统一刷了上述"长/短期预测 + 分类 + 异常 + 插补"五大任务,奠定了后续"通用时序模型"评测的模板。
三、方法分类体系(总览)
近两年方法可归纳为八大分支。下表给出速览:
| 分支 | 核心思想 | 代表作(本文收录) |
|---|---|---|
| Transformer 类 | 改进 attention 的作用维度/对象 | iTransformer, CARD, Fredformer, TimeXer, Pathformer, SAMformer |
| 线性 / MLP 类 | 用极简结构 + 分解/混合取胜 | TimeMixer(++), FITS, SparseTSF, CycleNet, SOFTS, U-Mixer |
| 频域方法 | 在 Fourier/频域建模与做损失 | FreDF, FreqMoE, TSLANet, ATFNet, FilterNet, FAN, FredNormer, DERITS |
| 基础模型 / 预训练 | 大规模预训练 + 零样本 | TimesFM, Moirai(-MoE), Chronos(-Bolt), MOMENT, Timer(-XL), TTM, UniTS, Time-MoE |
| LLM for TS | 复用/重编程大语言模型 | Time-LLM, GPT4TS, TEMPO, AutoTimes, S2IP-LLM, TEST, UniTime, CALF, TimeCMA, LLM4TS |
| State-Space / Mamba | 用选择性状态空间做近线性长依赖 | S-Mamba, TimeMachine, MambaTS, Bi-Mamba+, SST, Chimera, Time-SSM 等 |
| 扩散 / 生成 | 概率预测与生成建模 | TSFlow, NsDiff, Diffusion-TS, mr-Diff, TMDM, MG-TSD, TACTiS-2 |
| 多变量相关性 / GNN | 显式建模跨变量/跨节点依赖 | DUET, GinAR, MSGNet, SageFormer, STG-Mamba |
下面逐一展开。
四、方法演进(上):Transformer、线性/MLP、频域、多变量
4.1 Transformer 阵营的绝地反击
DLinear 的暴击之后,Transformer 阵营的反思集中在一个问题:过去把"时间步"当 token 是否搞错了对象?
- iTransformer(ICLR 2024 Spotlight)给出了最优雅的答案:不改任何组件,只把 attention/FFN 的作用维度倒置——每条变量的整段序列作为一个 variate token,attention 建模跨变量相关性,共享 FFN 学时序非线性。这一"换视角而非换结构"的操作让 Transformer 重回 SOTA,并能随 look-back 增长持续受益,现已成为时序领域最常用的 backbone 之一。
- CARD(ICLR 2024)针对 PatchTST 时代"通道独立(Channel Independence, CI)"策略丢弃跨变量信息的短板,提出 channel-aligned attention 在保留 CI 鲁棒性的同时受控地重新引入跨变量相关,并配合 signal-decay robust loss 抗过拟合。
- Fredformer(KDD 2024)识别并形式化了 Transformer 的频率偏置(frequency bias)——模型倾向于学低频而忽略关键高频细节,通过频域去偏与 Nyström 轻量近似兼顾精度与效率。
- TimeXer(NeurIPS 2024)把长期被忽视的外生变量(exogenous variables) 纳入 Transformer,用内生 patch token + 外生 variate token 的交叉注意力,贴近真实业务中"带协变量预测"的需求。
- Pathformer(ICLR 2024)引入多尺度自适应路径,按输入动态选择不同 patch 尺度的建模分支。
- SAMformer(ICML 2024)从优化角度切入,用 Sharpness-Aware Minimization 解决 Transformer 在时序上易陷入尖锐极小值、训练不稳的问题,以浅层通道注意力取得竞争力。
小结:Transformer 的复兴不是靠更复杂的结构,而是靠换对建模对象(变量维)、修正频率偏置、稳住优化。
4.2 线性 / MLP:简单即强大,轻量到极致
DLinear 的精神被这一支发扬光大:
- TimeMixer(ICLR 2024)用纯 MLP 的 decomposable multiscale mixing——过去混合(Past-Decomposable-Mixing)+ 未来混合(Future-Multipredictor-Mixing),在多尺度上分别 mix 季节与趋势;其升级版 TimeMixer++(ICLR 2025)进一步把"时间域多尺度 × 频域多分辨率"解耦为正交两轴,泛化成覆盖 8 类任务的通用时序模式机(TSPM)。
- FITS(ICLR 2024)以约 10k 参数在频域用一个复数线性层做插值,性能媲美重型模型;SparseTSF(ICML 2024 Oral)更进一步,用 1k 参数通过跨周期稀疏建模完成长期预测——这两者几乎把"参数效率"推到了理论下限,极具工程价值。
- CycleNet(NeurIPS 2024)显式建模可学习的周期模式(Residual Cycle Forecasting),以极小代价提升周期性强的数据集表现。
- SOFTS(NeurIPS 2024)提出 Series-Core Fusion,用一个中心化的 series core 高效聚合跨变量信息,兼顾 MLP 的效率与跨变量建模。
- U-Mixer(AAAI 2024)把 MLP-Mixer 与 U-Net 结合并加平稳性校正。
4.3 频域方法:从"在频域建模"到"在频域做损失"
频域是近两年最活跃的切入点之一:
- FreDF(ICLR 2025)提出一个反直觉但重要的观察:主流方法在时域计算损失会强制模型拟合自相关噪声,改为在频域计算预测损失能显著解耦标签自相关,即插即用地提升多种骨干。
- FreqMoE(AISTATS 2025)把 MoE 的"分而治之"锚定到频段语义上——不同频段交给不同的轻量复数专家,动态门控组合。
- FilterNet(NeurIPS 2024)直接用可学习的频率滤波器(类信号处理)做预测;TSLANet(ICML 2024)用自适应频谱滤波替代注意力做通用表示。
- ATFNet(2024)时频双分支自适应集成;DERITS(IJCAI 2024)用频域导数学习应对非平稳。
- 归一化方向:FAN(NeurIPS 2024)做频率自适应归一化,FredNormer 在频域做实例归一化,均针对分布漂移。
4.4 多变量相关性:CI 与 CD 之争的和解
PatchTST 之后,"通道独立(CI)vs 通道依赖(CD)"成为核心争论。近两年的趋势是寻找二者之间的中间地带:
- DUET(KDD 2025)用双聚类——时间维聚类(TCM)应对异质分布 + 通道维频域软聚类稀疏化(CCM)选择性建模跨通道交互,提供比纯 CI/CD 更抗噪的方案。
- GinAR(KDD 2024)针对真实场景的变量缺失,用插值注意力 + 自适应图卷积做端到端鲁棒预测。
- MSGNet(AAAI 2024)、SageFormer(IoT-J 2024)用 GNN / series-aware 框架显式建模多尺度跨序列相关。
五、方法演进(下):基础模型、LLM、Mamba、扩散
5.1 时序基础模型:一个模型零样本预测万物
这是近两年最热的主线。核心配方是"大规模跨域预训练 + 零样本迁移":
| 模型 | 机构 | 架构 | 关键点 |
|---|---|---|---|
| TimesFM(ICML 2024) | Decoder-only | patch 输入,大规模真实+合成语料预训练 | |
| Moirai(ICML 2024) | Salesforce | Encoder(masked) | 多 patch size、any-variate,LOTSA 大语料 |
| Chronos(TMLR 2024) | Amazon | T5(复用 NLP) | tokenization:缩放+量化成离散 token,几乎零时序专用改动 |
| MOMENT(ICML 2024) | CMU | Encoder(masked) | 开源、多任务,配 Time-Series Pile |
| Timer / Timer-XL(ICML/ICLR) | 清华 | Decoder-only | 生成式 LTSM;Timer-XL 用 TimeAttention 统一多变量+长上下文+协变量 |
| UniTS(NeurIPS 2024) | Harvard | 统一 token | 一套权重跨预测/分类/异常/插补多任务 |
| TTM(NeurIPS 2024) | IBM | 轻量 TSMixer | 极小模型也能强零/少样本,主打高效 |
| Time-MoE(ICLR 2025) | — | 稀疏 MoE | 首个 billion 级,容量与激活算力解耦,验证 scaling law |
| Moirai-MoE(ICML 2025) | Salesforce | 稀疏 MoE | 用 token 级专家替代人工 patch 启发式 |
| Chronos-Bolt | Amazon | patch+direct | 工程优化版,更快更准 |
看点:(1)Chronos 证明了"把时序当语言"——极简 tokenization + 复用成熟 NLP 生态即可获强零样本,其 42-dataset 零样本协议成为事实标准;(2)Time-MoE 把 LLM 的稀疏 MoE scaling 配方成功搬到时序,给出"扩容不涨推理成本"的证据;(3)Chronos 的 42-dataset 零样本评测与后续的 GIFT-Eval / TSFM-Bench 一起,把"零样本是否名副其实"推上台面。
5.2 LLM for TS:兴起、繁荣与祛魅
用大语言模型做时序,是一条充满争议的路线:
- 重编程 / 对齐路线:Time-LLM(ICLR 2024)通过 reprogramming + Prompt-as-Prefix 把时序对齐进冻结 LLM;GPT4TS/One-Fits-All 冻结 GPT-2 大部分参数刷五大任务;TEMPO(ICLR 2024)用分解 + 软 prompt;S2IP-LLM(ICML 2024)做语义空间 prompt;TEST(ICLR 2024)用文本原型对齐激活 LLM;CALF / TimeCMA(AAAI 2025)聚焦跨模态对齐缩小文本-时序分布差,并解决 LLM 推理贵的痛点;AutoTimes(NeurIPS 2024)把 decoder-only LLM 变成自回归时序预测器;UniTime / LLM4TS / aLLM4TS 走跨域统一与数据高效路线。
- 祛魅的一击:Are Language Models Actually Useful for Time Series Forecasting?(NeurIPS 2024)通过消融实验发现——把 LLM 组件移除或替换成简单结构,性能往往不降反而持平/更好,质疑了 LLM 在时序预测中的实际增益。这项工作促使整个子领域重新审视"LLM 到底贡献了什么"。
判断:LLM-for-TS 在少样本/零样本、跨模态(带文本上下文) 场景仍有独特价值,但在纯数值 LTSF 上,其相对轻量专用模型的优势尚存疑,需要更严谨的对照。
5.3 State-Space / Mamba:近线性长依赖的新宠
Mamba(选择性状态空间 S6)以近线性复杂度建模长依赖,2024 年密集涌入时序:
- S-Mamba(Is Mamba Effective for TSF?)系统验证 Mamba 在 LTSF 的有效性,成为该支的锚点;
- TimeMachine(ECAI 2024)"4 个 Mamba"多尺度协同;MambaTS(NeurIPS 2024)改进变量扫描顺序;Bi-Mamba+ 双向建模;SST 做 Mamba×Transformer 多尺度混合专家;Chimera(NeurIPS 2024)用 2D SSM 同时建模时间与变量维;Time-SSM / DTMamba / CMamba / MambaMixer / Mambaformer / SiMBA / Mamba4Cast 各有侧重(统一理论、双塔、通道相关、双向选择、混合、零样本)。
评价:Mamba 系的最大卖点是效率(近线性、低显存),在超高维数据集(Traffic/ECL)上尤具吸引力;但相对 iTransformer 的精度增益并不总是稳定,且论文间评测口径差异较大,需结合 TFB 等公平基准审视。
5.4 扩散 / 生成:概率预测的主场
当需求从"点预测"转向"带不确定性的概率预测"时,扩散/生成模型登场:
- TSFlow(ICLR 2025)用 Gaussian Process 先验替代白噪声做 Flow Matching,使先验贴合时序结构,同时提升样本质量与采样速度;
- NsDiff(ICML 2025 Spotlight)用 Location-Scale 噪声模型替代 DDPM 常方差假设,把时变不确定性注入扩散;
- Diffusion-TS(ICLR 2024)可解释地做通用时序生成;mr-Diff(ICLR 2024)多分辨率扩散;TMDM(ICLR 2024)Transformer 调制扩散;MG-TSD(ICLR 2024)多粒度引导;LDT(AAAI 2024)潜空间扩散;CCDM 通道感知条件扩散;
- TACTiS-2(ICLR 2024)用简化的注意力 copula(线性复杂度 + 两阶段课程)做多变量概率预测,兼顾预测/插补与不规则采样。
六、评测基准:进步还是幻觉?
近两年一个健康的信号,是评测基准本身成为研究对象:
- TFB(VLDB 2024):统一 pipeline,25 数据集 + 8000+ 单变量序列,公平对比统计/ML/DL 三类方法,发现传统方法在部分场景不逊于深度学习;
- BasicTS+ / Exploring Progress(TKDE 2024):强调数据集异质性,提供公平多变量对比;
- GIFT-Eval(2024):7 领域 23 数据集,认真对待数据泄漏,提供独立无泄漏预训练语料 + 公开榜;
- ProbTS(NeurIPS 2024):把点预测与概率预测统一到 NMAE + CRPS 双指标、多 horizon 的坐标系,揭示"分布刻画能力 vs 长程精度"的结构性权衡;
- TSFM-Bench / FoundTS(KDD 2025):统一评测 LLM-based 与 TS-pretrained 两类基础模型的 zero/few/full-shot;
- Deep Time Series Models Survey(2024):综述 + 基准。
共识结论:(1)没有单一模型在所有 horizon、所有指标上通吃;(2)方法优劣高度依赖数据的趋势/季节/平稳性特征;(3)评测口径(look-back、归一化、划分)的不一致,是过去"SOTA 泛滥"的重要原因。
七、趋势、争议与开放问题
四大趋势:
- 基础模型与零样本成为竞赛焦点,配方(大语料 + decoder-only/掩码 + tokenization/MoE)日趋 NLP 化;
- 效率导向回归:FITS/SparseTSF/TTM/Mamba 证明"小而美"在很多场景足够;
- 频域从建模手段扩展到损失函数(FreDF)与归一化(FAN);
- 概率化:从点预测走向带不确定性的分布预测。
核心争议:
- 线性 vs 复杂模型:DLinear 之问至今未被彻底回答——复杂模型的增益在公平评测下常被压缩;
- 通道独立 vs 依赖:并无普适赢家,DUET/CARD 式的"软性折中"成为趋势;
- LLM 是否有用:NeurIPS 2024 的批判性工作使这一路线进入冷静期;
- 评测可信度:数据泄漏、look-back 不一致、cherry-picking 仍是隐患。
开放问题:真正的跨域零样本泛化、协变量/外生信息的有效利用、长上下文下的非平稳处理、概率预测的校准、以及一个被广泛接受的公平评测标准。
八、结语
如果说 2022 年 DLinear 的意义是"戳破泡沫",那么 2023–2025 年的意义就是在废墟上重建多元的方法生态:Transformer 学会了谦逊(换视角、修偏置),线性模型证明了极简的力量,基础模型点燃了零样本的野心,而评测基准则扮演了冷静的裁判。下一个真正的突破,或许不在于某个更花哨的架构,而在于谁能在公平、无泄漏的评测下,拿出稳定且可迁移的泛化能力。
九、论文清单(89 篇)
以下为本次深读整理的全部论文,按方向分组。每篇的完整研读笔记(中英混合)见文末 zip 下载。
1. Transformer 类(4)
- CARD: Channel Aligned Robust Blend Transformer for Time Series Forecasting · ICLR 2024 · arXiv
- iTransformer: Inverted Transformers Are Effective for Time Series Forecasting · ICLR 2024 (Spotlight) / 2024 · arXiv
- TimeBridge: Non-Stationarity Matters for Long-term Time Series Forecasting · ICML 2025 / 2025 · arXiv
- TimeXer: Empowering Transformers for Time Series Forecasting with Exogenous Variables · NeurIPS 2024 / 2024 · arXiv
2. 线性 / MLP(5)
- CycleNet: Enhancing Time Series Forecasting through Modeling Periodic Patterns · NeurIPS 2024 / 2024 · arXiv
- HDMixer: Hierarchical Dependency with Extendable Patch for Multivariate Time Series Forecasting · AAAI 2024 (Proceedings of the AAAI Conference on Artificial Intelligence, article 29155)
- SparseTSF: Modeling Long-term Time Series Forecasting with 1k Parameters · ICML 2024 (Oral) / 2024 · arXiv
- TimeMixer: Decomposable Multiscale Mixing for Time Series Forecasting · ICLR 2024 · arXiv
- U-Mixer: An Unet-Mixer Architecture with Stationarity Correction for Time Series Forecasting · AAAI 2024 / 2024 · arXiv
2b. 多变量相关性 / GNN(3)
- DUET: Dual Clustering Enhanced Multivariate Time Series Forecasting · KDD 2025 (Research Track) / 2025 · arXiv
- MSGNet: Learning Multi-Scale Inter-Series Correlations for Multivariate Time Series Forecasting · AAAI 2024 · arXiv
- SAMformer: Unlocking the Potential of Transformers in Time Series Forecasting with Sharpness-Aware Minimization and Channel-Wise Attention · ICML 2024 / 2024 · arXiv
2c. 分块 / 多尺度 / token化(5)
- Learning to Embed Time Series Patches Independently · ICLR 2024 · arXiv
- MTST: Multi-resolution Time-Series Transformer for Long-term Forecasting · AISTATS 2024 · arXiv
- MultiResFormer: Transformer with Adaptive Multi-Resolution Modeling for General Time Series Forecasting · arXiv / 2024 (v1 2023/11/30, v2 2024/02/08) · arXiv
- Pathformer: Multi-scale Transformers with Adaptive Pathways for Time Series Forecasting · ICLR 2024 · arXiv
- TimeMixer++: A General Time Series Pattern Machine for Universal Predictive Analysis · ICLR 2025 / 2025 · arXiv
3. 频域方法(8)
- ATFNet: Adaptive Time-Frequency Ensembled Network for Long-term Time Series Forecasting · arXiv 2024 · arXiv
- FilterNet: Harnessing Frequency Filters for Time Series Forecasting · NeurIPS 2024 · arXiv
- FITS: Modeling Time Series with 10k Parameters · ICLR 2024 · arXiv
- FreDF: Learning to Forecast in the Frequency Domain · ICLR 2025 · arXiv
- Fredformer: Frequency Debiased Transformer for Time Series Forecasting · KDD 2024 · arXiv
- FreqMoE: Enhancing Time Series Forecasting through Frequency Decomposition Mixture of Experts · AISTATS 2025 · arXiv
- Frequency Adaptive Normalization For Non-stationary Time Series Forecasting (FAN) · NeurIPS 2024 · arXiv
- TSLANet: Rethinking Transformers for Time Series Representation Learning · ICML 2024 · arXiv
4. 基础模型 / 预训练(15)
- A decoder-only foundation model for time-series forecasting (TimesFM) · ICML 2024 / 2024 (arXiv v1: 2023-10) · arXiv
- Chronos-Bolt: Faster and More Accurate Chronos Forecasting · 2024 / Technical report (AWS AI Blog, 2024-12-02)+ GitHub + AutoGluon-TimeSeries v1.2,无独立 arXiv 论文 · arXiv
- Chronos: Learning the Language of Time Series · TMLR 2024 / 2024 · arXiv
- LLM4TS: Aligning Pre-Trained LLMs as Data-Efficient Time-Series Forecasters · ACM TIST 2025(2024/2025 正式发表,arXiv 2023/08 首发,v6 更新至 2025/02) · arXiv
- Moirai-MoE: Empowering Time Series Foundation Models with Sparse Mixture of Experts · arXiv 2024 (2410.10469, 提交于 2024-10-14;后被 ICML 2025 接收) · arXiv
- MOMENT: A Family of Open Time-series Foundation Models · ICML 2024 / 2024 · arXiv
- ProbTS: Benchmarking Point and Distributional Forecasting across Diverse Prediction Horizons · NeurIPS 2024 (Datasets & Benchmarks Track) / 2024 · arXiv
- Time-MoE: Billion-Scale Time Series Foundation Models with Mixture of Experts · ICLR 2025 / 2025 · arXiv
- Timer-XL: Long-Context Transformers for Unified Time Series Forecasting · ICLR 2025 · arXiv
- Timer: Generative Pre-trained Transformers Are Large Time Series Models · ICML 2024 / 2024 · arXiv
- Tiny Time Mixers (TTMs): Fast Pre-trained Models for Enhanced Zero/Few-Shot Forecasting of Multivariate Time Series · NeurIPS 2024 / 2024 · arXiv
- TSFM-Bench (原名 FoundTS): A Comprehensive and Unified Benchmark of Foundation Models for Time Series Forecasting · KDD 2025 (arXiv 2024/10 首发,v6 2025/06 修订) · arXiv
- Unified Training of Universal Time Series Forecasting Transformers (Moirai) · ICML 2024 (International Conference on Machine Learning) / 2024 · arXiv
- UniST: A Prompt-Empowered Universal Model for Urban Spatio-Temporal Prediction · KDD 2024 · arXiv
- UniTS: A Unified Multi-Task Time Series Model · NeurIPS 2024 / 2024 · arXiv
5. LLM for Time Series(10)
- Are Language Models Actually Useful for Time Series Forecasting? · NeurIPS 2024 / 2024 · arXiv
- AutoTimes: Autoregressive Time Series Forecasters via Large Language Models · NeurIPS 2024 / 2024(arXiv 首发 2024-02-04) · arXiv
- CALF: Aligning LLMs for Time Series Forecasting via Cross-modal Fine-Tuning · AAAI 2025 (formerly LLaTA) · arXiv
- Multi-Patch Prediction: Adapting LLMs for Time Series Representation Learning (aLLM4TS) · ICML 2024 / 2024(arXiv 首发 2024-02-07) · arXiv
- S2IP-LLM: Semantic Space Informed Prompt Learning with LLM for Time Series Forecasting · ICML 2024 / 2024 · arXiv
- TEMPO: Prompt-based Generative Pre-trained Transformer for Time Series Forecasting · ICLR 2024 · arXiv
- TEST: Text Prototype Aligned Embedding to Activate LLM's Ability for Time Series · ICLR 2024 / 2024 (arXiv v1 2023-08) · arXiv
- Time-LLM: Time Series Forecasting by Reprogramming Large Language Models · ICLR 2024 / 2024(arXiv 首发 2023-10) · arXiv
- TimeCMA: Towards LLM-Empowered Multivariate Time Series Forecasting via Cross-Modality Alignment · AAAI 2025 / 2025(arXiv 首次提交 2024-06-03) · arXiv
- UniTime: A Language-Empowered Unified Model for Cross-Domain Time Series Forecasting · WWW 2024 / 2024(arXiv 首发 2023-10-15) · arXiv
6. State-Space / Mamba(14)
- Bi-Mamba+: Bidirectional Mamba for Time Series Forecasting · arXiv / 2024 (提交于 2024-04-24,v2 更新于 2024-06-27) · arXiv
- Chimera: Effectively Modeling Multivariate Time Series with 2-Dimensional State Space Models · NeurIPS 2024 / 2024 · arXiv
- CMamba: Channel Correlation Enhanced State Space Models for Multivariate Time Series Forecasting · arXiv preprint / 2024 (v1 2024-06-08,最新 v3 2024-09-26) · arXiv
- DTMamba: Dual Twin Mamba for Time Series Forecasting · arXiv (preprint) / 2024 (v1: 2024-05-11) · arXiv
- Is Mamba Effective for Time Series Forecasting? (S-Mamba) · arXiv 2024 (v1: 2024-03-17, v3: 2024-04-27);后被 Neurocomputing (2025) 收录 · arXiv
- Mamba4Cast: Efficient Zero-Shot Time Series Forecasting with State Space Models · arXiv 2410.09385, 2024(NeurIPS 2024 "Time Series in the Age of Large Models" Workshop) · arXiv
- Mambaformer: Integrating Mamba and Transformer for Long-Short Range Time Series Forecasting · arXiv preprint / 2024 (提交于 2024-04-23) · arXiv
- MambaMixer: Efficient Selective State Space Models with Dual Token and Channel Selection · arXiv / 2024 (v1 2024-03-29, 后有多版更新) · arXiv
- MambaTS: Improved Selective State Space Models for Long-term Time Series Forecasting · NeurIPS 2024 / 2024 · arXiv
- SiMBA: Simplified Mamba-Based Architecture for Vision and Multivariate Time Series · arXiv (2024) · arXiv
- SST: Multi-Scale Hybrid Mamba-Transformer Experts for Time Series Forecasting · arXiv / 2024(v1 提交 2024-04-23,后续修订至 v3,online date 2025-11-02) · arXiv
- STG-Mamba: Spatial-Temporal Graph Learning via Selective State Space Model · arXiv preprint / 2024 · arXiv
- Time-SSM: Simplifying and Unifying State Space Models for Time Series Forecasting · arXiv (preprint) / 2024 · arXiv
- TimeMachine: A Time Series is Worth 4 Mambas for Long-term Forecasting · ECAI 2024 (27th European Conference on Artificial Intelligence) / 2024 · arXiv
7. 扩散 / 生成 / 概率预测(9)
- Channel-aware Contrastive Conditional Diffusion for Multivariate Probabilistic Time Series Forecasting (CCDM) · arXiv (preprint) / 2024 · arXiv
- Diffusion-TS: Interpretable Diffusion for General Time Series Generation · ICLR 2024 · arXiv
- Flow Matching with Gaussian Process Priors for Probabilistic Time Series Forecasting (TSFlow) · ICLR 2025 / 2025 · arXiv
- Latent Diffusion Transformer for Probabilistic Time Series Forecasting (LDT) · AAAI 2024 (Proceedings of the AAAI Conference on Artificial Intelligence, Vol. 38, No. 11, pp. 11979–11987)
- MG-TSD: Multi-Granularity Time Series Diffusion Models with Guided Learning Process · ICLR 2024 · arXiv
- Multi-Resolution Diffusion Models for Time Series Forecasting (mr-Diff) · ICLR 2024
- Non-stationary Diffusion for Probabilistic Time Series Forecasting (NsDiff) · ICML 2025 (Spotlight Poster) / 2025 · arXiv
- TACTiS-2: Better, Faster, Simpler Attentional Copulas for Multivariate Time Series · ICLR 2024 / 2024 · arXiv
- Transformer-Modulated Diffusion Models for Probabilistic Multivariate Time Series Forecasting (TMDM) · ICLR 2024
8. 时空 / 城市 / 交通(6)
- GinAR: An End-to-End Multivariate Time Series Forecasting Model Suitable for Variable Missing · KDD 2024 (Research Track) / 2024 · arXiv
- GraFITi: Graphs for Forecasting Irregularly Sampled Time Series · AAAI 2024 / 2024 · arXiv
- ImputeFormer: Low Rankness-Induced Transformers for Generalizable Spatiotemporal Imputation · KDD 2024 (DOI 10.1145/3637528.3671751) · arXiv
- Spatial-Temporal-Decoupled Masked Pre-training for Spatiotemporal Forecasting (STD-MAE) · IJCAI 2024 / 2024 · arXiv
- TOTEM: TOkenized Time Series EMbeddings for General Time Series Analysis · TMLR 2024 / 2024 · arXiv
- UrbanGPT: Spatio-Temporal Large Language Models · KDD 2024 (Accepted as Full Paper) / 2024 · arXiv
9. 基准 / 评测 / 综述(4)
- Deep Time Series Models: A Comprehensive Survey and Benchmark · arXiv preprint / 2024 · arXiv
- Exploring Progress in Multivariate Time Series Forecasting: Comprehensive Benchmarking and Heterogeneity Analysis (BasicTS+) · IEEE TKDE 2024 (arXiv 预印本 2023/10) · arXiv
- GIFT-Eval: A Benchmark for General Time Series Forecasting Model Evaluation · NeurIPS 2024 TSALM Workshop / ICLR 2025 · 2024 · arXiv
- TFB: Towards Comprehensive and Fair Benchmarking of Time Series Forecasting Methods · VLDB 2024 (PVLDB Vol. 17) / 2024 · arXiv
10. 非平稳 / 在线自适应(4)
- Deep Frequency Derivative Learning for Non-stationary Time Series Forecasting (DERITS) · IJCAI 2024 / 2024 · arXiv
- FredNormer: Frequency Domain Normalization for Non-stationary Time Series Forecasting · arXiv 2024(投稿中 / ICLR 系) · arXiv
- Proactive Model Adaptation Against Concept Drift for Online Time Series Forecasting (Proceed) · KDD 2025 · arXiv
- SOFTS: Efficient Multivariate Time Series Forecasting with Series-Core Fusion · NeurIPS 2024 / 2024(arXiv v1 2024-04-22,online 2024-11-18) · arXiv
11. 其它(2)
- Periodicity Decoupling Framework for Long-term Series Forecasting · ICLR 2024 (Poster)
- SageFormer: Series-Aware Framework for Long-term Multivariate Time Series Forecasting · IEEE Internet of Things Journal (IoT-J), 2024 · arXiv
十、论文研读笔记下载
本次调研为每一篇论文都撰写了独立的中英混合研读笔记(结构:TL;DR / 背景动机 / 方法 / 实验 / 局限 / 相关工作 / 个人评述),共 89 篇,已打包为 zip:
📦 下载全部 89 篇研读笔记 (ts-forecasting-papers.zip)
每份笔记均基于论文原文与公开信息整理;实验数值以原文为准。欢迎指正与补充。