AI 19 分钟阅读

Falcon-X 技术精读:从原型空间到差分注意力

· 更新于 2026/8/10

本文是对蚂蚁国际(Ant International)时序基座模型 Falcon-X 论文(arXiv:2605.27286)的深度精读,所有架构细节、公式、超参与论文图均来自论文原文与官方仓库 ant-intl/Falcon-TST 源码。Falcon-X 是 Falcon 家族(1.0 / 2.0 / X)中唯一有正式论文的成员,定位为 591M 参数的原生多变量异构建模基座模型。

一、技术架构总路线图

Falcon-X 的整体设计哲学是**"解耦"**:把"物理变量空间"和"潜在交互空间"彻底分开。物理变量先各自独立做时间建模,再统一映射到一个固定维度的原型空间做跨变量交互,最后路由还原回各变量。整套流水线如下:

Falcon-X 整体架构

Figure 2:Falcon-X 整体架构。原始输入经归一化、分词后,由 Time Attention 提取各变量独立的时序特征;Unified Prototype Diff-Attention (UPDA) 将这些特征投射到共享原型空间;Latent Entity Attention (LEA) 在该空间内捕获全局跨变量依赖;Variate Reassembly Router (VRR) 动态重建变量特定表示;最后融合时序上下文,经分位数头输出概率预测。

四阶段流水线:

阶段 模块 输入 → 输出 作用
① 预处理 Normalization + Tokenization X ∈ ℝ^(M×(L+T))H ∈ ℝ^(M×P×D) arcsin 归一化 + 残差 patch embedding
② 时间建模 Time Attention(n 层) HH_T ∈ ℝ^(M×P×D) 各变量独立沿时间维 self-attention
③ 跨变量交互 UPDA + LEA(l 层) H_TH_C' ∈ ℝ^(N×C×P×D) 投射原型空间 + 全局跨变量注意力
④ 还原预测 VRR + Gated Residual + Quantile Head H_C'Ŷ ∈ ℝ^(M×T) 路由回变量维 + 门控融合 + 分位数输出

其中 M=Σmᵢ 是所有 entity 的变量总数,mᵢ 各异(异构的根源),N 是 entity 数,P=(L+T)/Lp 是 patch 数,D 隐藏维度,C 原型维度(C≪M)。

核心数据流的关键形状变化(理解全文的钥匙):

原始:   M × (L+T)          # M 个物理变量,每个长度 L+T,维度参差不齐
   ↓ Normalization + Tokenization
Token:  M × P × D           # 每个 patch 映射到 D 维
   ↓ Time Attention (n 层, 沿 P 维独立)
H_T:    M × P × D           # 各变量时序特征已稳定
   ↓ UPDA (投射到原型空间)
H_C:    N × C × P × D       # ★ 维度从 M 压到 C,与物理变量数解耦
   ↓ LEA (l 层, 沿 N×C 维)
H_C':   N × C × P × D       # 全局跨变量交互完成
   ↓ VRR (路由回变量维)
H_V:    M × P × D           # 维度恢复回 M
   ↓ Gated Residual + Quantile Head
Ŷ:      M × T               # 概率预测

整条流水线的本质是两次"压缩-还原"M → C(UPDA 压到原型空间)和 C → M(VRR 还原),中间的交互计算量与物理变量数 M 无关,只与原型数 C 相关——这就是 Falcon-X 能处理"极端高维异构变量"的根因。

二、要解决的两个根本问题

论文开篇就指出,现有的多变量 TSFM(Moirai-1.0 flatten、Toto 因子化时空注意力、Chronos-2 group attention)都直接在原始变量空间做交互,有两个根本缺陷:

多变量建模范式对比

Figure 1:多变量建模范式对比。(a) 高度异构的输入。(b) Group attention 对完全不同的输入产生几乎相同的注意力图,暴露原始变量空间的语义坍塌和过平滑。(c-d) Falcon-X 投射到潜在原型空间后,注意力图高度可区分,准确捕获底层动态。

问题❶ 语义对齐缺失:不同数据集共享同一 Transformer backbone,但它们的变量对应完全不同的物理量(温度 vs 汇率 vs 客流),量纲、语义都不同。在原始空间混合,模型只能把这种异构性隐式吸收进参数里,跨域迁移成了"参数共享的副产品"而非有原则的结构复用。更糟的是,高维系统中只有少数变量强相关,其余是弱相关或噪声,原始空间稠密注意力会把有意义信号稀释掉(Figure 1(b) 的语义坍塌就是证据)。

问题❷ 关系表达力不足:现实系统中跨变量依赖既有协同(synergistic,正相关)也有拮抗(antagonistic,负相关)。但标准 attention 的 softmax 输出非负值 [0,1],只能表达"有多聚合/相似",无法表达对冲动态

Falcon-X 对这两个问题的回应是:用一个固定 C 维的可学习原型空间做语义对齐坐标,用差分注意力表达正负亲和度。下表是它与所有主流 TSFM 的能力对比,注意 Falcon-X 是唯一在"Signed Dependence(带符号依赖)"和"Heterogeneous Unification(异构统一)"两列都打勾的:

能力 Falcon-X Moirai 2.0 TimesFM-2.5 Chronos-2 Timer-S1 Toto Sundial Moirai 1.0 TabPFN-TS
Univariate
Multivariate
Cross Learning
Signed Dependence
Heterogeneous Unification Prototype Routing Group Mixing Fixed Concat.

Table 1:Cross Learning = 跨数据集迁移通用跨变量交互模式;Signed Dependence = 同时计算正负亲和度;Heterogeneous Unification = 把不同维度的物理变量投射到维度无关的潜在空间。

三、逐模块深度解析(公式 + 代码映射)

3.1 Normalization & Tokenization

归一化采用 arcsin 变换而非常见的 RevIN 线性标准化:

$$\hat{X} = \arcsin\left(\frac{X - \mu}{\sigma}\right)$$

实例均值 μ、标准差 σ 只从观测值计算,缺失位置保留(不补零、不截断),交给下游 mask 显式建模。arcsin 的选择是为了把数值压到 [-π/2, π/2] 有界区间,配合推理时的 sin 反归一化 Ỹ=σ·sin(Ŷ)+μ,对极端值更鲁棒。

Tokenization 把输入与相对时间戳 T、观测 mask M 拼接后分 patch。时间戳锚定在第一个预测步为 0:

$$\mathcal{T} = \{-\frac{L}{L+T}, \dots, 0, \dots, \frac{T-1}{L+T}\}$$

这让它能泛化到异构采样频率。patch 长度 Lp,patch 数 P=(L+T)/Lp,经 ResPatchEmbed(残差 patch embedding,融合线性与非线性语义)映射到隐藏维 D:

$$H = \text{ResPatchEmbed}(\text{Concat}(\hat{X}, \mathcal{T}, \mathcal{M})) \in \mathbb{R}^{M \times P \times D}$$

3.2 Time Attention(n 层)

这是纯时间维度的 self-attention,对每个变量独立施加。论文 A.2 节强调一个关键设计选择:时间建模与跨变量建模刻意解耦——不像很多多变量模型那样交错混合时间和空间,那会导致语义纠缠(一个变量的微弱时序信号被异构邻居的噪声过早污染)。Falcon-X 先堆 n 层 Time Attention,把每个变量的时序演化状态充分提炼稳定,再进入跨变量阶段。

每层就是标准 post-LN 残差结构:

$$H^{(i)} = \text{LayerNorm}(H^{(i-1)} + \text{MHA}(H^{(i-1)}))$$

输出 H_T ∈ ℝ^(M×P×D),封装了每个变量的完整时序动态。注意:这一步 M 个变量之间完全没有交互,是干净的逐变量特征。

与 Falcon-1.0 的对照:Falcon-1.0 的 FalconTSTExpertfalcon1/models/modeling_falcon_tst.py)每个专家内部也是 TransformerLayer 堆叠 + RoPE + RMSNorm,同样是先做时间维 attention。差异在于 1.0 用 MoE 把不同 patch 尺度的专家路由分流,而 Falcon-X 取消了 MoE、改用统一的 Lp=16 patch,把"多尺度"能力后移到原型空间机制里。

3.3 Unified Prototype Diff-Attention (UPDA) —— 核心创新

这是全文最关键的模块。它要解决 H_T(M 维物理空间)到 H_C(C 维原型空间)的投射,并用差分机制表达正负亲和度。

定义两组全局共享的可学习原型键K_pos, K_neg ∈ ℝ^(C×D),分别代表协同原型和拮抗原型。对第 i 个 entity,由其时序嵌入 h_T^i ∈ ℝ^(mᵢ×P×D) 经线性投射生成 query Q^i 和 value V^i,计算双依赖注意力图:

$$A_{pos}^i = \text{softmax}\left(\frac{Q^i K_{pos}^\top}{\sqrt{D}}\right), \quad A_{neg}^i = \text{softmax}\left(\frac{Q^i K_{neg}^\top}{\sqrt{D}}\right)$$

然后差分聚合得到统一表示:

$$h_C^i = [A_{pos}^i - \lambda \cdot A_{neg}^i]^\top V^i$$

λ 是可学习缩放因子。A_pos - λ·A_neg 这一步是精髓——因为 softmax 恒非负,单个 A_posA_neg 只能量化"与协同/拮抗原型的相似度",但两者相减后可以产生正负值,从而显式表达"这个变量对某原型是协同还是对冲"。这是对标准注意力"只能聚合不能对冲"的根本修正,灵感来自 Differential Attention(Ye et al., 2025),但原论文用于抑制噪声,Falcon-X 重新用于捕获双依赖动态。

为强制正负原型语义可分,加正交损失约束两者不相似:

$$\mathcal{L}_{orth} = \text{Sim}(K_{pos}, K_{neg})$$

其中 Sim 是归一化余弦相似度。整个投射在所有 N 个 entity 上并行执行(用 entity-aware masking 避免显式循环),输出 H_C ∈ ℝ^(N×C×P×D)

复杂度优势:原始空间 group attention 是 O(M²),原型投射变成 O(M·C),而 C≪M(实验最优 C=68),所以即使物理变量数 M 极大,计算量仍线性可控。这是"把计算瓶颈与物理维度解耦"的直接收益。

3.4 Latent Entity Attention (LEA)

所有表示已对齐到共享的、维度无关的语义空间后,LEA 做全局跨变量交互。把 (entity × prototype) 合并成空间序列维度,套 l 层标准 MHA:

$$H_C' = \text{LayerNorm}(H_C + \text{MHA}(H_C))$$

因为此时所有 entity 在同一原型坐标系里,不同域的结构模式可以自然迁移——这是 Falcon-X 零样本跨数据集泛化的来源。论文 A.3.2 指出,正因为交互发生在"维度无关的语义空间"而非原始物理维度,跨域迁移才是"有原则的结构复用"而非参数共享的副产品。

3.5 Variate Reassembly Router (VRR)

交互完成后,要把全局上下文 H_C' 还原回各变量的物理维度 mᵢ。VRR 用 request-and-dispatch 机制做软路由,三个组件都由线性投射生成:

$$R_{req}^i = \text{Linear}(h_T^i), \quad P_{idx}^i = \text{Linear}(h_C'^{\,i}), \quad S_{ctx}^i = \text{Linear}(h_C'^{\,i})$$

  • Routing Request R_req:来自时序嵌入 h_T,作为 entity 身份标签,携带该变量独有的时间轨迹和物理维度信息
  • Prototype Index P_idx:全局原型库的可寻址映射
  • Source Context S_ctx:精炼后的语义载荷

重建通过 scaled dot-product 软路由:

$$h_V^i = \text{softmax}\left(\frac{R_{req}^i (P_{idx}^i)^\top}{\sqrt{D}}\right) S_{ctx}^i$$

即"用本地特定轨迹去检索统一全局原型",高保真重建变量特定表示 h_V^i ∈ ℝ^(mᵢ×P×D),恢复到 H_V ∈ ℝ^(M×P×D)。同样用 entity-aware masking 并行软路由。

3.6 Gated Residual 融合

考虑到不同数据集的跨变量依赖强度差异巨大,强行统一注入全局上下文会对弱相关数据集引入噪声。因此用门控残差动态融合时序嵌入 H_T 与跨变量表示 H_V

$$\hat{H} = H_T + \mathcal{G}(H_T) \odot H_V$$

G(·) 是 linear + sigmoid, 逐元素乘。强相关系统门打开充分用跨变量依赖,弱相关系统门关闭退化为纯单变量——这保证了 Falcon-X 开启多变量模式不会损害单变量精度(5.3 节实验证实)。

3.7 Forecasting Head

跟随 Chronos-2 / Timer-S1 的概率预测范式,取未来 horizon 对应的嵌入,线性投射到预设分位数集 Q,用分位数损失端到端优化:

$$\mathcal{L}_{pred} = \frac{1}{|\mathcal{Q}|\cdot M\cdot T}\sum_{q}\sum_{i}\sum_{t}\max\left(q(Y_{i,t}-\hat{Y}_{i,t}^{(q)}), (q-1)(Y_{i,t}-\hat{Y}_{i,t}^{(q)})\right)$$

总训练目标 = 预测损失 + 正交损失:L = L_pred + α·L_orth。推理时经 sin 反归一化回物理尺度。

四、训练配置与超参(论文 4.2 节)

配置项
隐藏维度 D 1024
Patch 长度 Lp 16
Time Attention 层数 n 16
Entity Attention 层数 l 16
注意力头数 16 / 层
原型维度 C 6~8(实验最优)
最大输入 token 512(上下文 L=8192)
最大输出 token 30(预测 T=480)
参数量 591M(另有 59M / 253M 缩放档)
预训练步数 100 万 iterations
全局 batch size 384
精度 bf16
硬件 NVIDIA B200-180GB 集群
优化器 AdamW(β1=0.9, β2=0.95, weight decay=0.1)
学习率 warmup 到 6e-5(前 0.1% 步),cosine 衰减到 6e-6
预训练框架 Megatron-LM + 自定义采样流水线

预训练语料混合真实 + 合成数据:真实来自 GIFT-Eval、Chronos、QuitoBench;合成单变量用数据混合 + 随机过程采样,合成多变量通过分组相关单变量并注入显式跨变量依赖(含瞬时和时间滞后交互)。还实现了运行时多变量采样策略,动态平衡每 batch 的变量数以提升 GPU 利用率。

五、实验结果

5.1 主结果

GIFT-Eval 排行榜

Figure 3:Falcon-X 在 GIFT-Eval 排行榜。DeOS = DeOSAlphaTimeGPTPredictor-2025,STRIDE = STRIDE+Chronos-2。

按预测长度分组

Figure 4:GIFT-Eval 上按预测长度分组的 MASE。Falcon-X 在所有 horizon 上都稳定。

  • GIFT-Eval:Falcon-X 取得最佳整体 0.666 MASE / 0.453 CRPS。相比 STRIDE 提升 1.2% MASE,相比 Toto-2.0-FT 提升 1.9% MASE + 2.2% CRPS,相比 Timer-S1 提升 3.9% MASE + 6.6% CRPS。
  • 长 horizon 优势更明显:短程 0.65 MASE(与 Toto-2.0-FT 并列最佳),中程 0.68、长程 0.70 均为最佳。而 Chronos-2 从短程 0.67 退化到长程 0.76,Toto-1.0 和 TabPFN-TS 退化更严重——说明原型路由机制能捕获持久的跨变量动态,缓解 horizon 误差累积。
  • fev-bench:0.652 MASE / 0.490 CRPS,仅次于 Chronos-2 的 0.645 / 0.485,差距仅约 1.1% MASE + 1.0% CRPS。但注意 Falcon-X 只用内生目标序列,不用额外的 past-only/future-known 协变量,而 Chronos-2 用了协变量——所以这个近身差距含金量很高。

5.2 消融实验

消融与推理范式对比

Figure 7:(a) 消融实验。(b) 推理范式对比。

模块消融

  • (i) 去掉 K_neg(只用 K_pos)→ 性能下降最严重,证明建模负亲和度对异构序列交互不可或缺。这是全文最有说服力的实验,直接验证了"差分注意力"的必要性。
  • (ii) 去掉 gated residual → 性能下降,证明门控在弱相关数据集上过滤噪声的作用。
  • (iii) 去掉 timestamp & mask → 对不规则采样和缺失值的鲁棒性下降。

策略消融

  • (i) 去掉变量 shuffle → 显著损害性能,说明随机置换对学"内容驱动而非索引驱动"的关系至关重要。
  • (ii) 固定长度预测替代 flexible horizon → 削弱对未见 horizon 的泛化。
  • (iii) 联合训练 vs 两阶段课程:直接联合训练一致优于"先单变量预训练再多变量微调"的两阶段——说明 Falcon-X 能在单一优化过程里自然统一时序动态和跨变量交互,不需要精心分阶段课程。

5.3 推理范式分析(语义坍塌的铁证)

Figure 7(b) 最有意思的发现:在 GIFT-Eval 上,Chronos-2 开不开启 group attention 性能几乎相同,说明原始空间变量混合几乎没贡献有效关系信息——跨变量交互退化为单变量行为(语义坍塌)。而 Falcon-X 开启多变量模式在多变量任务上一致提升精度,且完全不损害单变量任务精度——证明潜在路由成功提取了全局协同上下文而不破坏个体时序信号。

5.4 关键超参敏感性

敏感性与 scaling

Figure 8:(a) n vs l 层分配。(b) 原型维度 C 敏感性。(c) 参数规模 scaling。

  • 深度分配(n vs l):固定总深度下,给时间建模足够容量是关键,过度跨变量路由反而损害性能。说明鲁棒时序建模是预测的根基,跨变量交互是互补增益。最优是均衡的 16/16。
  • 原型维度 C:C≤2 会有信息瓶颈、语义过压缩;扩大维度增强关系表达力;峰值在 C=6 和 C=8,在"捕获多样动态"和"避免冗余噪声"间取得平衡。
  • Scaling:从 59M(l=n=8,D=512)→ 253M(l=n=12,D=768)→ 591M(l=n=16,D=1024),MASE/CRPS 严格可预测地改善,符合神经 scaling law,证明解耦架构有良好可扩展性。

5.5 Case Study

ETT1/15T 案例研究

Figure 9:ETT1/15T 数据集案例。单变量推理模式下预测逐渐偏离真值;Falcon-X 多变量推理利用跨变量信号校准轨迹。

ETT1/15T 上对比多变量 vs 单变量推理:无跨变量交互时,channel-independent 在复杂时序漂移下逐渐偏离真值;Falcon-X 用统一原型空间聚合跨变量互补信号,产生更准轨迹。论文还展示了它能同时准确建模正相关(同步趋势)和负相关(对冲动态),验证了 UPDA 对双依赖的建模能力。

六、代码-论文模块映射

Falcon-X 源码在仓库 falconx/src/falcontst/,目前公开的是 client.py(API 调用层)和 __init__.py,完整的模型实现(modeling 文件)尚未随仓库公开(与 1.0 的 falcon1/models/ 不同)。从 API 层可确认的接口事实:

# falconx/src/falcontst/client.py 的对外契约
result = client.quantile_predict(
    context=context,           # (B, L) 支持 np.nan 缺失
    prediction_length=H,       # 预测 horizon
    model_name="Falcon-X",
    input_mask=input_mask,     # 1=观测, 0=缺失 → 对应论文的 M
    group_ids=group_ids,       # 非递减序列,同 ID 当作同一多变量组 → 对应论文的 entity 划分
    is_multivariate=True,      # 全部当一个多变量组
)
# 输出: result['prob_prediction'] shape (B, Q, H), Q=21 个分位数

API 契约与论文的对应关系:

API 参数 论文符号 含义
context X 原始输入序列
input_mask M 观测 mask(1=观测,0=缺失),归一化只从观测值算 μ/σ
group_ids entity 划分 同 group 的 series 作为同一 entity 的多通道,对应 mᵢ
is_multivariate True 时全部当一组,忽略 group_ids
prob_prediction Ŷ^(q) 21 分位数 [0.01,...,0.99],中位 index=10 作点预测

group_ids 必须是非递减序列这一点,对应论文里 entity-aware masking 的并行实现——同 entity 的变量在张量上连续排布,才能用 mask 并行投射到原型空间而不用显式循环。评测脚本在 falconx/eval/falcon-x.ipynb,跑完 GIFT-Eval 生成 all_results.csv(per-dataset MASE/CRPS)和 agg_results.csv(几何均值聚合)。

七、技术洞察与启示

  1. "解耦"是异构建模的正解:Falcon-X 把时间建模和跨变量建模彻底分开(先 n 层纯时间 attention 再做跨变量),避免了交错混合的语义纠缠。这呼应了 A.2 节的论断——"一个变量的微弱时序信号会被异构邻居的噪声过早污染"。

  2. 原型空间是对"异构维度"的降维打击:把 M 维物理空间压到固定 C 维原型空间(C≪M),既解决了语义对齐(不同物理量有了共同坐标),又把计算复杂度从 O(M²) 降到 O(M·C),还顺带做了结构去噪(强制通过固定原型过滤局部噪声)。这三重收益是单一机制带来的。

  3. 差分注意力是对"非负 softmax"的根本修正:标准注意力只能表达"有多相关",A_pos - λ·A_neg 让模型能表达"协同还是对冲"。消融实验里去掉 K_neg 性能下降最严重,是这个论点的硬证据。这是当前所有其他 TSFM 都没做的(Table 1 唯一打勾)。

  4. 门控残差是"多变量不伤单变量"的关键H_T + G(H_T)⊙H_V 让弱相关系统自动退化为单变量,强相关系统才打开跨变量门。这解释了 5.3 节"Falcon-X 开多变量模式不损害单变量精度"的实验事实。

  5. 训练制度 > 架构堆叠:联合训练优于两阶段课程、变量 shuffle 必不可少、flexible horizon 泛化更强——这些策略消融说明,Falcon-X 的成功不只是架构创新,数据采样制度同样关键,这与 Sundial 的 TimeBench、TimesFM 的合成数据是同一信号。

参考来源