---
title: "Falcon-X 技术精读：从原型空间到差分注意力"
description: "基于 arXiv:2605.27286 论文全文的深度精读：架构总路线图、逐模块公式与代码映射、训练配置、消融实验，论文原图直接嵌入"
pubDate: 2026-08-05
tags: ["falcon-x","time-series","foundation-model","diff-attention","ant-international"]
category: "AI"
lang: "zh"
math: false
---
> 本文是对蚂蚁国际（Ant International）时序基座模型 Falcon-X 论文（[arXiv:2605.27286](https://arxiv.org/abs/2605.27286)）的深度精读，所有架构细节、公式、超参与论文图均来自论文原文与官方仓库 [ant-intl/Falcon-TST](https://github.com/ant-intl/Falcon-TST) 源码。Falcon-X 是 Falcon 家族（1.0 / 2.0 / X）中唯一有正式论文的成员，定位为 591M 参数的原生多变量异构建模基座模型。

## 一、技术架构总路线图

Falcon-X 的整体设计哲学是**"解耦"**：把"物理变量空间"和"潜在交互空间"彻底分开。物理变量先各自独立做时间建模，再统一映射到一个固定维度的原型空间做跨变量交互，最后路由还原回各变量。整套流水线如下：

![Falcon-X 整体架构](https://arxiv.org/html/2605.27286v1/x2.png)

*Figure 2：Falcon-X 整体架构。原始输入经归一化、分词后，由 Time Attention 提取各变量独立的时序特征；Unified Prototype Diff-Attention (UPDA) 将这些特征投射到共享原型空间；Latent Entity Attention (LEA) 在该空间内捕获全局跨变量依赖；Variate Reassembly Router (VRR) 动态重建变量特定表示；最后融合时序上下文，经分位数头输出概率预测。*

四阶段流水线：

| 阶段 | 模块 | 输入 → 输出 | 作用 |
|---|---|---|---|
| ① 预处理 | Normalization + Tokenization | `X ∈ ℝ^(M×(L+T))` → `H ∈ ℝ^(M×P×D)` | arcsin 归一化 + 残差 patch embedding |
| ② 时间建模 | Time Attention（n 层）| `H` → `H_T ∈ ℝ^(M×P×D)` | 各变量**独立**沿时间维 self-attention |
| ③ 跨变量交互 | UPDA + LEA（l 层）| `H_T` → `H_C' ∈ ℝ^(N×C×P×D)` | 投射原型空间 + 全局跨变量注意力 |
| ④ 还原预测 | VRR + Gated Residual + Quantile Head | `H_C'` → `Ŷ ∈ ℝ^(M×T)` | 路由回变量维 + 门控融合 + 分位数输出 |

其中 `M=Σmᵢ` 是所有 entity 的变量总数，`mᵢ` 各异（异构的根源），`N` 是 entity 数，`P=(L+T)/Lp` 是 patch 数，`D` 隐藏维度，`C` 原型维度（`C≪M`）。

**核心数据流的关键形状变化**（理解全文的钥匙）：

```
原始:   M × (L+T)          # M 个物理变量，每个长度 L+T，维度参差不齐
   ↓ Normalization + Tokenization
Token:  M × P × D           # 每个 patch 映射到 D 维
   ↓ Time Attention (n 层, 沿 P 维独立)
H_T:    M × P × D           # 各变量时序特征已稳定
   ↓ UPDA (投射到原型空间)
H_C:    N × C × P × D       # ★ 维度从 M 压到 C，与物理变量数解耦
   ↓ LEA (l 层, 沿 N×C 维)
H_C':   N × C × P × D       # 全局跨变量交互完成
   ↓ VRR (路由回变量维)
H_V:    M × P × D           # 维度恢复回 M
   ↓ Gated Residual + Quantile Head
Ŷ:      M × T               # 概率预测
```

整条流水线的本质是**两次"压缩-还原"**：`M → C`（UPDA 压到原型空间）和 `C → M`（VRR 还原），中间的交互计算量与物理变量数 M 无关，只与原型数 C 相关——这就是 Falcon-X 能处理"极端高维异构变量"的根因。

## 二、要解决的两个根本问题

论文开篇就指出，现有的多变量 TSFM（Moirai-1.0 flatten、Toto 因子化时空注意力、Chronos-2 group attention）都直接在**原始变量空间**做交互，有两个根本缺陷：

![多变量建模范式对比](https://arxiv.org/html/2605.27286v1/x1.png)

*Figure 1：多变量建模范式对比。(a) 高度异构的输入。(b) Group attention 对完全不同的输入产生几乎相同的注意力图，暴露原始变量空间的语义坍塌和过平滑。(c-d) Falcon-X 投射到潜在原型空间后，注意力图高度可区分，准确捕获底层动态。*

**问题❶ 语义对齐缺失**：不同数据集共享同一 Transformer backbone，但它们的变量对应完全不同的物理量（温度 vs 汇率 vs 客流），量纲、语义都不同。在原始空间混合，模型只能把这种异构性隐式吸收进参数里，跨域迁移成了"参数共享的副产品"而非有原则的结构复用。更糟的是，高维系统中只有少数变量强相关，其余是弱相关或噪声，原始空间稠密注意力会把有意义信号稀释掉（Figure 1(b) 的语义坍塌就是证据）。

**问题❷ 关系表达力不足**：现实系统中跨变量依赖既有**协同（synergistic，正相关）**也有**拮抗（antagonistic，负相关）**。但标准 attention 的 softmax 输出非负值 `[0,1]`，只能表达"有多聚合/相似"，**无法表达对冲动态**。

Falcon-X 对这两个问题的回应是：用一个固定 `C` 维的可学习原型空间做语义对齐坐标，用差分注意力表达正负亲和度。下表是它与所有主流 TSFM 的能力对比，注意 Falcon-X 是唯一在"Signed Dependence（带符号依赖）"和"Heterogeneous Unification（异构统一）"两列都打勾的：

| 能力 | Falcon-X | Moirai 2.0 | TimesFM-2.5 | Chronos-2 | Timer-S1 | Toto | Sundial | Moirai 1.0 | TabPFN-TS |
|---|---|---|---|---|---|---|---|---|---|
| Univariate | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Multivariate | ✓ | ✗ | ✗ | ✓ | ✗ | ✓ | ✗ | ✓ | ✗ |
| Cross Learning | ✓ | ✗ | ✗ | ✓ | ✗ | ✗ | ✗ | ✗ | ✗ |
| **Signed Dependence** | **✓** | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ |
| **Heterogeneous Unification** | **Prototype Routing** | ✗ | ✗ | Group Mixing | ✗ | Fixed | ✗ | Concat. | ✗ |

*Table 1：Cross Learning = 跨数据集迁移通用跨变量交互模式；Signed Dependence = 同时计算正负亲和度；Heterogeneous Unification = 把不同维度的物理变量投射到维度无关的潜在空间。*

## 三、逐模块深度解析（公式 + 代码映射）

### 3.1 Normalization & Tokenization

**归一化**采用 arcsin 变换而非常见的 RevIN 线性标准化：

$$\hat{X} = \arcsin\left(\frac{X - \mu}{\sigma}\right)$$

实例均值 μ、标准差 σ **只从观测值计算**，缺失位置保留（不补零、不截断），交给下游 mask 显式建模。arcsin 的选择是为了把数值压到 `[-π/2, π/2]` 有界区间，配合推理时的 `sin` 反归一化 `Ỹ=σ·sin(Ŷ)+μ`，对极端值更鲁棒。

**Tokenization** 把输入与相对时间戳 `T`、观测 mask `M` 拼接后分 patch。时间戳锚定在第一个预测步为 0：

$$\mathcal{T} = \{-\frac{L}{L+T}, \dots, 0, \dots, \frac{T-1}{L+T}\}$$

这让它能泛化到异构采样频率。patch 长度 `Lp`，patch 数 `P=(L+T)/Lp`，经 **ResPatchEmbed**（残差 patch embedding，融合线性与非线性语义）映射到隐藏维 D：

$$H = \text{ResPatchEmbed}(\text{Concat}(\hat{X}, \mathcal{T}, \mathcal{M})) \in \mathbb{R}^{M \times P \times D}$$

### 3.2 Time Attention（n 层）

这是**纯时间维度的 self-attention，对每个变量独立施加**。论文 A.2 节强调一个关键设计选择：**时间建模与跨变量建模刻意解耦**——不像很多多变量模型那样交错混合时间和空间，那会导致语义纠缠（一个变量的微弱时序信号被异构邻居的噪声过早污染）。Falcon-X 先堆 n 层 Time Attention，把每个变量的时序演化状态充分提炼稳定，再进入跨变量阶段。

每层就是标准 post-LN 残差结构：

$$H^{(i)} = \text{LayerNorm}(H^{(i-1)} + \text{MHA}(H^{(i-1)}))$$

输出 `H_T ∈ ℝ^(M×P×D)`，封装了每个变量的完整时序动态。**注意：这一步 M 个变量之间完全没有交互**，是干净的逐变量特征。

> **与 Falcon-1.0 的对照**：Falcon-1.0 的 `FalconTSTExpert`（`falcon1/models/modeling_falcon_tst.py`）每个专家内部也是 TransformerLayer 堆叠 + RoPE + RMSNorm，同样是先做时间维 attention。差异在于 1.0 用 MoE 把不同 patch 尺度的专家路由分流，而 Falcon-X 取消了 MoE、改用统一的 `Lp=16` patch，把"多尺度"能力后移到原型空间机制里。

### 3.3 Unified Prototype Diff-Attention (UPDA) —— 核心创新

这是全文最关键的模块。它要解决 `H_T`（M 维物理空间）到 `H_C`（C 维原型空间）的投射，并用差分机制表达正负亲和度。

定义两组**全局共享的可学习原型键**：`K_pos, K_neg ∈ ℝ^(C×D)`，分别代表协同原型和拮抗原型。对第 i 个 entity，由其时序嵌入 `h_T^i ∈ ℝ^(mᵢ×P×D)` 经线性投射生成 query `Q^i` 和 value `V^i`，计算双依赖注意力图：

$$A_{pos}^i = \text{softmax}\left(\frac{Q^i K_{pos}^\top}{\sqrt{D}}\right), \quad A_{neg}^i = \text{softmax}\left(\frac{Q^i K_{neg}^\top}{\sqrt{D}}\right)$$

然后**差分聚合**得到统一表示：

$$h_C^i = [A_{pos}^i - \lambda \cdot A_{neg}^i]^\top V^i$$

`λ` 是可学习缩放因子。`A_pos - λ·A_neg` 这一步是精髓——因为 softmax 恒非负，单个 `A_pos` 或 `A_neg` 只能量化"与协同/拮抗原型的相似度"，但**两者相减后可以产生正负值**，从而显式表达"这个变量对某原型是协同还是对冲"。这是对标准注意力"只能聚合不能对冲"的根本修正，灵感来自 Differential Attention（Ye et al., 2025），但原论文用于抑制噪声，Falcon-X 重新用于捕获双依赖动态。

为强制正负原型语义可分，加**正交损失**约束两者不相似：

$$\mathcal{L}_{orth} = \text{Sim}(K_{pos}, K_{neg})$$

其中 `Sim` 是归一化余弦相似度。整个投射在所有 N 个 entity 上**并行**执行（用 entity-aware masking 避免显式循环），输出 `H_C ∈ ℝ^(N×C×P×D)`。

> **复杂度优势**：原始空间 group attention 是 `O(M²)`，原型投射变成 `O(M·C)`，而 `C≪M`（实验最优 `C=6` 或 `8`），所以即使物理变量数 M 极大，计算量仍线性可控。这是"把计算瓶颈与物理维度解耦"的直接收益。

### 3.4 Latent Entity Attention (LEA)

所有表示已对齐到共享的、维度无关的语义空间后，LEA 做**全局跨变量交互**。把 `(entity × prototype)` 合并成空间序列维度，套 l 层标准 MHA：

$$H_C' = \text{LayerNorm}(H_C + \text{MHA}(H_C))$$

因为此时所有 entity 在同一原型坐标系里，不同域的结构模式可以自然迁移——这是 Falcon-X 零样本跨数据集泛化的来源。论文 A.3.2 指出，正因为交互发生在"维度无关的语义空间"而非原始物理维度，跨域迁移才是"有原则的结构复用"而非参数共享的副产品。

### 3.5 Variate Reassembly Router (VRR)

交互完成后，要把全局上下文 `H_C'` 还原回各变量的物理维度 `mᵢ`。VRR 用 **request-and-dispatch** 机制做软路由，三个组件都由线性投射生成：

$$R_{req}^i = \text{Linear}(h_T^i), \quad P_{idx}^i = \text{Linear}(h_C'^{\,i}), \quad S_{ctx}^i = \text{Linear}(h_C'^{\,i})$$

- **Routing Request `R_req`**：来自时序嵌入 `h_T`，作为 entity 身份标签，携带该变量独有的时间轨迹和物理维度信息
- **Prototype Index `P_idx`**：全局原型库的可寻址映射
- **Source Context `S_ctx`**：精炼后的语义载荷

重建通过 scaled dot-product 软路由：

$$h_V^i = \text{softmax}\left(\frac{R_{req}^i (P_{idx}^i)^\top}{\sqrt{D}}\right) S_{ctx}^i$$

即"用本地特定轨迹去检索统一全局原型"，高保真重建变量特定表示 `h_V^i ∈ ℝ^(mᵢ×P×D)`，恢复到 `H_V ∈ ℝ^(M×P×D)`。同样用 entity-aware masking 并行软路由。

### 3.6 Gated Residual 融合

考虑到不同数据集的跨变量依赖强度差异巨大，强行统一注入全局上下文会对弱相关数据集引入噪声。因此用**门控残差**动态融合时序嵌入 `H_T` 与跨变量表示 `H_V`：

$$\hat{H} = H_T + \mathcal{G}(H_T) \odot H_V$$

`G(·)` 是 linear + sigmoid，`⊙` 逐元素乘。强相关系统门打开充分用跨变量依赖，弱相关系统门关闭退化为纯单变量——这保证了 Falcon-X **开启多变量模式不会损害单变量精度**（5.3 节实验证实）。

### 3.7 Forecasting Head

跟随 Chronos-2 / Timer-S1 的概率预测范式，取未来 horizon 对应的嵌入，线性投射到预设分位数集 `Q`，用分位数损失端到端优化：

$$\mathcal{L}_{pred} = \frac{1}{|\mathcal{Q}|\cdot M\cdot T}\sum_{q}\sum_{i}\sum_{t}\max\left(q(Y_{i,t}-\hat{Y}_{i,t}^{(q)}), (q-1)(Y_{i,t}-\hat{Y}_{i,t}^{(q)})\right)$$

总训练目标 = 预测损失 + 正交损失：`L = L_pred + α·L_orth`。推理时经 sin 反归一化回物理尺度。

## 四、训练配置与超参（论文 4.2 节）

| 配置项 | 值 |
|---|---|
| 隐藏维度 D | 1024 |
| Patch 长度 Lp | 16 |
| Time Attention 层数 n | 16 |
| Entity Attention 层数 l | 16 |
| 注意力头数 | 16 / 层 |
| 原型维度 C | 6~8（实验最优） |
| 最大输入 token | 512（上下文 L=8192） |
| 最大输出 token | 30（预测 T=480） |
| 参数量 | 591M（另有 59M / 253M 缩放档） |
| 预训练步数 | 100 万 iterations |
| 全局 batch size | 384 |
| 精度 | bf16 |
| 硬件 | NVIDIA B200-180GB 集群 |
| 优化器 | AdamW（β1=0.9, β2=0.95, weight decay=0.1） |
| 学习率 | warmup 到 6e-5（前 0.1% 步），cosine 衰减到 6e-6 |
| 预训练框架 | Megatron-LM + 自定义采样流水线 |

预训练语料混合真实 + 合成数据：真实来自 GIFT-Eval、Chronos、QuitoBench；合成单变量用数据混合 + 随机过程采样，合成多变量通过分组相关单变量并注入显式跨变量依赖（含瞬时和时间滞后交互）。还实现了运行时多变量采样策略，动态平衡每 batch 的变量数以提升 GPU 利用率。

## 五、实验结果

### 5.1 主结果

![GIFT-Eval 排行榜](https://arxiv.org/html/2605.27286v1/x3.png)

*Figure 3：Falcon-X 在 GIFT-Eval 排行榜。DeOS = DeOSAlphaTimeGPTPredictor-2025，STRIDE = STRIDE+Chronos-2。*

![按预测长度分组](https://arxiv.org/html/2605.27286v1/x4.png)

*Figure 4：GIFT-Eval 上按预测长度分组的 MASE。Falcon-X 在所有 horizon 上都稳定。*

- **GIFT-Eval**：Falcon-X 取得最佳整体 **0.666 MASE / 0.453 CRPS**。相比 STRIDE 提升 1.2% MASE，相比 Toto-2.0-FT 提升 1.9% MASE + 2.2% CRPS，相比 Timer-S1 提升 3.9% MASE + 6.6% CRPS。
- **长 horizon 优势更明显**：短程 0.65 MASE（与 Toto-2.0-FT 并列最佳），中程 0.68、长程 0.70 均为最佳。而 Chronos-2 从短程 0.67 退化到长程 0.76，Toto-1.0 和 TabPFN-TS 退化更严重——说明原型路由机制能捕获持久的跨变量动态，缓解 horizon 误差累积。
- **fev-bench**：0.652 MASE / 0.490 CRPS，仅次于 Chronos-2 的 0.645 / 0.485，差距仅约 1.1% MASE + 1.0% CRPS。但注意 Falcon-X **只用内生目标序列，不用额外的 past-only/future-known 协变量**，而 Chronos-2 用了协变量——所以这个近身差距含金量很高。

### 5.2 消融实验

![消融与推理范式对比](https://arxiv.org/html/2605.27286v1/x7.png)

*Figure 7：(a) 消融实验。(b) 推理范式对比。*

**模块消融**：
- (i) **去掉 K_neg（只用 K_pos）→ 性能下降最严重**，证明建模负亲和度对异构序列交互不可或缺。这是全文最有说服力的实验，直接验证了"差分注意力"的必要性。
- (ii) 去掉 gated residual → 性能下降，证明门控在弱相关数据集上过滤噪声的作用。
- (iii) 去掉 timestamp & mask → 对不规则采样和缺失值的鲁棒性下降。

**策略消融**：
- (i) 去掉变量 shuffle → 显著损害性能，说明随机置换对学"内容驱动而非索引驱动"的关系至关重要。
- (ii) 固定长度预测替代 flexible horizon → 削弱对未见 horizon 的泛化。
- (iii) **联合训练 vs 两阶段课程**：直接联合训练一致优于"先单变量预训练再多变量微调"的两阶段——说明 Falcon-X 能在单一优化过程里自然统一时序动态和跨变量交互，不需要精心分阶段课程。

### 5.3 推理范式分析（语义坍塌的铁证）

Figure 7(b) 最有意思的发现：在 GIFT-Eval 上，**Chronos-2 开不开启 group attention 性能几乎相同**，说明原始空间变量混合几乎没贡献有效关系信息——跨变量交互退化为单变量行为（语义坍塌）。而 Falcon-X 开启多变量模式在多变量任务上一致提升精度，且**完全不损害单变量任务精度**——证明潜在路由成功提取了全局协同上下文而不破坏个体时序信号。

### 5.4 关键超参敏感性

![敏感性与 scaling](https://arxiv.org/html/2605.27286v1/x8.png)

*Figure 8：(a) n vs l 层分配。(b) 原型维度 C 敏感性。(c) 参数规模 scaling。*

- **深度分配（n vs l）**：固定总深度下，给时间建模足够容量是关键，过度跨变量路由反而损害性能。说明**鲁棒时序建模是预测的根基，跨变量交互是互补增益**。最优是均衡的 16/16。
- **原型维度 C**：C≤2 会有信息瓶颈、语义过压缩；扩大维度增强关系表达力；峰值在 **C=6 和 C=8**，在"捕获多样动态"和"避免冗余噪声"间取得平衡。
- **Scaling**：从 59M（l=n=8,D=512）→ 253M（l=n=12,D=768）→ 591M（l=n=16,D=1024），MASE/CRPS 严格可预测地改善，符合神经 scaling law，证明解耦架构有良好可扩展性。

### 5.5 Case Study

![ETT1/15T 案例研究](https://arxiv.org/html/2605.27286v1/x9.png)

*Figure 9：ETT1/15T 数据集案例。单变量推理模式下预测逐渐偏离真值；Falcon-X 多变量推理利用跨变量信号校准轨迹。*

ETT1/15T 上对比多变量 vs 单变量推理：无跨变量交互时，channel-independent 在复杂时序漂移下逐渐偏离真值；Falcon-X 用统一原型空间聚合跨变量互补信号，产生更准轨迹。论文还展示了它能同时准确建模正相关（同步趋势）和负相关（对冲动态），验证了 UPDA 对双依赖的建模能力。

## 六、代码-论文模块映射

Falcon-X 源码在仓库 `falconx/src/falcontst/`，目前公开的是 `client.py`（API 调用层）和 `__init__.py`，完整的模型实现（modeling 文件）尚未随仓库公开（与 1.0 的 `falcon1/models/` 不同）。从 API 层可确认的接口事实：

```python
# falconx/src/falcontst/client.py 的对外契约
result = client.quantile_predict(
    context=context,           # (B, L) 支持 np.nan 缺失
    prediction_length=H,       # 预测 horizon
    model_name="Falcon-X",
    input_mask=input_mask,     # 1=观测, 0=缺失 → 对应论文的 M
    group_ids=group_ids,       # 非递减序列，同 ID 当作同一多变量组 → 对应论文的 entity 划分
    is_multivariate=True,      # 全部当一个多变量组
)
# 输出: result['prob_prediction'] shape (B, Q, H), Q=21 个分位数
```

API 契约与论文的对应关系：

| API 参数 | 论文符号 | 含义 |
|---|---|---|
| `context` | `X` | 原始输入序列 |
| `input_mask` | `M` | 观测 mask（1=观测,0=缺失），归一化只从观测值算 μ/σ |
| `group_ids` | entity 划分 | 同 group 的 series 作为同一 entity 的多通道，对应 `mᵢ` |
| `is_multivariate` | — | True 时全部当一组，忽略 group_ids |
| `prob_prediction` | `Ŷ^(q)` | 21 分位数 `[0.01,...,0.99]`，中位 index=10 作点预测 |

`group_ids` 必须是**非递减序列**这一点，对应论文里 entity-aware masking 的并行实现——同 entity 的变量在张量上连续排布，才能用 mask 并行投射到原型空间而不用显式循环。评测脚本在 `falconx/eval/falcon-x.ipynb`，跑完 GIFT-Eval 生成 `all_results.csv`（per-dataset MASE/CRPS）和 `agg_results.csv`（几何均值聚合）。

## 七、技术洞察与启示

1. **"解耦"是异构建模的正解**：Falcon-X 把时间建模和跨变量建模彻底分开（先 n 层纯时间 attention 再做跨变量），避免了交错混合的语义纠缠。这呼应了 A.2 节的论断——"一个变量的微弱时序信号会被异构邻居的噪声过早污染"。

2. **原型空间是对"异构维度"的降维打击**：把 `M` 维物理空间压到固定 `C` 维原型空间（`C≪M`），既解决了语义对齐（不同物理量有了共同坐标），又把计算复杂度从 `O(M²)` 降到 `O(M·C)`，还顺带做了结构去噪（强制通过固定原型过滤局部噪声）。这三重收益是单一机制带来的。

3. **差分注意力是对"非负 softmax"的根本修正**：标准注意力只能表达"有多相关"，`A_pos - λ·A_neg` 让模型能表达"协同还是对冲"。消融实验里去掉 K_neg 性能下降最严重，是这个论点的硬证据。这是当前所有其他 TSFM 都没做的（Table 1 唯一打勾）。

4. **门控残差是"多变量不伤单变量"的关键**：`H_T + G(H_T)⊙H_V` 让弱相关系统自动退化为单变量，强相关系统才打开跨变量门。这解释了 5.3 节"Falcon-X 开多变量模式不损害单变量精度"的实验事实。

5. **训练制度 > 架构堆叠**：联合训练优于两阶段课程、变量 shuffle 必不可少、flexible horizon 泛化更强——这些策略消融说明，Falcon-X 的成功不只是架构创新，数据采样制度同样关键，这与 Sundial 的 TimeBench、TimesFM 的合成数据是同一信号。

## 参考来源

- [Falcon-X 论文 arXiv:2605.27286](https://arxiv.org/abs/2605.27286) — Yiding Liu*, Yifan Hu*, Hongjie Xia*, Peiyuan Liu*, Hongzhou Chen, Xilin Dai, Zewei Dong†, Jiang-Ming Yang（*同等贡献，†通讯作者）
- [ant-intl/Falcon-TST GitHub 仓库](https://github.com/ant-intl/Falcon-TST) — `falconx/` 子目录含 client.py 与 eval 脚本
- [GIFT-Eval 基准](https://github.com/SalesforceAIResearch/gift-eval) — 评测所用主基准
- [fev-bench 基准](https://arxiv.org/abs/2410.10393) — 多变量评测基准
- 论文图均来自 arXiv HTML 版本：[Figure 1-9](https://arxiv.org/html/2605.27286v1)