P11 Tabular Foundation Models
NUMERICAL TOKENIZATION · INPUT GEOMETRY · EVIDENCE BEFORE CLAIM

一列数,
不只是一条直线

PLE 与逐特征周期嵌入带来的真正变化,不只是“把一维升到高维”,而是重新定义网络眼中的数值几何。这足以显著缩小 MLP 与 GBDT 的差距——但它是强实证发现,不是已经完成的数学定理。

WeHub public owner-review technical article · noindex · source-grounded synthesis · not a formal release

01 · THE CLAIM, CALIBRATED

这项工作很重要;准确地说,重要在这里

Gorishniy、Rubachev 与 Babenko 把一个常被当成预处理细节的问题提升为模型设计对象:每个数值特征在进入 backbone 前,应当先处于什么坐标系?

Strong evidence数值表示足以改变模型排名

在刻意偏向 GBDT 的 11 个数据集上,PLE 与 periodic-based modules 普遍改善 MLP、ResNet 与 Transformer;普通 MLP 也能进入强模型区间。

Not a theorem论文没有证明“核心元凶”

作者在 checklist 明确说明论文不含理论结果,并在结论中把“这些模块为何从根本上帮助优化”留作开放问题。

Real research openingValueEncoder 成为一等问题

真正被打开的方向不是宣布 PLE 或 Fourier 永远胜出,而是研究数值 token 的局部性、多尺度、共享方式与跨表适应。

因此,本文不用“无可辩驳地证明”来放大它。

更强也更准确的说法是:这是一组受控、跨 backbone 的强实证,揭示数值特征所处的输入几何,是足以显著缩小 DL–GBDT 差距的高杠杆归纳偏置之一。

02 · ONE NUMBER, THREE GEOMETRIES

“升到高维”不等于获得高维几何

想象 \(x\) 从小到大连续移动。重要的不是输出向量有多少维,而是它在 embedding space 中走出怎样的轨迹。

small xlarge x
Affine scalar token

高维中的一条直线

\(z(x)=b+xw\)。即使 \(z\in\mathbb R^d\),所有可能的 token 仍落在同一条仿射直线上。

bin 1bin T
PLE + Linear

每个区间可以换方向

PLE 保留顺序与区间内位置;线性读出后,数值 token 沿带结点的折线移动,而不是离散跳到 one-hot 点。

phase 0multi-scale
Periodic / PLR

一组可学习的相位坐标

多个 sin/cos 通道把距离改写为多尺度相位关系;频率可训练,初始化尺度需要验证集选择,并不保证都是高频。

The affine-line bottleneck
\[z(x)=b+xw,\qquad A z(x)+c=(Aw)x+(Ab+c).\]

只要 tokenizer 与 backbone 第一层之间没有非线性,两个线性映射可以合并。线性升维可能改变参数化与优化路径,但不会凭空制造阈值、局部区间或新的频率基。

03 · INTERACTIVE REPRESENTATION LAB

拖动同一个 \(x\),观察三种表示怎样变化

下面是教学用简化示意,不是论文模型的精确前向复现。它只让表示几何变得可见。

一个输入,三种坐标

PLE 使用 5 个等宽 bins;Periodic 使用频率 \((1,2,4,7)\) 的 sin/cos 示意。

RAW / AFFINE

只知道全局位置

数值只在一条直线上前进;局部边界必须由后续网络自己发现。

z(x) = b + 0.37w
PIECEWISE LINEAR

知道越过了哪些区间

已完成区间为 1,当前区间保留局部进度,其后为 0。

PLE(x) = [1.00, 0.85, 0, 0, 0]
PERIODIC

同时拥有多尺度相位

不同频率对同一个 \(x\) 给出不同坐标,后续层可以组合快速与缓慢变化。

[sin/cos values]
04 · PIECEWISE LINEAR ENCODING

PLE 不是离散化,而是给数轴铺设局部坐标

给定分点 \(b_0<b_1<\cdots<b_T\),如果 \(x\in[b_{s-1},b_s)\),PLE 的形状大致是 \([1,\ldots,1,\alpha,0,\ldots,0]\)。

Piecewise linear encoding
\[e_t(x)=\begin{cases}0,&x<b_{t-1},\\[3pt]1,&x\ge b_t,\\[3pt]\dfrac{x-b_{t-1}}{b_t-b_{t-1}},&b_{t-1}\le x<b_t,\end{cases}\qquad \operatorname{PLE}(x)=[e_1(x),\ldots,e_T(x)].\]\[f(x)=v_0+\sum_{t=1}^{T}e_t(x)v_t.\]

在训练范围内,它保留 \(x\) 已越过的区间、当前所在区间及区间内进度。后接 Linear 时,各 bin 的向量 \(v_t\) 让 token 轨迹在结点处改变方向。

Quantile PLE

用训练特征的经验分位数放置边界,不读取标签。它让不同 bins 获得相近样本量,并降低对原始尺度与 preprocessing 的敏感度。

Target-aware PLE

用当前任务的标签训练单特征决策树,再把叶区间当作 bins。它更接近树的阈值逻辑,但必须只在训练集拟合,也不能直接充当 zero-shot 跨表 tokenizer。

05 · WHAT IT SHARES WITH TREES

它借来的是局部化,不是整棵树

GBDT 天然围绕阈值组织计算:一次 split 只关心 \(x<\tau\) 是否成立,多个 splits 把数轴切成局部区域,boosting 再逐步叠加修正。这使不规则、局部、近似阶梯状的响应成为树模型的舒适区。

PLE 把区间与局部进度提前放进输入;periodic embedding 提供多尺度变化方向。二者都减轻了 backbone 从原始标量中重新发明局部结构的负担。

但每个数值特征仍在混合前独立编码。像“收入超过阈值且年龄处于某区间”这样的跨特征条件关系,仍需要后续 MLP、Transformer 或其他交互模块学习。

06 · THE SPECTRAL-BIAS BRIDGE

“越过谱偏差”是一条有根据的解释桥,不是这篇论文的定理

需要把三层证据分开,才能既保留数学直觉,也不把相邻理论错写成表格任务的证明。

Layer 1 · General phenomenon神经网络的频率偏好

Rahaman 等人用 Fourier analysis 研究网络更快学习低频模式的现象。它解释优化偏好,不直接比较 GBDT。

Layer 2 · NTK resultFourier mapping 改变有效核

Tancik 等人在低维 coordinate regression / NTK 设定中说明 Fourier mapping 可把有效核变成带宽可调的 stationary kernel,从而改善高频学习。

Layer 3 · Tabular evidenceGorishniy 提供迁移与实验

他们逐特征使用可学习 periodic coefficients,并在表格 benchmark 上验证收益;论文没有给出“谱偏差导致 DL 输给 GBDT”的表格定理。

还有一个很容易漏掉的负结果。

补充实验中,直接照搬原始 fixed Fourier features、先混合多个特征的做法甚至不如 vanilla MLP。逐特征独立编码、可学习频率和验证集选择都不是无关细节。

Per-feature periodic embedding
\[\gamma_i(x)=\operatorname{concat}_{r=1}^{k}\left[\sin(2\pi c_{ir}x),\ \cos(2\pi c_{ir}x)\right],\qquad c_{ir}\sim\mathcal N(0,\sigma^2),\]\[\operatorname{PLR}_i(x)=\operatorname{ReLU}\!\left(W_i\gamma_i(x)+b_i\right).\]

\(c_{ir}\) 在 Gorishniy 等人的方案中参与训练;\(k\) 与初始化尺度 \(\sigma\) 都要调优。Periodic 不等于“强制高频”,过大的频率尺度也可能带来噪声敏感、混叠与过拟合。

07 · WHAT THE EXPERIMENTS SAY

只换数值表示,vanilla MLP 就进入了强模型区间

论文使用 11 个中大型公开数据集,样本量约从 9,900 到 120 万,并明确说明 benchmark 刻意偏向 GBDT-friendly tasks。

Experimental frame

这组比较有力量,也有边界

MLP · ResNet · Transformer收益跨三类 backbone 出现,不只是 attention 的副产品。
15 random seeds单模型表报告多随机种子;最终大表比较 model ensembles。
Accuracy / RMSE only最终排名不计训练、推理、参数量与部署效率。
GBDT-friendly selection这有助于检验能否缩小差距,但不能外推成所有表格任务的平均效果。
论文 Table 6 的 ensemble 平均排名摘录;越低越好。作者提醒 average rank 不适合做细微结论。
模型数值表示Avg. rank
Vanilla MLPraw scalar8.5 ± 2.6
MLP-Q-LRQuantile PLE + Linear + ReLU5.1 ± 1.9
MLP-T-LRTarget-aware PLE + Linear + ReLU5.1 ± 1.7
MLP-PLRPeriodic + Linear + ReLU3.0 ± 2.4
CatBoosttree splits3.6 ± 2.9
XGBoosttree splits4.6 ± 2.7

可以说

  • 数值 embedding 是一个重要、长期被低估的设计自由度;
  • 合适的表示在这些 tasks 上显著缩小 DL 与 GBDT 的差距;
  • MLP-like backbone 配合 embedding 可与 attention models 相当;
  • 不同表示改变的不只是维数,还有数值 token 的局部几何。

不能说

  • raw scalar 已被证明是 DL 落后的唯一或核心成因;
  • PLE / Periodic 在所有数据集、效率指标与部署条件下都优于 GBDT;
  • Gorishniy 的论文完成了表格谱偏差的理论证明;
  • 这些连续编码能在整个数轴上严格复制任意不连续树函数。
08 · WHAT P11 SHOULD TAKE

对于表格基础模型,问题比“选 PLE 还是 Fourier”更深

Gorishniy 等人的原始设定是 per-dataset supervised learning:不同 numerical features 的 embedding 参数不共享;quantile bins 依赖本表分布,target-aware bins 还依赖本任务标签。

应当吸收的原则

  • 把 ValueEncoder 当作与 backbone 同等级的研究对象;
  • 分别审计局部阈值、多尺度平滑与跨特征交互由哪一层承担;
  • 比较 raw / affine、PLE、Periodic/PLR 与局部 RBF 等真实 alternatives;
  • 同时报告 accuracy、calibration、OOD、参数量、吞吐与数值稳定性。

不能直接照搬的部分

  • target-aware PLE 无法直接作为无标签 zero-shot tokenizer;
  • 按列独立参数不等于跨 schema 共享的 value geometry;
  • “37”脱离变量语义、单位与分布位置,没有跨表稳定含义;
  • 单任务收益不证明 foundation-model pretraining 或 unseen-schema transfer。
The next research question

当“37”可以表示年龄、温度、价格或标准化坐标时,通用表格模型的 value token 应如何联合编码数值、单位、feature semantics、分布位置与任务上下文?

09 · PRIMARY-SOURCE TRAIL

结论来自哪里,推论又停在哪里

NeurIPS 2022

On Embeddings for Numerical Features in Tabular Deep Learning

PLE、Periodic/PLR、11 个数据集、三类 backbone、GBDT comparison 与“无理论结果”的直接来源。

会议页面 ↗ · PDF ↗

NeurIPS 2020

Fourier Features Let Networks Learn High Frequency Functions

低维 coordinate regression / NTK 下的带宽与高频学习理论桥;不是一般表格任务证明。

会议页面 ↗

ICML 2019 + official code

Spectral bias 与可运行实现

Rahaman 等人的频率偏好分析,以及 Gorishniy 等人的官方 embedding package 与复现入口。

Spectral bias ↗ · 官方代码 ↗

继续沿两条线读下去

本篇解释“为什么数值表示值得成为研究对象”;TabFM code-reading 篇展示一个当前 foundation model 怎样把 learned Fourier features 真正接进 cell-token pipeline。P11 当前模型文章则说明这个 ValueEncoder 接口如何进入 Unit-abduction 主干。