在刻意偏向 GBDT 的 11 个数据集上,PLE 与 periodic-based modules 普遍改善 MLP、ResNet 与 Transformer;普通 MLP 也能进入强模型区间。
这项工作很重要;准确地说,重要在这里
Gorishniy、Rubachev 与 Babenko 把一个常被当成预处理细节的问题提升为模型设计对象:每个数值特征在进入 backbone 前,应当先处于什么坐标系?
作者在 checklist 明确说明论文不含理论结果,并在结论中把“这些模块为何从根本上帮助优化”留作开放问题。
真正被打开的方向不是宣布 PLE 或 Fourier 永远胜出,而是研究数值 token 的局部性、多尺度、共享方式与跨表适应。
更强也更准确的说法是:这是一组受控、跨 backbone 的强实证,揭示数值特征所处的输入几何,是足以显著缩小 DL–GBDT 差距的高杠杆归纳偏置之一。
“升到高维”不等于获得高维几何
想象 \(x\) 从小到大连续移动。重要的不是输出向量有多少维,而是它在 embedding space 中走出怎样的轨迹。
高维中的一条直线
\(z(x)=b+xw\)。即使 \(z\in\mathbb R^d\),所有可能的 token 仍落在同一条仿射直线上。
每个区间可以换方向
PLE 保留顺序与区间内位置;线性读出后,数值 token 沿带结点的折线移动,而不是离散跳到 one-hot 点。
一组可学习的相位坐标
多个 sin/cos 通道把距离改写为多尺度相位关系;频率可训练,初始化尺度需要验证集选择,并不保证都是高频。
只要 tokenizer 与 backbone 第一层之间没有非线性,两个线性映射可以合并。线性升维可能改变参数化与优化路径,但不会凭空制造阈值、局部区间或新的频率基。
拖动同一个 \(x\),观察三种表示怎样变化
下面是教学用简化示意,不是论文模型的精确前向复现。它只让表示几何变得可见。
PLE 使用 5 个等宽 bins;Periodic 使用频率 \((1,2,4,7)\) 的 sin/cos 示意。
只知道全局位置
数值只在一条直线上前进;局部边界必须由后续网络自己发现。
知道越过了哪些区间
已完成区间为 1,当前区间保留局部进度,其后为 0。
同时拥有多尺度相位
不同频率对同一个 \(x\) 给出不同坐标,后续层可以组合快速与缓慢变化。
PLE 不是离散化,而是给数轴铺设局部坐标
给定分点 \(b_0<b_1<\cdots<b_T\),如果 \(x\in[b_{s-1},b_s)\),PLE 的形状大致是 \([1,\ldots,1,\alpha,0,\ldots,0]\)。
在训练范围内,它保留 \(x\) 已越过的区间、当前所在区间及区间内进度。后接 Linear 时,各 bin 的向量 \(v_t\) 让 token 轨迹在结点处改变方向。
Quantile PLE
用训练特征的经验分位数放置边界,不读取标签。它让不同 bins 获得相近样本量,并降低对原始尺度与 preprocessing 的敏感度。
Target-aware PLE
用当前任务的标签训练单特征决策树,再把叶区间当作 bins。它更接近树的阈值逻辑,但必须只在训练集拟合,也不能直接充当 zero-shot 跨表 tokenizer。
它借来的是局部化,不是整棵树
GBDT 天然围绕阈值组织计算:一次 split 只关心 \(x<\tau\) 是否成立,多个 splits 把数轴切成局部区域,boosting 再逐步叠加修正。这使不规则、局部、近似阶梯状的响应成为树模型的舒适区。
PLE 把区间与局部进度提前放进输入;periodic embedding 提供多尺度变化方向。二者都减轻了 backbone 从原始标量中重新发明局部结构的负担。
但每个数值特征仍在混合前独立编码。像“收入超过阈值且年龄处于某区间”这样的跨特征条件关系,仍需要后续 MLP、Transformer 或其他交互模块学习。
“越过谱偏差”是一条有根据的解释桥,不是这篇论文的定理
需要把三层证据分开,才能既保留数学直觉,也不把相邻理论错写成表格任务的证明。
Rahaman 等人用 Fourier analysis 研究网络更快学习低频模式的现象。它解释优化偏好,不直接比较 GBDT。
Tancik 等人在低维 coordinate regression / NTK 设定中说明 Fourier mapping 可把有效核变成带宽可调的 stationary kernel,从而改善高频学习。
他们逐特征使用可学习 periodic coefficients,并在表格 benchmark 上验证收益;论文没有给出“谱偏差导致 DL 输给 GBDT”的表格定理。
补充实验中,直接照搬原始 fixed Fourier features、先混合多个特征的做法甚至不如 vanilla MLP。逐特征独立编码、可学习频率和验证集选择都不是无关细节。
\(c_{ir}\) 在 Gorishniy 等人的方案中参与训练;\(k\) 与初始化尺度 \(\sigma\) 都要调优。Periodic 不等于“强制高频”,过大的频率尺度也可能带来噪声敏感、混叠与过拟合。
只换数值表示,vanilla MLP 就进入了强模型区间
论文使用 11 个中大型公开数据集,样本量约从 9,900 到 120 万,并明确说明 benchmark 刻意偏向 GBDT-friendly tasks。
这组比较有力量,也有边界
| 模型 | 数值表示 | Avg. rank |
|---|---|---|
| Vanilla MLP | raw scalar | 8.5 ± 2.6 |
| MLP-Q-LR | Quantile PLE + Linear + ReLU | 5.1 ± 1.9 |
| MLP-T-LR | Target-aware PLE + Linear + ReLU | 5.1 ± 1.7 |
| MLP-PLR | Periodic + Linear + ReLU | 3.0 ± 2.4 |
| CatBoost | tree splits | 3.6 ± 2.9 |
| XGBoost | tree splits | 4.6 ± 2.7 |
可以说
- 数值 embedding 是一个重要、长期被低估的设计自由度;
- 合适的表示在这些 tasks 上显著缩小 DL 与 GBDT 的差距;
- MLP-like backbone 配合 embedding 可与 attention models 相当;
- 不同表示改变的不只是维数,还有数值 token 的局部几何。
不能说
- raw scalar 已被证明是 DL 落后的唯一或核心成因;
- PLE / Periodic 在所有数据集、效率指标与部署条件下都优于 GBDT;
- Gorishniy 的论文完成了表格谱偏差的理论证明;
- 这些连续编码能在整个数轴上严格复制任意不连续树函数。
对于表格基础模型,问题比“选 PLE 还是 Fourier”更深
Gorishniy 等人的原始设定是 per-dataset supervised learning:不同 numerical features 的 embedding 参数不共享;quantile bins 依赖本表分布,target-aware bins 还依赖本任务标签。
应当吸收的原则
- 把 ValueEncoder 当作与 backbone 同等级的研究对象;
- 分别审计局部阈值、多尺度平滑与跨特征交互由哪一层承担;
- 比较 raw / affine、PLE、Periodic/PLR 与局部 RBF 等真实 alternatives;
- 同时报告 accuracy、calibration、OOD、参数量、吞吐与数值稳定性。
不能直接照搬的部分
- target-aware PLE 无法直接作为无标签 zero-shot tokenizer;
- 按列独立参数不等于跨 schema 共享的 value geometry;
- “37”脱离变量语义、单位与分布位置,没有跨表稳定含义;
- 单任务收益不证明 foundation-model pretraining 或 unseen-schema transfer。
当“37”可以表示年龄、温度、价格或标准化坐标时,通用表格模型的 value token 应如何联合编码数值、单位、feature semantics、分布位置与任务上下文?
结论来自哪里,推论又停在哪里
On Embeddings for Numerical Features in Tabular Deep Learning
PLE、Periodic/PLR、11 个数据集、三类 backbone、GBDT comparison 与“无理论结果”的直接来源。
Fourier Features Let Networks Learn High Frequency Functions
低维 coordinate regression / NTK 下的带宽与高频学习理论桥;不是一般表格任务证明。
Spectral bias 与可运行实现
Rahaman 等人的频率偏好分析,以及 Gorishniy 等人的官方 embedding package 与复现入口。
继续沿两条线读下去
本篇解释“为什么数值表示值得成为研究对象”;TabFM code-reading 篇展示一个当前 foundation model 怎样把 learned Fourier features 真正接进 cell-token pipeline。P11 当前模型文章则说明这个 ValueEncoder 接口如何进入 Unit-abduction 主干。