P11 Tabular Foundation Models
TABPFN · AMORTIZED INFERENCE · COST TRANSFER

不再为每张表,
从头训练

TabPFN 最深的变化不是“Transformer 又赢了一次”,而是把逐数据集的参数拟合与超参数搜索,改写成一次跨任务预训练后的 in-context inference:新表进入模型,权重不动,预测算法在上下文中执行。

WeHub public owner-review technical article · noindex · benchmark claims pinned to Nature 2025 · not a formal release

01 · THE CLAIM, CALIBRATED

这是学习算法的变化,不是免费午餐

Nature 2025 的结果非常强:在论文限定的中小型 benchmark 上,default TabPFN 用秒级 fit-and-predict 时间超过了给传统方法数小时调参预算的结果。真正需要校准的是“证明了什么”。

Strong empirical result逐表优化可以被大幅摊销

同一个预训练模型接收 labelled context 与 query rows,在不更新模型权重的情况下完成新任务预测。

Precise boundary“零次迭代”不是零计算

它指没有 dataset-specific gradient steps;preprocessing、多个 ensemble members、校准与一次或多次 forward 仍然会发生。

Real research opening先验成为可执行算法设计

研究者不再只手写 optimizer 与 model class,而是设计一族合成任务,让网络从例子中学出推断策略。

“直接全面超越 XGBoost 与 AutoGluon”仍然太宽。

准确说法是:在论文的 29 个分类与 28 个回归 benchmark、至多 10,000 samples / 500 features 的协议下,default TabPFN 平均优于调参至 4 小时的 individual baselines;分类 default 也优于 4 小时 AutoGluon。回归对 AutoGluon 的对应胜出需要 300 秒 TabPFN PHE,而不是 default 4.8 秒结果。

02 · MOVE THE OPTIMIZATION

不是删掉成本,而是改变成本落在哪里

传统 pipeline 把学习发生在每一张真实表上;PFN 把大部分学习提前放到一个跨任务分布上。新表不再触发一轮从随机初值开始的 optimizer trajectory,而是成为推断时的 context。

Prior factory

先生成任务世界

采样 DAG、机制、噪声、feature / target 位置、缺失与离散化,形成海量 synthetic tables。

Offline meta-training

训练“怎样学习”

随机遮住 query labels,让 Transformer 反复从 context 恢复它们;一套权重跨任务共享。

New real table

把训练集放进上下文

((X_{train},y_{train})) 与 (X_{test}) 一起进入模型;新数据集不修改预训练参数。

Posterior-like prediction

直接输出预测分布

模型用已经摊销在权重里的策略,近似该 synthetic prior 下的 posterior predictive。

Nature 2025 的账本:每个最终模型约训练 200 万 steps、batch size 64,也就是约 1.3 亿个 synthetic datasets;一次训练约用 8 张 RTX 2080 Ti 跑 2 周。秒级新表预测的前提,是这笔离线成本已经支付。
03 · THE AMORTIZED OBJECTIVE

网络逼近的不是一组固定参数,而是一个条件推断算子

设新任务的 context 为 (D_C=\{(x_i,y_i)\}_{i=1}^{n}),query 为 ((X_Q,Y_Q))。若 synthetic task generator 定义了先验 (p(D)),理想目标是该先验诱导的 posterior predictive。

Bayesian predictive target
\[p(Y_Q\mid X_Q,D_C)=\int p(Y_Q\mid X_Q,\vartheta)\,p(\vartheta\mid D_C)\,d\vartheta.\]

显式 Bayes 方法会为每个 (D_C) 重新做积分、采样或变分优化。PFN 改为训练一个共享的 (q_\phi),直接把整张 context table 映射为 query predictive。

Prior-data fitted loss
\[\mathcal L(\phi)=\mathbb E_{(D_C,X_Q,Y_Q)\sim p(D)}\left[-\log q_\phi(Y_Q\mid X_Q,D_C)\right].\] \[q_{\phi^*}(Y_Q\mid X_Q,D_C)\approx p(Y_Q\mid X_Q,D_C).\]

在无限数据、足够表达能力与优化到全局最优等理想条件下,cross-entropy optimum 对应 prior predictive;有限网络与有限训练只能近似它。等号的理论目标不能自动变成现实数据上的 exact Bayesian inference。

摊销误差与 prior mismatch 是这条路线的核心代价。

如果真实任务落在 synthetic prior 覆盖较差的区域,快速的 (q_\phi) 可能稳定地给出错误偏好;“更快”不会自动修复“先验不对”。

04 · WHAT “CAUSAL PRIOR” MEANS

因果图在这里首先是数据生成器,不是因果发现结论

“TabPFN 在大规模因果图先验上训练”对 Nature 2025 大体成立,但仍要区分版本,并阻止一个危险跳跃:用 SCM 合成数据训练预测器,不等于它识别了真实表的 causal graph。

Nature 2025 / TabPFN v2 paper

SCM-based synthetic pipeline

每个任务采样一个 DAG;edge mappings 可包含 small neural networks、linear / nonlinear activations、discretization 与 decision-tree structures,再叠加噪声、missingness、warping 与 quantization。

DAGneural mechanismstree mappingsmissingnesspost-processing
ICLR 2023 / original TabPFN

BNN prior + SCM prior 的混合

早期版本明确混合 Bayesian neural network 与 structural causal model 两类 prior,并在各自内部继续混合 architectures 与 hyperparameters。不能把整个 TabPFN 谱系压成“只靠因果图”。

BNN priorSCM priorhyperparameter mixturesimplicity bias

可以说

  • SCM 给 synthetic task family 提供结构化的生成过程;
  • network 在训练分布上学习近似由 prior 定义的 Bayesian predictive;
  • prior factory 是对现实表格规律的可执行假设。

不能说

  • TabPFN 已恢复真实数据的 causal DAG;
  • 预测准确率证明其 causal mechanisms 正确;
  • 任意 causal prior 都会转化为真实世界 OOD 保证;
  • SCM pretraining 本身完成了 causal effect identification。
05 · INTERACTIVE COST LAB

当任务数量增加,摊销的杠杆从哪里出现?

下面只是 operation-count 教学模型,不是论文 runtime 复现:传统侧固定每表 40 个 configurations × 5-fold CV;PFN 侧固定每表 8 个 ensemble forwards。两种操作的单次成本不同,不能把数量比直接当 speedup。

同一个已部署系统,接连处理多少张新表?

离线 pretraining 视为已经完成;拨动 downstream task count,观察 online work 怎样增长。

PER-DATASET SEARCH

逐表 fit + cross-validation

8,000
model fits · 40 configs × 5 folds × 40 tables
AMORTIZED PATH

固定权重 + ensemble forwards

320
forward evaluations · 8 members × 40 tables
没有画进 online bars 的成本:PFN 的大规模 synthetic generation 与离线 meta-training;传统方法的开发经验也同样来自过去积累。这个实验只展示“重复任务越多,预先学好算法越能摊销”的结构。
06 · IS IT REALLY ONE FORWARD PASS?

概念上是;默认系统路径通常比一句话更复杂

Nature 论文准确地把 ICL 主干描述为 single forward pass;同一篇 Methods 又明确说明,为获得最好性能,TabPFN 通常运行一个 small ensemble,并对每个 member 改变 preprocessing 或 post-processing。

The essential claim

没有新表上的 gradient descent

每个 member 都用冻结权重,把 labelled context 与 query 一起映射到预测。这是“零 dataset-specific optimizer steps”的本质。

The deployed default

不是一次物理 forward

Nature benchmark 的 default classification 使用 4-way、regression 使用 8-way ensemble;feature-order shuffle、label permutation、calibration 与不同 transforms 都可能参与。

The tuned variant

PHE 又把搜索加回来

TabPFN PHE 会评估配置 portfolio、做 holdout validation 与 greedy ensemble selection;回归超越 4 小时 AutoGluon 的对应结果使用了至少 300 秒预算。

另一个部署细节:ICL 若反复预测新 test rows,会重复处理 training context。Nature 架构因此支持 train-state caching,把 context 表示保存后复用。单次 fit 很快,不等于单样本实时 serving 必然比树快。
07 · WHAT THE BENCHMARK ACTUALLY SUPPORTS

把最强数字放回它们各自的比较对象

主 benchmark 使用 29 个 classification 与 28 个 regression datasets,每个方法 10 次不同 split / seed,individual baselines 用 5-fold random-search HPO,预算从 30 秒到 4 小时。

Nature 2025 comparison map
时间为论文报告的平均 fit-and-predict / tuning budget;性能为跨数据集归一化聚合,不能读成每张表都获胜。
任务与方法TabPFN 路径对手论文支持的结论
Classification · default2.8 sXGBoost / CatBoost / RF 等,最多 4 h HPOdefault TabPFN 的平均结果更高;论文换算为 5,140× time-budget ratio。
Classification · AutoMLdefault,2.8 s;normalized ROC AUC 0.939AutoGluon 1.0,最多 4 h;0.914这里可以说 default TabPFN 超过 4 h AutoGluon。
Regression · default4.8 sindividual baselines,最多 4 h HPOdefault TabPFN 的平均结果更高;论文换算为 3,000× time-budget ratio。
Regression · AutoMLTabPFN PHE,至少 300 sAutoGluon 1.0,4 hPHE 在 300 s 后超过;不能偷换成 default 4.8 s 已超过 AutoGluon。

硬件边界:所有方法使用 8 CPU cores;TabPFN 额外使用 RTX 2080 Ti。作者报告 GPU 并未改善这些小数据上的 baselines,但比较仍不是同构硬件上的纯算法步数对照。并且 CatBoost 在部分数据集上仍胜过 TabPFN。

08 · WHERE THE RESULT STOPS

万级样本是这篇论文的证据边界,不是永恒产品上限

Nature 2025 直接支持

  • 主评估覆盖至多 10,000 samples、500 features、10 classes;
  • small-to-medium classification / regression 上有强 out-of-box 表现;
  • synthetic pretraining 可以把新表上的优化成本显著摊销;
  • 模型输出 predictive distribution,并可继续 fine-tune 或 ensemble。

论文自己明确保留

  • 更大数据与高度 non-smooth regression,CatBoost、XGB 或 AutoGluon 可能更强;
  • 单 test sample latency 可远慢于已拟合 CatBoost,论文给出 10k×10 表上约 0.2 s 对 0.0002 s 的例子;
  • 内存随 table cells 线性增长,compute 对 samples / features attention 呈平方项;
  • synthetic generator code 未随 Nature 模型公开,prior 的完全复核有现实边界。
当前软件已经继续扩展,本文不把移动中的产品能力倒写进 2025 证据。

Prior Labs 的现行 checkpoints、推荐尺寸与许可证会更新;这里所有“2.8 秒、10,000 rows、500 features、4 小时”都严格绑定 Nature 2025 的模型、protocol 与硬件。

09 · WHAT P11 SHOULD TAKE

对 P11 来说,最重要的是“先验工厂”与“推断对象”

TabPFN 证明了一个极有力量的 engineering possibility:新任务上的适配可以主要发生在 activations / context 中,而不是 weights 中。但它没有替 P11 决定 Unit、Feature semantics 与 response law 应如何定义。

值得吸收

  • 把 synthetic task generator 当成第一等模型组件,而不是数据脚本;
  • 明确写出预训练 task distribution 与 real-table target distribution 的 mismatch;
  • 把 context-conditioned prediction 与 dataset-specific fine-tuning 分成不同实验臂;
  • 评估 default amortized、small ensemble、PHE 与 per-dataset training 的完整成本曲线。

不能直接继承

  • random feature embeddings 不等于 LLM-derived feature semantics;
  • label-column prediction 不自动给出 P11 的 Unit token ontology;
  • SCM prior 不证明新表上的 causal identification;
  • TabPFN benchmark 胜出不证明 P11 当前 candidate architecture 已有效。
The next P11 research question

P11 能否把“Unit–Feature response law 的先验”写成可采样的跨表 task family,让新表上的 visible evidence 通过一次 context-conditioned Unit abduction 完成预测,同时把 prior mismatch 暴露为可测量对象?

10 · PRIMARY-SOURCE TRAIL

从原始 PFN 目标,到 TabPFN 的强结果与理论边界

Nature 2025

Accurate predictions on small data with a tabular foundation model

SCM synthetic pipeline、130M tasks、10k / 500 benchmark、2.8 s / 4.8 s、AutoGluon comparison、inference ensemble 与限制的直接来源。

Nature full text ↗

ICLR 2022

Transformers Can Do Bayesian Inference

PFN 的 prior-data objective、posterior predictive approximation 与 single-forward amortized inference 的原始论文。

OpenReview ↗

ICLR 2023

TabPFN: A Transformer That Solves Small Tabular Classification Problems in a Second

original TabPFN,以及 BNN prior + SCM prior 混合的版本来源。

OpenReview ↗

ICML 2023 + official code

Statistical foundations 与移动中的实现

Nagler 给出 frequentist 理解与一致性边界;官方仓库用于核对当前 checkpoint,而不是改写 Nature-era claim。

PMLR ↗ · Official code ↗

下一步,把“学会一个算法”接回 P11

TabPFN reference dossier 负责逐篇资料证据;本篇负责 project-level synthesis:成本如何被摊销、synthetic prior 在数学上指定了什么,以及这条路线如何压到 P11 的 Unit abduction 问题上。