OWNER-REVIEW · NOINDEX · NOT A FORMAL RELEASE
PROJECT COURSE · TABPFN-3 READING → BUILDING

Mini-TabPFN:表格基础模型项目实战

从 Attention、Row Token 到表格 In-Context Learning,把 TabPFN-3 的关键计算对象拆成一个可以训练、验证、修改和复盘的 Mini-TabPFN 项目。

COURSE OUTCOME

终点不是“看过论文”,而是得到一个可审计的项目

模型接收 context table 和 query rows,直接输出 query 的预测分布。每一个关键阶段都留下 shape、行为、泄漏和任务级证据,而不是只留下一份没有实验的实现草稿。

01Cell tokensscalar → vector
02Column context\(N\to K\to N\)
03Row tokensfeatures → row
04Row-level ICLlabel injection
05Predictionclassification / regression
8-SESSION PROJECT PATH

八次课,每次都产出一段可以验证的模型能力

每个单元有两层 canonical source:course/lectures/ 负责系统讲义,course/lessons/ 负责动手实验与验收。点击任一课程卡片即可进入合并展示的公开 lesson 子页面。

01 TASK REPRESENTATION

模型究竟学习一行,还是学习一个任务?

建立 synthetic classification/regression task、context/query split 和 MLP baseline,先固定 batch、row、feature 维度。

产物 · task sampler + tensor checks →
02 ATTENTION

Attention 怎样把 token 变成新的表示?

手写 single-head self/cross-attention,对照 PyTorch,并检查每行权重是否真的是概率分布。

产物 · attention module + parity test →
03 INDUCED COLUMN ENCODER

怎样把列上下文成本从 \(N^2\) 降到 \(NK\)?

实现 inducing points 的两段 attention,继续保留每个 cell token 的更新,而不是把整列压成一个向量。

产物 · column encoder + scaling audit →
04 ROW TOKEN

一行表格怎样成为一个可比较的 token?

把 feature states 与 CLS tokens 放进 row 内 transformer,比较 pooling 选择并固定 row representation 接口。

产物 · row aggregator + shape assertions →
05 ROW-LEVEL ICL

query 怎样读 context,又不偷看 query label?

注入 context labels、屏蔽未知 query labels,写出 context→context、query→context 的 attention mask。

产物 · ICL transformer + leakage audit →
06 PREDICTION HEADS

为什么分类和回归需要不同输出头?

实现 learned retrieval classification,并比较 scalar MSE、bar-distribution NLL 和 quantile pinball。

产物 · heads + metric comparison →
07 SYNTHETIC PRIOR

PFN 为什么不是在一张固定表上训练?

用简化 SCM/task prior 采样新的表格任务,接通 trainer、checkpoint 和可复现训练证据。

产物 · prior sampler + training run →
08 EVALUATION + CHANGE

模型是否学会了跨任务预测算法?

在未见任务上做 zero-shot evaluation,和 MLP/KNN/XGBoost 对照,再完成一次有指标的架构改造。

产物 · report + architecture experiment →
TARGET REPOSITORY

课程最终要留下什么结构

这是课程的目标接口,不声称是官方 TabPFN-3 的真实内部代码结构。实现应独立产生,论文 archive、作者源码和作者图表保持只读。

mini-tabpfn/
├── data/       synthetic tasks · SCM · prior sampler
├── models/     attention · column · row · ICL · heads
├── training/   trainer · losses · checkpoint
├── tests/      shape · leakage · permutation · task audits
├── experiments/ zero-shot · baseline · architecture change
└── README.md
ACCEPTANCE GATES

每一阶段都要有“停下来核对”的证据

  • Shape assertions:每个模块声明输入、输出和 batch/row/feature 语义。
  • Attention audit:权重行和为 1,并能与参考实现对齐。
  • Leakage audit:改变 query label 不应改变其他 query 的预测。
  • Permutation / scaling audit:声明顺序性质,并比较普通 attention 与 induced attention 的 N 趋势。
  • Task / zero-shot audit:同一模型经过分类和回归,并在训练未见任务上报告结果。
  • Architecture audit:至少一个改造方向有对照、指标和失败解释。
FINAL DELIVERABLES

完成课程后提交一套可复盘的证据包

CODE

完整代码仓库

可运行训练脚本、checkpoint 说明、分类和回归路径。

EVIDENCE

结构与实验报告

模型结构图、Attention 可视化、zero-shot 结果与 baseline 对照。

CHANGE

一个架构改进

例如第二轮 column-row interaction、categorical embedding、missing value mechanism 或 row chunking。

REFLECTION

失败解释

说明哪些能力仍是 not-yet-verified,哪些只是预测表现,哪些不能升级为因果主张。

BOUNDARY

这是一门受启发的实现课程,不是官方复现声明

课程不声称复现官方 TabPFN-3 的参数规模、训练数据、optimizer、schedule、Thinking algorithm 或 benchmark 数字,也不把 Mini-TabPFN 自动解释成 causal identification、persistent Unit identity、counterfactual ability 或 SCM recovery。

正确成果表述是:学习者实现了一个受 TabPFN-3 启发、可训练、可审计、可改造的 Mini-TabPFN,并能把论文中的计算图读成代码、张量和实验。