合成先验的强项
TabPFN 把预测写成从 synthetic prior 中近似 Bayesian inference;Google TabFM 公开描述的训练也完全依赖由 SCM 与随机函数动态生成的大规模 synthetic datasets。它们因此拥有可扩展、可控且不依赖真实 schema 的计算先验。
TabPFN 与 Google TabFM 证明了“只靠可扩展的合成先验,也能在陌生数值表上做强 zero-shot / in-context prediction”。 但真实表格还有另一种信息:列名、单位、时间范围和列之间的关系。问题不是再塞进一个大语言模型, 而是能否用一个轻量、可审计、不会破坏行列对称性的 semantic interface,把这部分信息接回 table-native backbone。
P11 project-level technical article · owner-review preview · noindex · proposal, not a result
现有文献已经覆盖了合成数据、真实表格预训练、LLM 序列化和语义列编码。真正值得 P11 继续追问的, 是能否把这些信息放在同一个最小契约里:语义只负责提供列级 identity / role / relation hint, 通用计算 backbone 仍负责行列交互、mask、typed response 和 permutation symmetry。
TabPFN 把预测写成从 synthetic prior 中近似 Bayesian inference;Google TabFM 公开描述的训练也完全依赖由 SCM 与随机函数动态生成的大规模 synthetic datasets。它们因此拥有可扩展、可控且不依赖真实 schema 的计算先验。
ConTextTab 明确把 column headers、categorical/text values 和 dates 的语义带回 table-native ICL,并使用小型 all-MiniLM-L6-v2 作为文本 embedding。它证明语义信号有价值,但也把 real-data corpus、semantic encoding、attention 与 context scaling 一起带进了系统。
我们要找的不是“再训练一个更大的语言模型”,而是一个 column-level semantic adapter:便宜、可替换、可缺省、能表达列间关系,又不破坏原来可泛化的集合/拓扑计算规律。
更准确的 gap statement 是:semantic-aware TFM 已经存在,但“轻量语义词典 + 稀疏列关系 + 通用 table-native topology”的独立组合契约仍值得系统化设计与验证。
三条路线各自解决了不同问题。这里的比较是研究设计定位,不是对所有模型版本的完整 benchmark 排名。
| 路线 | 主要输入 | 计算优势 | 留下的缺口 |
|---|---|---|---|
| synthetic-prior table-native | 数值/类别编码后的 rows、columns、context/query | 先验可无限生成;集合/行列 topology 直接进入模型;陌生数值 schema 的 ICL 很强 | 列名、单位、类别文本和真实 domain relation 通常不进入 learned object |
| real-data semantic table-native | 真实表格、column headers、text/date/category semantics | 能够利用真实 schema 与世界知识的部分线索,同时保留表格结构 | 语义预处理、real-table corpus、长 context、attention 与 bagging 的总成本较高 |
| LLM serialization | 把表格线性化为文本 token 序列 | 可直接调用强大的语言语义与知识 | token inefficient;2D 结构、行列置换不变性和大表 context 容量需要额外补偿 |
| 轻量语义接口(待检验) | 列描述/单位/类型/少量关系词典 + raw values | 语义成本按 columns 而不是 cells 放大;可插拔;backbone 仍保持 table-native | 词典覆盖、歧义、跨 domain transfer 和语义提示是否真的改善预测都尚未证明 |
debt_ratio is 0.42,把名称、定义和值一起交给 LLM。它最符合人的阅读直觉,也最容易调用已有语言知识;但当 rows × columns 很大时,token、context 和自回归 latency 会迅速成为瓶颈,所以更适合小表、原型或语义很强的任务。
列级只编码一次:name=debt_ratio; definition=debt/income; unit=percentage;每一行的 0.42 走 numeric value encoder,再与列语义融合。它牺牲了一点文本直觉,换取更低的重复成本和更好的 table-native 结构。
把同一列压缩成 role=ratio, numerator=debt, denominator=income, unit=percentage,或映射到小型受控词典。它更便宜、易审计,但可能丢失定义中的细节和跨领域措辞;哪些字段值得保留仍待消融。
额外提供 debt_ratio → days_past_due 这样的 relation hint,让模型知道两列可能属于同一风险状态或时间逻辑。它只是 hypothesis-space 的提示,不是 hard-coded causal edge,也不直接规定效果方向。
全量文本序列化保留为一个可验证的 baseline;轻量接口只是把名称/定义、值、关系拆成不同通道,尝试在语义收益与计算预算之间取得更好的位置。后续实验应比较 A/B/C/D,而不是预先宣布哪一种输入是唯一正确答案。
论文并不是说 all-MiniLM 本身很大;它选择这个模型正是为了速度和语义之间的折中。真正的总成本来自 semantic embedding、real-table pretraining、交替行/列 attention、长 context 以及默认的多次 context bagging。论文报告 base 模型 172M 参数(weight sharing 时 16M trainable),单 H100 训练约 4–12 天,推理默认可用 8-fold bagging 与最多 8192 context。因此,轻量文本 encoder 并不等于轻量的整体语义 TFM。
候选设计不是把每个 cell 送进 LLM,而是把语义预算集中在 columns:与某个特征有关的一组可选信息——名称、自然语言定义、单位、时间范围、角色、来源、关系提示,甚至后续发现有用的其他 metadata——共同形成 compact semantic state。具体选哪些信息、由谁提供、是否允许缺失,留给后续实验;数值模式、行间 context 和 typed response 仍由内部 backbone 学习。
\(\mathcal M_j\) 是“这个特征相关的信息”的候选集合,不是已经冻结的字段 schema;可以只放 raw header,也可以加入定义、单位、时间窗口、来源或关系提示。\(\phi_{\mathrm{sem}}\) 可以是小型 text embedding、受控 lookup 或二者的混合;\(A_{\mathrm{sem}}\) 是很小的 learned adapter。它只处理 column-associated metadata,不读取 target truth。
数值、类别、日期和缺失状态仍由 shared value path 处理;semantic state 是 column meaning,不替代 raw value,也不强迫所有列使用同一个 domain-specific head。
\(\mathcal N(j)\) 只保留 top-\(K\) 或词典声明的关系边。关系可以表达 ratio、duration、lag、aggregation、same-entity 或 unit-compatibility,但不直接写入效果正负。
这里可以复用 P11 当前的 position-free Transformer、symmetric readout 与 numeric/binary/categorical typed loss;这篇文章不把候选 interface 当作当前 v1 已冻结网络。
当列的 value、description、dtype、mask 和 relation metadata 一起重排时,semantic interface 应满足 equivariance,row readout 应满足 invariance:
\[ B_\theta(\pi\mathcal E_i)=\pi B_\theta(\mathcal E_i),\qquad u_i(\pi\mathcal E_i)=u_i(\mathcal E_i). \]只交换 values 而不交换 descriptions 是另一张 evidence table;它可以改变结果。语义接口要消除的是 serialization-order bias,不是消除 feature identity。这里的 passport 是候选信息菜单,不是强制 schema。轻量语义接口可以从特征名称开始,也可以加入定义、类型、单位、时间、来源、质量标记或列间关系;具体哪些字段值得保留,要由跨 schema transfer、缺失消融和计算预算共同决定。
这些是可选候选,不代表第一版必须全部输入。
| column | compact passport | 可提出的 relation hint | 不可直接声称 |
|---|---|---|---|
| debt_ratio | role=ratio; numerator=debt; denominator=income/assets; unit=percentage | ratio-of、risk-state-related | 不能直接声称对 default 有单调正效应 |
| days_past_due | role=duration; event=delinquency; unit=days; time=recent window | duration-of、temporal-marker、risk-state-related | 不能把日期窗口、催收规则或标签定义当成 universal mechanism |
| loan_amount | role=amount; unit=currency; scale=continuous | same-contract、aggregates-with、unit-compatible | 不能仅凭词典决定应使用线性、单调或比例关系 |
在这个例子里,词典只帮助模型把列放进一个更有结构的 hypothesis space;是否真的改善 default prediction,必须通过 label-preserving ablation、时间外推、缺失机制和关系打乱实验来判断。
最小可证伪实验应该把 topology、semantic content、compute 和 failure mode 分开。先在少量 schema 上闭合契约,再决定是否值得进入跨表 pretraining 或大规模 benchmark。
保持现有 synthetic-prior / table-native backbone,只使用 dtype 与 raw value;这是结构先验基线。
加入真实 column passport,但打乱 relation edges;若性能变化只来自列名,不能冒充关系建模收益。
保留 relation hints,分别打乱词面描述、单位字段和 graph edges;检验模型究竟用的是 lexical cue 还是结构 cue。
只有当 semantic adapter 在至少一个 semantically rich holdout 上稳定改善,且不破坏合法 permutation、不依赖高昂 cell-level text encoding、对 lexicon dropout 有可解释退化时,才进入 cross-schema pretraining 讨论。
否则它只是一个漂亮的输入特征,而不是下一代 TFM 的新接口。
为每个字段指定输入、输出、缺失 fallback、计算预算、permutation contract、falsifier 与 promotion evidence;然后在 P11 当前的 value-token / Unit-abduction 主干上做 matched ablation。若语义只增加成本而不增加跨 schema 的可迁移信息,就应该战略性推迟,而不是继续堆模块。
Current state: WeHub public owner-review proposal · no implementation, benchmark, performance, causal, formal-release or submission claim.Evidence cutoff: 2026-08-04。下面的链接用于区分“论文明确写了什么”和“P11 从中提出的研究方向”。
原始 TabPFN 论文:把预训练模型解释为 synthetic prior 上的 Bayesian inference approximation。
打开 arXiv → PRIMARY · GOOGLE TABFMGoogle Research 的公开架构与训练说明:交替 row/column attention、row compression、ICL 和 synthetic datasets。
打开 Google Research → PRIMARY · CONTEXTTAB语义列编码、真实 T4 表格、all-MiniLM、attention scaling 与 runtime trade-off 的直接来源。
打开 arXiv →说明 real-world continued pretraining 是另一条补充 synthetic-only 的路线,但不等于列级语义词典。
打开 arXiv → P11 CURRENT MODEL查看 P11 当前 v1 的 feature token、value token、evidence 与 Unit response contract。
阅读当前模型 → P11 DATASET ATLAS检查 synthetic prior、real tables、task compiler、split、HPO 与 contamination 的边界。
打开 Dataset Atlas →