P11 Tabular Foundation Models
RESEARCH FRONTIER · SYNTHETIC PRIORS × COLUMN SEMANTICS

合成先验之外:给 Tabular Foundation Model 加一层轻量语义接口

TabPFN 与 Google TabFM 证明了“只靠可扩展的合成先验,也能在陌生数值表上做强 zero-shot / in-context prediction”。 但真实表格还有另一种信息:列名、单位、时间范围和列之间的关系。问题不是再塞进一个大语言模型, 而是能否用一个轻量、可审计、不会破坏行列对称性的 semantic interface,把这部分信息接回 table-native backbone。

P11 project-level technical article · owner-review preview · noindex · proposal, not a result

01 · JUDGEMENT WITH A NARROWER CLAIM

问题不是“有没有语义模型”,而是语义应该以什么计算接口进入表格模型

现有文献已经覆盖了合成数据、真实表格预训练、LLM 序列化和语义列编码。真正值得 P11 继续追问的, 是能否把这些信息放在同一个最小契约里:语义只负责提供列级 identity / role / relation hint, 通用计算 backbone 仍负责行列交互、mask、typed response 和 permutation symmetry。

P

合成先验的强项

TabPFN 把预测写成从 synthetic prior 中近似 Bayesian inference;Google TabFM 公开描述的训练也完全依赖由 SCM 与随机函数动态生成的大规模 synthetic datasets。它们因此拥有可扩展、可控且不依赖真实 schema 的计算先验。

S

语义路线的补偿

ConTextTab 明确把 column headers、categorical/text values 和 dates 的语义带回 table-native ICL,并使用小型 all-MiniLM-L6-v2 作为文本 embedding。它证明语义信号有价值,但也把 real-data corpus、semantic encoding、attention 与 context scaling 一起带进了系统。

?

更窄的研究缺口

我们要找的不是“再训练一个更大的语言模型”,而是一个 column-level semantic adapter:便宜、可替换、可缺省、能表达列间关系,又不破坏原来可泛化的集合/拓扑计算规律。

更准确的 gap statement 是:semantic-aware TFM 已经存在,但“轻量语义词典 + 稀疏列关系 + 通用 table-native topology”的独立组合契约仍值得系统化设计与验证。
02 · THREE ROUTES, THREE DIFFERENT COSTS

不要把“没有列语义”和“拥有世界知识”误当成两个极端

三条路线各自解决了不同问题。这里的比较是研究设计定位,不是对所有模型版本的完整 benchmark 排名。

路线主要输入计算优势留下的缺口
synthetic-prior table-native数值/类别编码后的 rows、columns、context/query先验可无限生成;集合/行列 topology 直接进入模型;陌生数值 schema 的 ICL 很强列名、单位、类别文本和真实 domain relation 通常不进入 learned object
real-data semantic table-native真实表格、column headers、text/date/category semantics能够利用真实 schema 与世界知识的部分线索,同时保留表格结构语义预处理、real-table corpus、长 context、attention 与 bagging 的总成本较高
LLM serialization把表格线性化为文本 token 序列可直接调用强大的语言语义与知识token inefficient;2D 结构、行列置换不变性和大表 context 容量需要额外补偿
轻量语义接口(待检验)列描述/单位/类型/少量关系词典 + raw values语义成本按 columns 而不是 cells 放大;可插拔;backbone 仍保持 table-native词典覆盖、歧义、跨 domain transfer 和语义提示是否真的改善预测都尚未证明

四个编码案例:同一个特征信息,可以有不同入口

A · 全量文本序列化

debt_ratio is 0.42,把名称、定义和值一起交给 LLM。它最符合人的阅读直觉,也最容易调用已有语言知识;但当 rows × columns 很大时,token、context 和自回归 latency 会迅速成为瓶颈,所以更适合小表、原型或语义很强的任务。

B · 列信息与值分开

列级只编码一次:name=debt_ratio; definition=debt/income; unit=percentage;每一行的 0.42 走 numeric value encoder,再与列语义融合。它牺牲了一点文本直觉,换取更低的重复成本和更好的 table-native 结构。

C · 紧凑字段 / lookup

把同一列压缩成 role=ratio, numerator=debt, denominator=income, unit=percentage,或映射到小型受控词典。它更便宜、易审计,但可能丢失定义中的细节和跨领域措辞;哪些字段值得保留仍待消融。

D · 列间关系提示

额外提供 debt_ratio → days_past_due 这样的 relation hint,让模型知道两列可能属于同一风险状态或时间逻辑。它只是 hypothesis-space 的提示,不是 hard-coded causal edge,也不直接规定效果方向。

因此“被计算限制退下去”不等于“直觉做法错误”。

全量文本序列化保留为一个可验证的 baseline;轻量接口只是把名称/定义、值、关系拆成不同通道,尝试在语义收益与计算预算之间取得更好的位置。后续实验应比较 A/B/C/D,而不是预先宣布哪一种输入是唯一正确答案。

ConTextTab 的计算边界值得精确描述。

论文并不是说 all-MiniLM 本身很大;它选择这个模型正是为了速度和语义之间的折中。真正的总成本来自 semantic embedding、real-table pretraining、交替行/列 attention、长 context 以及默认的多次 context bagging。论文报告 base 模型 172M 参数(weight sharing 时 16M trainable),单 H100 训练约 4–12 天,推理默认可用 8-fold bagging 与最多 8192 context。因此,轻量文本 encoder 并不等于轻量的整体语义 TFM。

03 · A CANDIDATE MINIMAL INTERFACE

让语义只进入列级接口,让表格 topology 继续承担计算

候选设计不是把每个 cell 送进 LLM,而是把语义预算集中在 columns:与某个特征有关的一组可选信息——名称、自然语言定义、单位、时间范围、角色、来源、关系提示,甚至后续发现有用的其他 metadata——共同形成 compact semantic state。具体选哪些信息、由谁提供、是否允许缺失,留给后续实验;数值模式、行间 context 和 typed response 仍由内部 backbone 学习。

01 · COLUMN SEMANTIC STATE\[ \mathcal M_j=\{\text{name},\text{definition},\text{dtype},\text{unit},\text{role},\text{time},\text{provenance},\ldots\},\qquad z_j=A_{\mathrm{sem}}\!\left(\phi_{\mathrm{sem}}(\mathcal M_j)\right)\in\mathbb R^p \]

\(\mathcal M_j\) 是“这个特征相关的信息”的候选集合,不是已经冻结的字段 schema;可以只放 raw header,也可以加入定义、单位、时间窗口、来源或关系提示。\(\phi_{\mathrm{sem}}\) 可以是小型 text embedding、受控 lookup 或二者的混合;\(A_{\mathrm{sem}}\) 是很小的 learned adapter。它只处理 column-associated metadata,不读取 target truth。

02 · SHARED VALUE ENCODER\[ c_{ij}=g_{\mathrm{value}}(x_{ij},\mathrm{dtype}_j,\mathrm{state}_j),\qquad e_{ij}=\operatorname{Fuse}(c_{ij},z_j) \]

数值、类别、日期和缺失状态仍由 shared value path 处理;semantic state 是 column meaning,不替代 raw value,也不强迫所有列使用同一个 domain-specific head。

03 · SPARSE COLUMN RELATION\[ r_{jk}=R(z_j,z_k,\mathrm{unit}_{jk},\mathrm{time}_{jk}),\qquad \widetilde z_j=z_j+\sum_{k\in\mathcal N(j)}\alpha_{jk}W_r r_{jk} \]

\(\mathcal N(j)\) 只保留 top-\(K\) 或词典声明的关系边。关系可以表达 ratio、duration、lag、aggregation、same-entity 或 unit-compatibility,但不直接写入效果正负。

04 · TABLE-NATIVE RESPONSE LAW\[ \{\,(e_{ij},\widetilde z_j):j\in O_i\,\}\xrightarrow{\,B_\theta\,}u_i\xrightarrow{\,q_\Theta(\cdot\mid u_i,\widetilde z_t)\,}\text{typed response} \]

这里可以复用 P11 当前的 position-free Transformer、symmetric readout 与 numeric/binary/categorical typed loss;这篇文章不把候选 interface 当作当前 v1 已冻结网络。

TOPOLOGY CONTRACT · MUST SURVIVE THE SEMANTIC ADAPTER

当列的 value、description、dtype、mask 和 relation metadata 一起重排时,semantic interface 应满足 equivariance,row readout 应满足 invariance:

\[ B_\theta(\pi\mathcal E_i)=\pi B_\theta(\mathcal E_i),\qquad u_i(\pi\mathcal E_i)=u_i(\mathcal E_i). \]只交换 values 而不交换 descriptions 是另一张 evidence table;它可以改变结果。语义接口要消除的是 serialization-order bias,不是消除 feature identity。
04 · WHAT A LIGHTWEIGHT LEXICON SHOULD CARRY

不是固定字段表,而是一组可选择的 column passport 信息

这里的 passport 是候选信息菜单,不是强制 schema。轻量语义接口可以从特征名称开始,也可以加入定义、类型、单位、时间、来源、质量标记或列间关系;具体哪些字段值得保留,要由跨 schema transfer、缺失消融和计算预算共同决定。

可能放进来的信息

  • name / definition:原始列名、别名、自然语言定义、公式或业务备注;
  • dtype / role:ratio、amount、count、duration、date、status、identifier、target candidate;
  • unit / scale:currency、percentage、days、months、unknown,以及 numerator / denominator;
  • temporal scope:snapshot、rolling window、event time、lagged、future label;
  • source / confidence:header-derived、description-derived、human-verified、data-dictionary 或 unknown;
  • relation hint:ratio-of、same-entity、precedes、aggregates、often-cooccurs。

这些是可选候选,不代表第一版必须全部输入。

不能偷偷写入的假设

  • 词典相似不等于两个变量由同一机制生成;
  • “债务比例”和“逾期天数”相关不等于它们之间存在确定的单调因果关系;
  • domain phrase 的先验提示不能替代 split、missingness、selection 或 leakage audit;
  • unknown / noisy / adversarial descriptions 必须有 fallback,不能把 semantic failure 变成 silent zero vector。
columncompact passport可提出的 relation hint不可直接声称
debt_ratiorole=ratio; numerator=debt; denominator=income/assets; unit=percentageratio-of、risk-state-related不能直接声称对 default 有单调正效应
days_past_duerole=duration; event=delinquency; unit=days; time=recent windowduration-of、temporal-marker、risk-state-related不能把日期窗口、催收规则或标签定义当成 universal mechanism
loan_amountrole=amount; unit=currency; scale=continuoussame-contract、aggregates-with、unit-compatible不能仅凭词典决定应使用线性、单调或比例关系
关键边界:语义关系是可学习的条件,不是 hard-coded causal graph。

在这个例子里,词典只帮助模型把列放进一个更有结构的 hypothesis space;是否真的改善 default prediction,必须通过 label-preserving ablation、时间外推、缺失机制和关系打乱实验来判断。

05 · FIRST EXPERIMENT, NOT A GRAND BENCHMARK

第一轮不需要训练更大的模型,只需要验证语义接口是否真的有用

最小可证伪实验应该把 topology、semantic content、compute 和 failure mode 分开。先在少量 schema 上闭合契约,再决定是否值得进入跨表 pretraining 或大规模 benchmark。

A

Topology-only baseline

保持现有 synthetic-prior / table-native backbone,只使用 dtype 与 raw value;这是结构先验基线。

B

Lexicon-preserving

加入真实 column passport,但打乱 relation edges;若性能变化只来自列名,不能冒充关系建模收益。

C

Relation-preserving

保留 relation hints,分别打乱词面描述、单位字段和 graph edges;检验模型究竟用的是 lexical cue 还是结构 cue。

需要同时报告的指标

  • predictive:分类/回归主指标与 calibration;
  • semantic:description permutation、lexicon dropout、relation shuffle;
  • topology:完整 column-pair permutation equality;
  • cost:预计算与在线 latency、显存、每 table / 每 column 的 token 数;
  • robustness:unknown columns、同义改写、单位改写、错配 description。

最小 promotion gate

只有当 semantic adapter 在至少一个 semantically rich holdout 上稳定改善,且不破坏合法 permutation、不依赖高昂 cell-level text encoding、对 lexicon dropout 有可解释退化时,才进入 cross-schema pretraining 讨论。

否则它只是一个漂亮的输入特征,而不是下一代 TFM 的新接口。

06 · EVIDENCE BEFORE NOVELTY

这篇文章提出的是研究命题,不是“领域空白已被证明”

目前可以成立的观察

  • TabPFN 的原始 PFN 路线把 offline synthetic prior 与 Bayesian inference approximation 绑定起来;
  • Google TabFM 的公开说明把 hybrid row/column attention、row compression、ICL 与大规模 synthetic SCM data 放在同一条路线中;
  • ConTextTab 直接证明 semantics-aware table-native ICL 是一条真实的研究路线,并明确使用 column headers、semantic values 与 all-MiniLM 的速度/语义折中;
  • Real-TabPFN 说明“继续用少量 curated real-world data 做 pretraining”也可能有效,但这不是轻量 column lexicon interface 的同义词。

目前不能声称的结论

  • 不能声称学术界绝对没有任何 hybrid semantic TFM;这需要系统 literature sweep;
  • 不能声称轻量词典一定优于 all-MiniLM、真实表格预训练或更大的 LLM;
  • 不能声称 semantic relation hint 自动恢复金融机制、因果关系或可解释的 monotone effect;
  • 不能把候选公式当作 P11 v1 已实现、已训练、已跨 schema 泛化或已有 benchmark result。

下一关:先把 semantic interface 写成可证伪 component contract

为每个字段指定输入、输出、缺失 fallback、计算预算、permutation contract、falsifier 与 promotion evidence;然后在 P11 当前的 value-token / Unit-abduction 主干上做 matched ablation。若语义只增加成本而不增加跨 schema 的可迁移信息,就应该战略性推迟,而不是继续堆模块。

Current state: WeHub public owner-review proposal · no implementation, benchmark, performance, causal, formal-release or submission claim.
07 · PRIMARY SOURCES AND NEIGHBORING EVIDENCE

从一手资料继续核对,而不是只读这篇综合判断

Evidence cutoff: 2026-08-04。下面的链接用于区分“论文明确写了什么”和“P11 从中提出的研究方向”。