P11 TabUF Research Project
P11-MQ-001 · MAINLINE QUESTION

怎样统一异构表格输入,又不制造伪序?

数值、类别、文本、缺失、量纲和变化的 label space 应该如何进入同一个模型?

OWNER DRAFT · ALIGNMENT OPENSharedRSEvidence cutoff · 2026-08-11Last reviewed · 2026-08-11
OWNER DRAFT · ALIGNMENT OPEN

忠实投影 Gong owner worksheet;仍从属于 hello_agent.md 与所选 R/S contract。

Applies to: 表格输入接口、episode-local codebook、missingness 与 typed value encoder。

怎样统一数值、类别、文本、缺失值、不同量纲、不同列数与变化的 label space, 又不把 nominal category 错当成有序数?

TabUF 的回答(Gong):

这个属于数据预处理部分,之后会交给 value encoder.

数值变量:先做标准化; 默认使用Gaussian Z-score,候选 Cauchy location–scale 标准化,即 \((x-\mathrm{location})/\mathrm{scale}\)

有序类别变量:按类别数从选定分布(Gaussian 或 Cauchy)抽取随机数,排序后依据原有序关系逐一绑定,因此保留序关系。

无序类别变量:从选定分布(Gaussian 或 Cauchy)为每个类别直接独立抽取随机数并绑定,不排序,因此不引入伪序。

以上三种处理都先得到一个标量值,再统一经过 Fourier encoding 得到 Value Token。

缺失值使用一个可学习的全局 Value Token;文本语义编码暂不接入。