稠密表格 · Unit × Feature
几乎每个 Unit 都与每个 feature 发生一次可记录的取值关系。
Mask 的含义:模型本来知道这格的真实值,只是在进入 encoder 前暂时拿走,用它检验能否由同一 Unit 的其他 feature evidence 恢复。
P11 把表格写成一张 Unit × Feature 的稠密显式响应矩阵。推荐系统共享 row–column–cell 的计算几何,却通常来自稀疏、受 exposure policy 选择的 User × Item 交互日志。相似的是接口;真正不同的是观测如何产生。
表格大模型可以借用推荐系统的“Unit 表征 + query 表征 → response”结构,但不能把推荐日志误读成从一张稠密表里随机删掉绝大多数 cells。
在 P11 的默认任务里,task 已声明 one row per Unit。每列是一种 feature query,每个 recorded cell 是这个 Unit 在该 feature 上的显式 typed response。训练时遮住一格,是在一张原本完整或近完整的表中人工造题。
几乎每个 Unit 都与每个 feature 发生一次可记录的取值关系。
Mask 的含义:模型本来知道这格的真实值,只是在进入 encoder 前暂时拿走,用它检验能否由同一 Unit 的其他 feature evidence 恢复。
每个 User 通常只被曝光或选择极少量 items。
Missing 的含义:一格空白可能表示没有曝光、没有选择、没有记录或尚未实现;它通常不是一个已知的 0,也不是从完整矩阵中独立随机删掉的值。
共同的计算接口非常干净:从当前 Unit 已观测的 pairs 形成表征,再把它与一个 feature/item query 配对,输出相应 response distribution。
都可以从 visible evidence 即时计算,而不是依赖一张只服务训练 IDs 的 row lookup table。
P11 用 LLM(description) 产生 semantic feature token;RecSys 常用 item ID、content 或二者组合。
两者都学习 Unit–query response;P11 的 response 还必须尊重 numeric、binary、categorical 的 feature-local 类型。
稀疏度不只是存储格式差异。它改变了 missing cell 的语义、可用的监督、合理的 loss,以及模型是否必须显式处理 exposure 与 selection。
| 对象 | P11 稠密表格 | 典型推荐系统 |
|---|---|---|
| Row | task 默认声明 one row per Unit | User / account / persistent Unit |
| Column | 异质 feature;每列有自己的语义、dtype 与 value space | Item / action candidate;常共享一种反馈类型 |
| Recorded cell | 显式 typed value;二元 0 是真实 response | 曝光后的 click、rating、purchase 或其他 interaction |
| Unobserved cell | natural missing,或训练时暂时隐藏的已知真值 | 可能未曝光、未选择、未记录;通常不能直接当负例 |
| Training query | 从 recorded cells 中拿走 target,再用其真值监督 | 预测未见 item response,常需处理 exposure / sampling |
| Reference loss | numeric MSE、binary BCE、feature-local categorical CE | pointwise、pairwise 或 ranking objective,取决于反馈与展示机制 |
P11 的 artificial mask 负责把一张稠密表编译成学习 episode;推荐日志的 observation mask 则由真实 exposure、choice 与 logging process 共同生成。两种 mask 可以长得一样,却不代表同一个数据生成过程。
P11 接受“相似 Units 对相同或语义相近 queries 产生相似 responses”的归纳偏置,但不照搬 user-ID lookup、implicit negative sampling 或统一 rating head。
Visible cells 不负责重新判断“这行是谁”;它们负责恢复这个 Unit 的 response-relevant representation (h_u) 与其在共享结构中的位置。新 row 不查 ID 表,仍可由自己的 feature profile 即时形成表征。
这里的 interaction 是广义的 Unit–Feature 取值或响应关系。遮住一列再恢复它,默认仍是 observational prediction;只有额外声明 action、mechanism 与 identification contract,才进入 intervention。
稠密覆盖为每个 Unit 提供丰富 evidence;LLM-derived feature tokens 又让不同 schemas 中语义相近的 columns 有机会进入共享 feature space。模型由此可以学习一套跨 feature queries 复用的 Unit representation 与 typed response rule——但跨表共享、unseen-schema transfer 和性能仍必须由实验单独证明。