Feature semantics
变量 identity 不只来自本表 column ID,而可以由名称、描述和类型共同给出,使不同 schemas 之间存在语义接口。
P11 研究的不只是“哪个表格模型更强”,而是一个更基础的问题:模型能否理解每个变量在说什么, 从一组可见 cells 判断当前面对的是怎样的 Unit,并学习 Unit 与 feature 之间可跨表复用的 response law? 在这条 broad line 上,P05 进一步追问:当 feature axis 变成超高维、动态、不定长且稀疏时, 能否让计算随 active evidence 扩展,而不再被固定最大列数锁死?
WeHub public owner-review research project · noindex · not a formal release
一张表通常只被写成 rows 和 columns。P11 进一步区分三个对象:变量的语义、当前 Unit、 以及这个 Unit 对目标变量的 response。项目希望把这三个对象放进同一套可跨 schema 学习的模型中。
变量 identity 不只来自本表 column ID,而可以由名称、描述和类型共同给出,使不同 schemas 之间存在语义接口。
新 row 不查 row-ID embedding;模型从当前可见 feature–value evidence 中即时形成 Unit token。
Unit token 与目标 feature token 配对,回答“这个 Unit 对这个 feature 会产生什么 response”。
项目的核心不是给模型再加一个 embedding,而是先分清:我们测量什么、正在面对谁、以及它会如何响应。
每个入口承担不同职责。项目首页只说明全局关系;技术细节进入文章,单篇文献进入资料页,模型比较进入 benchmark 页面。
稳定编号 owner questions,逐题区分 owner draft、needs clarification 与 source-grounded working answer;每页绑定 evidence cutoff 和 verification gates。
进入核心问题清单 → CURRENT MODEL · TECHNICAL ARTICLE完整保留原入口的张量流、默认/扩展分支、typed objectives、排列不变性、训练/推理和证据边界。
阅读模型架构长文 → VALUE ENCODER · TECHNICAL ARTICLE从 affine scalar、PLE 与 periodic/PLR 三种输入几何,解释数值 Token 怎样改变可学习性;把强实证、谱偏差理论桥与尚未证明的机制明确分开。
阅读数值 Token 技术分享 → LEARNED ALGORITHM · TECHNICAL ARTICLE从 PFN 的 posterior-predictive objective、SCM synthetic prior 与 TabPFN benchmark,解释逐表拟合怎样被摊销进预训练,以及“一次前向”的真实系统边界。
阅读摊销推断技术分享 → RESEARCH FRONTIER · TECHNICAL ARTICLE把 TabPFN / TabFM 的可泛化 table-native topology,与真实表格的列名、单位和列间关系放进同一个可审计的研究问题;不把 ConTextTab 的语义路线简化成“只换一个 embedding”。
阅读研究缺口与第一轮实验协议 → FOLLOW-ON SLOT · P05把 P11 的 semantic-feature / Unit-response question 推到 variable-length sparse evidence;以推荐系统作为第一压力测试,不把 known-ID 推荐冒充 Unit Abduction。
进入 P05 owner-review seed → BENCHMARKS从评测 regime、数据与预算出发,再进入 TabArena、BeyondArena 等独立观察页。
打开 Benchmarks → RELATED MATERIALS · 24 ITEMS重要资料按时间倒序排列;每篇拥有独立资料页,核心模型还连接专属 Discord 反馈 thread。
进入资料工作台 → DATASET ATLAS区分 synthetic priors、真实表格、split、HPO、contamination 与评测协议。
查看 Dataset Atlas → DATA LANDSCAPE从 raw tables 到 prediction-problem corpus,理解 pretraining data 的构造对象。
阅读数据综述 → CONCEPTUAL BRIDGE比较 Unit–Feature response table 与 exposure-selected User–Item log:计算接口相似,空白 cell 的机制不同。
阅读五分钟概念桥 → HISTORICAL PROVENANCE保留 per-dataset feature-ID 分支的思想演化记录;它已经不代表当前 v1 主干。
打开历史 PDF →先写清 P11 的 description protocol、LLM regime、table episode sampler、目标类型与 adaptation contract;再为 P05 单独定义 active sparse evidence、latent bottleneck、feature vocabulary 与动态 schema protocol,最后用 permutation equality、semantic-transfer ablation 和 scaling benchmark 检验两条边界。
项目页面只报告当前可验证状态;新实验和新论文结论必须回到 canonical source 与 evidence ledger。先读本页的研究问题与当前状态,再从主线核心问题选择一个长期 gate;随后进入模型架构、数值 Token、TabPFN 摊销推断、语义研究缺口、推荐系统概念桥与 P05 follow-on。
主线核心问题 · 当前模型架构 · 数值怎样成为 Token · TabPFN 摊销推断 · 语义研究缺口 · Dense table vs recommender · P05 动态稀疏 follow-on
先在 Benchmarks 固定 comparison passport,再用 Dataset Atlas 审计数据与 protocol。