OWNER-REVIEW · BROWSER NOTES STAY LOCAL
必读 · 2024-10-23

TabDPT: Scaling Tabular Foundation Models on Real Data

Junwei Ma et al.
NeurIPS 2025 · peer-reviewed paper · arXiv:2410.18164v3

必读预训练核心模型评测
TECHNICAL DETAILS

这份资料下面的技术细节文章

技术文章属于当前资料,不与 P11 研究项目入口平级。

暂无技术细节文章

以后针对这份资料形成的代码解读、公式拆解或机制实验,都会继续落在本资料页下面。

WHY NOW

为什么现在读它

TabDPT 用 123 个真实 OpenML tables、retrieval 与 self-supervision 研究 real-data scaling,是 synthetic-only 路线的重要对照。

LEARNED OBJECT

它真正学习或预测的对象

从真实表格产生的 classification/regression episodes 中预训练的 context-conditioned predictor。

P11 USE

P11 可以从这里拿走什么

审计 physical table、target selection、retrieval、context/query partition 与 overlap,并复用其开放训练/推理 pipeline。

EVIDENCE BOUNDARY

不要从这篇论文多推一步

真实预训练数据可能带来语义和分布信号,也可能带来 contamination;power-law trend 不能单独证明 foundation-level generalization。

READING PATH

建议阅读路径

  1. 先看 123 tables 如何变成大量训练 tasks。
  2. 再看 retrieval、SSL 与 real-vs-synthetic ablation。
  3. 最后审计 benchmark overlap、scale units 与开放代码。
P11 INTERNAL MATERIAL

已有项目材料

  • 当前没有下载到仓库的第三方原文;先使用上方一手链接。
MY READING NOTE

我的浏览器便笺

可以马上写、刷新后继续。它不上传到服务器,也不会自动进入 P11 的 canonical source。

尚未读取到当前浏览器中的已保存草稿。

保存边界:只保存在当前 browser profile + 当前 origin。localhost 与 wehub.us 是两份笔记;换设备、隐私模式或清理网站数据都可能丢失。长期保存请导出 Markdown 并回填到上面的 canonical path。