OWNER-REVIEW · BROWSER NOTES STAY LOCAL
背景支撑 · 2025-07-05

Real-TabPFN: Improving Tabular Foundation Models via Continued Pre-Training With Real-World Data

Anurag Garg, Muhammad Ali, Noah Hollmann, Lennart Purucker, Samuel Müller, Frank Hutter
arXiv · arXiv preprint v1 · arXiv:2507.03971v1

背景支撑预训练评测核心模型
TECHNICAL DETAILS

这份资料下面的技术细节文章

技术文章属于当前资料,不与 P11 研究项目入口平级。

暂无技术细节文章

以后针对这份资料形成的代码解读、公式拆解或机制实验,都会继续落在本资料页下面。

WHY NOW

为什么现在读它

它直接比较纯 synthetic pretraining 与少量 curated real tables 的 continued pretraining,暴露真实数据价值和 contamination 风险。

LEARNED OBJECT

它真正学习或预测的对象

在 TabPFN synthetic prior 之上继续吸收真实表格规律的预测器。

P11 USE

P11 可以从这里拿走什么

把 real-data curation、table lineage、target construction 与 benchmark overlap 纳入 provenance passport。

EVIDENCE BOUNDARY

不要从这篇论文多推一步

真实数据带来的精度提升不自动说明学到了可迁移语义或机制;curation 与 overlap 边界决定结论强度。

READING PATH

建议阅读路径

  1. 先看 real pretraining corpus 的规模与筛选。
  2. 再比较 curated real data、CommonCrawl 与 GitTables 分支。
  3. 最后核对下游 29 个数据集的 overlap audit。
P11 INTERNAL MATERIAL

已有项目材料

  • 当前没有下载到仓库的第三方原文;先使用上方一手链接。
MY READING NOTE

我的浏览器便笺

可以马上写、刷新后继续。它不上传到服务器,也不会自动进入 P11 的 canonical source。

尚未读取到当前浏览器中的已保存草稿。

保存边界:只保存在当前 browser profile + 当前 origin。localhost 与 wehub.us 是两份笔记;换设备、隐私模式或清理网站数据都可能丢失。长期保存请导出 Markdown 并回填到上面的 canonical path。