先分 classification / regression
All Tasks 会把不同预测对象聚合。binary、multiclass 与 regression 的相对强弱可能相反。
这是 P11 Benchmarks 下的一个独立 benchmark 子页,不是全部 benchmark 的总称。它帮助我们观察 TabFM、TabPFN、LimiX、TabICL 等核心模型: 一键进入 TabArena 实时榜单,同时把榜单模式、模型版本、调参与集成、缺失运行和计算成本放回同一个判断框架。
WeHub public owner-review research navigation · noindex · 不是独立复现、官方镜像或性能结论
TabArena 是面向 IID tabular prediction 的 living benchmark。它把可验证的开源实现放进统一的 validation、HPO、cross-validation、ensembling、refit、时间与硬件记录中;不同页面设置会给出不同的排名问题。
用户给出的 TabArena Spaces 地址 ↗ 当前落在组织的 Spaces 列表;真正的 live leaderboard 是下面这个 Space。
下表只摘录 P11 当前关心的模型,便于从榜单回到逐篇资料。它不代表全部参赛模型,也不把相似名称下的不同版本强行视为同一个模型。
| # | 模型 | 榜单 pipeline | Overall Elo | 覆盖提示 | P11 资料 |
|---|---|---|---|---|---|
| 01 | TabFM | default | 1765 | live readback | 资料页 → |
| 02 | TabPFN-3 | default | 1641 | live readback | 资料页 → |
| 03 | TabPFN-2.6 | default | 1593 | 资料页对应 2.5;版本不可强配 | 2.5 资料 → |
| 04 | RealTabPFN-2.5 | tuned + ensembled | 1573 | pipeline 不同于 default | 资料页 → |
| 05 | TabICLv2 | default | 1570 | live readback | 资料页 → |
| 06 | TabDPT | tuned + ensembled | 1437 | pipeline 不同于 default | 资料页 → |
| 07 | LimiX | default | 1344 | live readback | 资料页 → |
| 08 | Mitra | default | 1312 | 部分 imputed | 资料页 → |
| 09 | TabICL | default | 1307 | 部分 imputed | 资料页 → |
| 10 | TabSTAR | tuned | 1088 | pipeline 不同于 default | 资料页 → |
“部分 imputed”表示该模型未在全部数据集完成真实运行,榜单以默认 RandomForest 结果补齐缺口并施加覆盖惩罚。请在实时榜单切换 Include imputed models 核对影响。
TabArena 最有价值的不是给出单一榜首,而是把容易被论文摘要隐藏的 protocol 变量显式化。下面六个镜头是 P11 每次比较模型时的最低读榜合同。
All Tasks 会把不同预测对象聚合。binary、multiclass 与 regression 的相对强弱可能相反。
表格 FM 往往在小数据预算更占优;总体榜不能替代按规模读取,也不覆盖所有 large-table regime。
模型结构、HPO 与 cross-model/cross-fold ensemble 是不同对象;必须把 pipeline 一起写进结论。
没有跑完全部数据集的模型会触发补值。补齐后的 Elo 适合导航,不等于全覆盖的直接实测。
同时检查 average rank、harmonic rank、win-rate matrix 与 improvability,避免只追逐一个聚合数。
训练/预测时间和硬件条件是结果的一部分。准确率相近时,部署成本可能改变实际选择。
这些链接进入 P11 的单篇资料页:先确认论文与代码版本,再看 learned object、证据边界、阅读路径和已有技术拆解。
官方生态已经把视野扩展到 BeyondArena、RamanBench、time-series 与自定义 benchmark。P11 需要先声明 deployment regime,再决定哪个榜单具有外部效度。
适合比较统一 pipeline 下的经典 ML、深度模型和 TFMs,也是本页快照的来源。
官方代码说明该基准覆盖 142 个数据集,并计划逐步取代 v0.1 IID 范围。不要用旧范围回答新 regime。
回到 corpus、task compiler、split、HPO 与 contamination,判断一个排名到底支持哪层 claim。
动态模型、数据集、过滤器、version history 与指标视图。
理解 curation、validation、HPO、ensembling 与结论边界。
统一训练评测代码、数据处理与 BeyondArena 的当前入口。
Space、datasets 与组织下的相关公开材料。
论文身份、P11 relevance、evidence boundary、阅读路径与笔记入口。
按首次公开时间倒序查找 24 篇材料,并进入各自资料与技术文章。