同分布预测
与标准 benchmark 最接近,仍要按规模、任务和模型兼容范围细分。
TabArena 的全面进阶 benchmark:把评测从熟悉的中小型 IID 表格,扩展到 temporal、grouped、large、high-dimensional,以及含 text / high-cardinality 特征的复杂任务。它不只是“更多数据集”,而是主动改变评价问题。
Observed 2026-07-31 · arXiv v1 · noindex · 不是 P11 独立 benchmark run
官方论文把 BeyondArena 定义为 unified holistic benchmark。它跨 task type、样本规模、特征维度和 feature type 组织评测,并用统一软件与 metadata schema 降低不同社区协议碎片化的问题。
与标准 benchmark 最接近,仍要按规模、任务和模型兼容范围细分。
训练与测试来自不同时间段;随机 IID split 无法替代真实的时间外推问题。
避免同一 group 的近重复结构同时进入训练与测试,更接近 new-group generalization。
foundation model 的推理便利与传统训练式模型的规模优势可能在这里换位。
特征数、样本数与模型 context / memory contract 共同决定兼容性。
复杂 feature type 被纳入 benchmark,不等于模型已经获得语义 grounding;仍需看编码、缺失和任务协议。
BeyondArena 同时引入 Data Foundry:用于整理 predictive tabular datasets 的 Python framework 与 metadata schema。对 P11 来说,这比一张更大的榜单更重要,因为它使数据来源、task 构造与 split regime 成为可审计对象。
如果每个社区都用自己的脚本、命名和过滤规则,模型研究者只能看到结果,无法重放协议。Data Foundry 尝试把 dataset curation 和 benchmark construction 产品化。
以下只转述 BeyondArena 论文摘要中的结果,不是 P11 独立复现,也不替代 live leaderboard 的当前状态。
这与标准 benchmark 中观察到的优势一致,但优势结论被限定在数据规模和 regime 内。
论文报告它们在 non-IID、large、high-dimensional datasets 上保持主导;这正是扩展 benchmark 的研究价值。
不要先问“总榜第一是谁”,先问哪种 deployment challenge 是我们要解决的。下面是进入任何结果表前的最小切片。
| 问题轴 | 必须记录 | 为什么 |
|---|---|---|
| Regime | IID / temporal / grouped | 决定 train/test 的关系和外推对象 |
| Scale | rows × features | 决定 context、memory 与训练成本 |
| Feature type | numeric / categorical / text / high-cardinality | 决定输入处理和模型兼容范围 |
| Task & metric | classification / regression + exact metric | 避免把不同预测问题聚合成模糊冠军 |
| Pipeline | default / tuned / ensembled + budget | 区分模型结构与搜索/集成收益 |
| Coverage | completed、failed、imputed | 失败模式本身就是 deployment evidence |
| Snapshot | observed_at、paper/Space/code version | living benchmark 的结果会变化 |
arXiv:2606.30410v1 · submitted 2026-06-29。
进入官方 Space 后选择 BeyondArena;实时来源优先于本页说明。
用于追踪数据、配置与官方公开制品。
保存论文身份、P11 relevance、reading path 与笔记。