P11 · BENCHMARKS · BEYONDARENA

BeyondArena

TabArena 的全面进阶 benchmark:把评测从熟悉的中小型 IID 表格,扩展到 temporal、grouped、large、high-dimensional,以及含 text / high-cardinality 特征的复杂任务。它不只是“更多数据集”,而是主动改变评价问题。

Observed 2026-07-31 · arXiv v1 · noindex · 不是 P11 独立 benchmark run

01 · SCOPE

142 个数据集只是表面,关键是覆盖了哪些困难轴

官方论文把 BeyondArena 定义为 unified holistic benchmark。它跨 task type、样本规模、特征维度和 feature type 组织评测,并用统一软件与 metadata schema 降低不同社区协议碎片化的问题。

142curated datasets;不是随意抓取的表格集合
11论文首轮结果覆盖的模型数量
3核心 task regimes:IID、temporal、grouped
官方摘要还明确覆盖:不同 sample-size / feature-dimensionality scale,以及含 text、high-cardinality 特征的数据。各子集的比较必须保留自己的过滤条件。
02 · EVALUATION REGIMES

它把“表格任务”拆回不同的数据生成与部署结构

IID

同分布预测

与标准 benchmark 最接近,仍要按规模、任务和模型兼容范围细分。

TEMPORAL

按时间前后评测

训练与测试来自不同时间段;随机 IID split 无法替代真实的时间外推问题。

GROUPED

按实体/群组隔离

避免同一 group 的近重复结构同时进入训练与测试,更接近 new-group generalization。

SAMPLE SCALE

从 tiny 到 large

foundation model 的推理便利与传统训练式模型的规模优势可能在这里换位。

DIMENSIONALITY

低维到 high-dimensional

特征数、样本数与模型 context / memory contract 共同决定兼容性。

FEATURE TYPES

text 与 high cardinality

复杂 feature type 被纳入 benchmark,不等于模型已经获得语义 grounding;仍需看编码、缺失和任务协议。

03 · DATA FOUNDRY

可扩展 benchmark 需要数据与协议的共同底座

BeyondArena 同时引入 Data Foundry:用于整理 predictive tabular datasets 的 Python framework 与 metadata schema。对 P11 来说,这比一张更大的榜单更重要,因为它使数据来源、task 构造与 split regime 成为可审计对象。

WHY A FOUNDRY

让跨领域任务进入同一种描述语言

如果每个社区都用自己的脚本、命名和过滤规则,模型研究者只能看到结果,无法重放协议。Data Foundry 尝试把 dataset curation 和 benchmark construction 产品化。

1Curate datasets保留来源、license、feature/target 语义与适用范围。
2Compile tasks把同一原始数据变成声明清楚的 prediction problem。
3Declare regimesIID、temporal、grouped split 不是同一个 evaluation object。
4Run comparable pipelines记录模型版本、预算、覆盖率、时间与硬件。
04 · PAPER-LEVEL RESULT

首轮结果不是“TFM 失效”,而是优势区域被重新定位

以下只转述 BeyondArena 论文摘要中的结果,不是 P11 独立复现,也不替代 live leaderboard 的当前状态。

TFMs 仍擅长 tiny-to-medium IID data

这与标准 benchmark 中观察到的优势一致,但优势结论被限定在数据规模和 regime 内。

传统 tree-based 与 deep learning 在更困难区域仍占优

论文报告它们在 non-IID、large、high-dimensional datasets 上保持主导;这正是扩展 benchmark 的研究价值。

05 · HOW TO COMPARE

读 BeyondArena 时,先选择一个切片

不要先问“总榜第一是谁”,先问哪种 deployment challenge 是我们要解决的。下面是进入任何结果表前的最小切片。

问题轴必须记录为什么
RegimeIID / temporal / grouped决定 train/test 的关系和外推对象
Scalerows × features决定 context、memory 与训练成本
Feature typenumeric / categorical / text / high-cardinality决定输入处理和模型兼容范围
Task & metricclassification / regression + exact metric避免把不同预测问题聚合成模糊冠军
Pipelinedefault / tuned / ensembled + budget区分模型结构与搜索/集成收益
Coveragecompleted、failed、imputed失败模式本身就是 deployment evidence
Snapshotobserved_at、paper/Space/code versionliving benchmark 的结果会变化
06 · EVIDENCE BOUNDARY

更广不等于无边界

不要从 BeyondArena 多推一步

  • 142 个 curated datasets ≠ 全部现实表格任务。 未被纳入的领域、目标和 deployment constraints 仍在边界外。
  • 多种 regime ≠ 一个可随意聚合的总分。 IID、temporal 与 grouped 的 learned object 和失败原因不同。
  • 含 text feature ≠ 已证明 semantic grounding。 benchmark 支持一种输入类型,不自动解释模型怎样使用语义。
  • 论文首轮 11 模型结果 ≠ live state。 新模型、代码与数据修订必须回到官方 Space 和版本记录核对。
  • 预测泛化 ≠ causal / intervention / counterfactual capability。 BeyondArena 扩展了预测 regimes,没有替 P11 证明因果 learned object。
07 · PRIMARY MATERIALS

官方材料与 P11 入口

PAPER

Beyond IID: How General Are Tabular Foundation Models, Really?

arXiv:2606.30410v1 · submitted 2026-06-29。

打开论文 ↗

LIVE ARENA

TabArena leaderboard Space

进入官方 Space 后选择 BeyondArena;实时来源优先于本页说明。

打开 Arena ↗

DATA

TabArena / BeyondArena dataset

用于追踪数据、配置与官方公开制品。

打开 dataset ↗

P11 DOSSIER

Beyond IID 单篇资料页

保存论文身份、P11 relevance、reading path 与笔记。

进入资料页 →