回答“当前这个 benchmark 在什么模式下怎样比较模型”。保存 live 入口、dated snapshot、protocol lens 和跨模型观察。
每套评测协议,拥有自己的观察子页
当前先建立 TabArena 与 BeyondArena 两个正式子页;后续还会继续接入 RamanBench、time-series 等 benchmark,但每一项都要先冻结来源和协议。Dataset Atlas 是跨 benchmark 的 protocol 工具,不冒充排行榜。
TabArena 竞技场
连接官方实时 leaderboard,并保存 P11 核心模型的带日期快照、读榜镜头、版本/补值/预算警告与逐篇资料入口。
进入 TabArena 子页 → ACTIVE CHILD PAGEHOLISTIC BENCHMARK · BEYOND IIDBeyondArena
142 个精选数据集,覆盖 IID、temporal、grouped tasks、不同样本和维度规模,以及 text / high-cardinality 等复杂特征类型。
进入 BeyondArena 子页 → PROTOCOL TOOLP11 DATASET ATLASDataset、task compiler 与 protocol
追踪数据来源、target construction、split、HPO、contamination 与适用范围,为所有 benchmark 子页提供审计底座。
打开 Dataset Atlas → DISCOVERY QUEUEMORE BENCHMARKSRamanBench · Time-series · Your Benchmark
官方 Space 已经暴露更多评测入口。P11 会逐项核验后建立独立子页,不在总入口里把不同协议压成一张混合榜。
查看官方 benchmark 生态 ↗没有这十二项,就不转述一个“更强”
每个 benchmark 子页都应把一次观察封印成可复核的 comparison passport。动态榜单变化时,我们更新观察记录,而不是偷偷把旧数字当成静态事实。
Benchmarks 与 References 是两棵互相连接的树
Benchmarks 负责比较问题与动态观察;References 负责单篇论文/项目材料、技术细节和笔记。TabArena 同时出现在两棵树里,但页面职责不同。
回答“TabArena 这篇论文和项目到底是什么”。保存文献身份、官方材料、P11 relevance、证据边界、阅读路径与笔记。
总入口可以继续长,但不能把不同 protocol 混成一个榜
新增 benchmark 子页前,先过四个门
- 有明确、稳定、可回读的官方来源,而不是一张二手截图。
- 能写清 evaluation regime、数据范围、metric 与预算,不把模型名次脱离协议。
- 动态结果带观察时间和版本;静态论文结论与 live state 分开。
- 与对应 reference dossier 双向连接,但不把 benchmark 观察伪装成论文技术文章或独立复现。