P11 · BENCHMARKS · EVALUATION PROTOCOLS

Benchmarks

先说明我们在什么数据、任务、预算和运行协议下提问,再看模型排第几。这里是 P11 的评测总入口;每一个 benchmark 都有自己的子页、动态来源和可外推边界。

WeHub public owner-review evaluation navigation · noindex · 不是新的 benchmark run 或性能发布

01 · BENCHMARK CATALOG

每套评测协议,拥有自己的观察子页

当前先建立 TabArena 与 BeyondArena 两个正式子页;后续还会继续接入 RamanBench、time-series 等 benchmark,但每一项都要先冻结来源和协议。Dataset Atlas 是跨 benchmark 的 protocol 工具,不冒充排行榜。

02 · COMPARISON PASSPORT

没有这十二项,就不转述一个“更强”

每个 benchmark 子页都应把一次观察封印成可复核的 comparison passport。动态榜单变化时,我们更新观察记录,而不是偷偷把旧数字当成静态事实。

01 · REGIMEIID / temporal / groupeddeployment 假设先于排名
02 · TASKclassification / regression预测对象不能混聚
03 · DATASET SET数量、来源、筛选包含哪些,排除哪些
04 · SPLITtrain / validation / test重复次数与 leakage audit
05 · METRICscore / Elo / rank聚合方法回答什么问题
06 · MODEL VERSION名称 + exact version相似名称不能强配
07 · PIPELINEdefault / tuned / ensemble结构与训练协议分开
08 · BUDGETHPO 与 time budget公平比较的资源边界
09 · COVERAGEcompleted / imputed %补值不冒充真实运行
10 · VERIFICATIONverified by whom不等于我们独立复现
11 · COMPUTEhardware + train/predict time把部署成本带回来
12 · SNAPSHOTobserved_at + source version实时来源优先于快照
最低转述格式:在「哪套 benchmark / 哪个版本 / 哪个过滤视图 / 哪种 pipeline / 哪个预算 / 什么覆盖率」下,模型在「哪个指标」上呈现「什么结果」。
03 · INFORMATION ARCHITECTURE

Benchmarks 与 References 是两棵互相连接的树

Benchmarks 负责比较问题与动态观察;References 负责单篇论文/项目材料、技术细节和笔记。TabArena 同时出现在两棵树里,但页面职责不同。

P11 → Benchmarks → TabArena

回答“当前这个 benchmark 在什么模式下怎样比较模型”。保存 live 入口、dated snapshot、protocol lens 和跨模型观察。

P11 → References → TabArena

回答“TabArena 这篇论文和项目到底是什么”。保存文献身份、官方材料、P11 relevance、证据边界、阅读路径与笔记。

04 · GOVERNANCE BOUNDARY

总入口可以继续长,但不能把不同 protocol 混成一个榜

新增 benchmark 子页前,先过四个门

  • 有明确、稳定、可回读的官方来源,而不是一张二手截图。
  • 能写清 evaluation regime、数据范围、metric 与预算,不把模型名次脱离协议。
  • 动态结果带观察时间和版本;静态论文结论与 live state 分开。
  • 与对应 reference dossier 双向连接,但不把 benchmark 观察伪装成论文技术文章或独立复现。