HCGM opponent essentials · 逐篇深读 · 面向读者的解释

Assessing Estimate of CATE from Observational Data via an RCT Study

这篇论文解决的不是“怎样估计 CATE”,而是下一道经常被跳过的问题:一个在大规模观察数据上训练出的 CATE 模型,怎样接受独立随机试验的外部考试?作者提出 CAFE,把 RCT 人群按 propensity score、预测 CATE 或其他预先确定的规则分组,比较每组的随机试验平均治疗效应与模型在该组的平均预测,再把这些 standardized gaps 汇总成 goodness-of-fit test。它能发现 组层面的不兼容 ,但不能看见个人真实 treatment effect,也不能仅凭一次 rejection 就断言存在未观测混杂。

01 · Misconception repair

先拆掉最容易产生的误会

第一误会:有了 RCT,就能逐个核对每个人的 \(Y_i(1)-Y_i(0)\)。不能。RCT 仍然只观察每个人的一个 potential outcome;CAFE 把个体预测聚合到 subgroup,再用组内 treated-control contrast 作为可估计的随机化证据。

第二误会:CAFE 不拒绝,就证明 observational CATE 正确。统计检验只能说“当前 RCT、当前 partition 和当前 power 没有发现不兼容”。预测误差若在组内正负抵消、发生在很小区域、落在 RCT support 之外,或 RCT 太小,模型仍可能通过。

第三误会:CAFE 拒绝,就证明 OS 有 hidden confounding。拒绝只说明 \(\widehat\tau_O\) 与 RCT benchmark 不兼容。模型 misspecification、有限样本不稳定、OS/RCT treatment-effect transport 失败、变量或 outcome 定义不一致、trial implementation 差异,也可能产生同样现象。

第四误会:论文第二阶段直接检验了未观测混杂。它实际检验的是模型是否拟合 observational conditional treatment difference,即 CATD。若模型能拟合 CATD、却与 RCT CATE 不相容,作者在额外假设和足够 power 下把剩余差异归因于 confounding;这是一种排除式诊断,不是直接观测了 confounder。

第五误会:CAFE 等于 TOC、RATE 或 policy value evaluation。CAFE 主要问预测的效应幅度是否按组校准;TOC/RATE 主要问 priority score 是否把更高效应者排在前面。一个模型可能排序正确但效应幅度整体夸大,也可能粗分组校准尚可却在组内排序很差。

第六误会:论文已经提供可完全复核的理论和实现包。当前 arXiv v1 的 PDF 给出六个 theorem statements 和一个 proposition,但证明、额外 covariate-shift/proxy experiments、related work 与实现细节被指向 supplementary material;官方 source archive 中没有该 supplement,也没有实验代码。因此本页只能审读定理的陈述与条件,不能声称证明或结果已独立复现。

02 · Objective verdict

先给一个客观判决

这是一篇抓住真问题的方法论文。现代 HTE 工作大量关注更灵活的 CATE learner,却很少正面回答“模型训练完以后,怎样知道它因果上 fit 得够不够好”。CAFE 的好处是把验证对象从整套 outcome model 收窄到 CATE function,并允许把 observational learner 当作可查询的 black box;只要有独立 RCT,就能用随机化证据做 subgroup calibration test。

但它离“CATE 的通用验收标准”还有距离。证据是 coarse group averages,不是 pointwise truth;理论依赖较强的 transportability、common support、partition、moment、group-size 和 OS/RCT sample-rate 条件;hidden-confounding attribution 比 abstract 的措辞更条件化。最准确的定位是:一个很有启发性的 RCT-grounded CATE lack-of-fit detector,以及一份值得继续补齐的 v1 理论原型

03 · Mental model

一个直观世界

想象一家医院用十万条历史病历训练了一个模型,预测每位病人服用新药相对旧药的收益。模型对患者甲给出 \(+6\),对乙给出 \(-1\)。历史病历很大,却可能因为医生把新药优先给了更严重的病人而带有 hidden confounding;我们没有任何人的两个 potential outcomes,普通 train/test loss 也无法验证预测的是 causal effect。

现在另有一个独立、规模较小的 RCT。CAFE 不尝试逐人对答案,而是做一场分组考试:

  1. 只用 treatment 之前的 covariates 或一个与 RCT outcomes 独立的外部模型,把 trial participants 分成若干组。
  2. 在每组计算随机试验的 treated-control outcome difference。
  3. 在同一组计算历史模型的平均 CATE prediction。
  4. 看两者相差多少个标准误,并跨组汇总。

如果模型在五组都与 RCT 大体一致,CAFE 没有证据拒绝它;如果模型只在最优先治疗的一组严重夸大,CAFE-M 会盯住最大的 standardized gap。这里的关键不是 RCT 为每个人揭示真值,而是 randomization 让组平均因果效应成为可信的外部标尺。

04 · Real setup

真实问题与实验设定

论文采用 binary treatment 的 potential-outcome 设定:

\[Y=AY(1)+(1-A)Y(0), \qquad \tau(x)=E\{Y(1)-Y(0)\mid X=x\}.\]

有两种数据源:

数据源 可见对象 主要优势 主要风险
Observational study, size \(m\) 预训练 \(\widehat\tau_O(x)\)、通常还有 \(\widehat e_O(x)\);原始训练数据甚至可以不可访问 大样本、允许 flexible learner hidden confounding、model misspecification、regularization 与 finite-sample instability
Independent RCT, size \(n\) \((X,A,Y)\),trial propensity 通常已知 internal validity,组平均效应可估 样本较小、support/人群可能不同、仍无 individual effect truth

作者要求至少满足:RCT assignment validity 与 positivity;OS/RCT 之间的 CATE transportability;RCT covariate support 与 OS support 一致;partition 不使用 RCT potential outcomes;每组人数足够;组内 heterogeneity 与 variance 受控;potential outcomes 有有限八阶矩。正文为简化还使用 homoskedastic error,heteroskedastic extension 被留给未附的技术推导。

这里有两个必须保留的 target distinction:

\[\tau(x)=E\{Y(1)-Y(0)\mid X=x\}\]

是 CATE,而 observational distribution 可以直接识别的

\[\psi(x)=E(Y\mid A=1,X=x)-E(Y\mid A=0,X=x)=\tau(x)+b(x)\]

是 CATD;\(b(x)\) 汇集 unobserved-confounding bias。若 unconfoundedness 成立,二者相同;否则,一个 learner 很可能把 \(\psi(x)\) 学得很好,却仍不是正确的 \(\tau(x)\)

05 · Method walkthrough

方法或任务流程

第一步,冻结 observational learner。把 \(\widehat\tau_O(x)\) 和可选的 \(\widehat e_O(x)\) 当作预训练函数;RCT evaluation sample 不能参与模型训练或 partition 的 outcome-driven tuning。

第二步,在 RCT covariate support 上构造 \(K_n\) 个互不重叠的组 \(P_{R,1},\ldots,P_{R,K_n}\)。论文常用 \(\widehat e_O(X)\) quantiles,也测试 predicted-CATE quantiles 或 RCT-only confounder/proxy;原则是分组必须在看 trial outcomes 之前确定,并保证各组有足够 treated/control units。

第三步,在每组计算 RCT difference in means:

\[\widehat\tau_{R,k}=\overline Y_{1,k}-\overline Y_{0,k}, \qquad \widehat\sigma_k^2=\frac{s_{1,k}^2}{n_{1,k}}+\frac{s_{0,k}^2}{n_{0,k}}.\]

同时计算 observational model 在该组 RCT covariates 上的平均预测:

\[\overline{\widehat\tau}_{O,k} =\frac{1}{n_k}\sum_{i:X_i\in P_{R,k}}\widehat\tau_O(X_i).\]

第四步,形成 standardized discrepancy

\[Z_k=\frac{\widehat\tau_{R,k}-\overline{\widehat\tau}_{O,k}} {\sqrt{\widehat\sigma_k^2}}.\]

CAFE 汇总 distributed lack of fit:

\[T=\sum_{k=1}^{K_n} Z_k^2,\]

并用 \(\chi^2_{K_n}\) 近似校准。CAFE-M 针对 localized lack of fit:

\[M=\max_{1\le k\le K_n}|Z_k|,\]

经论文给出的 extreme-value normalization 后用 Gumbel law 得到 p-value。

第五步,如果保留了独立 observational hold-out set,做 CATD fit test。Stage 1 用 RCT 检验 CATE compatibility;Stage 2 用 OS hold-out 检验同一 parametric family 是否能拟合 \(\psi(x)\)。作者给出三类决策:Stage 1 不拒绝是 D1;RCT 拒绝而 OS 不拒绝是 D2;二者都拒绝是 D3。D2 被解释为 confounding-driven discrepancy,D3 则说明 observational contrast 的 modeling 也不足,但不能排除 confounding。

06 · Worked example

自己走一遍最小例子

继续考虑“只治疗预测收益最高的 20% 人”。先在一个完全独立的 RCT 中,按照 observational CATE score 的 quintiles 分成 \(K=5\) 组。最高 quintile 有 200 人,历史模型在其中预测平均收益为 \(+4.0\)

RCT 在这组观察到:treated 平均 outcome 为 \(12.3\),control 为 \(10.1\),所以

\[\widehat\tau_{R,5}=12.3-10.1=2.2.\]

若 difference-in-means 的 estimated standard error 是 \(0.8\),那么

\[Z_5=\frac{2.2-4.0}{0.8}=-2.25, \qquad Z_5^2=5.06.\]

这一个 top-20% group 就向 CAFE statistic 贡献 5.06;CAFE 再把其他四组的 \(Z_k^2\) 相加,与 \(\chi^2_5\) 比较。CAFE-M 则直接检查 \(\max_k|Z_k|\),所以会特别关注这个最高收益组。

这个结果意味着模型在 top group 的 effect magnitude 与 RCT 不相容;它不意味着每个被排入 top 20% 的人都被错估,也不自动说明 score 的排序没价值。若要检验“排序是否真的带来更高治疗收益”,应另用 TOC/RATE 或 policy-value estimand;若要提高 RCT group estimator 的效率、适应 covariate-adaptive assignment,可考虑 regression adjustment、IPW 或 AIPW,而不是把本文的 raw difference in means 当作唯一选择。

07 · Results and evidence

关键结果与证据层级

理论层面,论文给出两套 null。Parametric case 检验真实 \(\tau(\cdot)\) 是否属于指定 family \(\{f(\cdot;\beta)\}\)。General learner case 则把 null 写成

\[\sup_x|\widehat\tau_O(x)-\tau(x)|=O_p(r_m),\]

即 learner 达到预先声明的 uniform convergence rate。Theorems 1--2 声称 CAFE p-value 在 null 下渐近 Uniform\((0,1)\);Theorems 3--4 在 discrepancy 位于 non-negligible region、组内不发生严重正负抵消等 alternative conditions 下给出 power consistency。Theorems 5--6 给 CAFE-M 的 Gumbel null calibration 与 localized-alternative power。

这些保证不是无条件的。一般 learner 的 CAFE null validity 要求 \(n=o(r_m^{-14/9})\),parametric case 要求 \(n=o(m^{7/9})\);每组最小样本量还须以快于 \(n^{5/7}\) 的速度增长。CAFE-M 的 rate relation 较宽松,但同样依赖 uniform learner error、partition 和 moment assumptions。统计量没有显式加入 OS learner uncertainty;论文通过要求 OS sample 相对 RCT 足够大,让这部分误差在渐近上可忽略。

实证证据分三层:

证据层 设定 论文报告的主要现象
Low-dimensional simulation 3 个 parametric designs;\(m=200,400,800\)\(n=40,80,120\),100 replications null p-values的 QQ calibration 随样本变大改善;misspecified models 的 rejection 增加;learner 与 DGP 匹配程度明显影响结果
Confounder/proxy-aligned partition omitted \(X_5\),比较 propensity、predicted CATE、\(X_5\) partitions,并与 SES 比 用真正 omitted confounder 对齐分组时 power 最高;这说明 partition quality 是方法能力的一部分
High-dimensional simulation \(p=1000,m=500,n=120\);Lasso/XGBoost R/T learners、causal forest nonlinear sparse setting中 causal forest 最稳;linear sparse setting中 Lasso 最稳,XGBoost约 20% 被拒,causal forest表现很差

Tennessee STAR 部分保留 4,218 名随机学生,把原 RCT 随机切成 10% evaluation RCT 与 90% pseudo-observational sample,再人为构造 omitted effect modifier 与 hidden-confounding scenarios。因此它是带真实 covariates/outcomes 的 controlled or semi-synthetic analysis,不是两个独立现实世界 RCT/OS cohort 的外部验证。

STAR unconfounded benchmark 报告的是 100 次重复的平均 p-value:ridge 约 0.29--0.32,causal forest 约 0.41--0.46;linear regression 小于 0.0001,XGBoost R-learner 约 0.02--0.03。加入 race-related omitted effect modifier 后四种 learner 普遍被拒;重新制造 confounding 后多数平均 p-value 较小,但 linear CAFE-M 在不同 \(K\) 下约为 0.055--0.068。这个结果支持“方法能对一些 discrepancy 敏感”,却不能被写成所有 learner、所有 confounding 都有稳定高 power。

08 · Objective review

综合客观评价

论文最强的贡献是把 estimation 与 assessment 分开。它不要求 RCT 大到重新训练最复杂的 CATE model,只要求 RCT 足以提供 group-level experimental contrasts;也不必查看 proprietary learner 的训练细节。这是一种很实用的“外部 randomized audit”思路。

CAFE 与 CAFE-M 的 sum/max pairing也合理:前者对许多组都略有偏差的 dense alternative 更敏感,后者对一两个组严重失配的 sparse alternative 更敏感。用 predicted effect 或 propensity 形成可解释 strata,也比只报一个全局 ATE disagreement 更接近 personalized-treatment use case。

但这篇 v1 最需要克制的是“direct assessment”和“detect unobserved confounders”的措辞。它直接检验的是有限 partition 上的 group-average compatibility;隐藏混杂诊断依赖先接受 transportability、RCT validity、CATD family 与 power conditions。再加上证明 supplement 和代码缺失,当前最合适的态度是:重视问题与方法原型,把定理和 attribution claims 当作需要进一步审稿与复核的正式主张,而不是已经落定的 operational standard。

09 · Limitations

主要局限性

  1. 必须有独立 RCT。 没有 randomized evidence 时,CAFE 不能从 observational data 内部创造可检验的 unconfoundedness。
  2. 需要比正文一句话更细的 effect-transport contract。 RCT 与 OS 人群若在未记录 effect modifier、treatment version、adherence 或 outcome measurement 上不同,拒绝可能反映 transport failure。尤其 Assumption 2 允许 \(Z\) 含 latent effect modifiers;仅有 \(E[Y(1)-Y(0)\mid Z,S=1]=E[Y(1)-Y(0)\mid Z,S=0]\) 并不显然推出两个来源的 \(X\)-conditional effect 相同,还需要 latent modifiers 在给定 \(X\) 后的 source composition 可比,或另一条足以 bridge 到被检验 \(X\)-groups 的条件。
  3. 需要 common support。 RCT 未覆盖的 OS covariate region 完全得不到检验;外推越远,CAFE 越不能保护实际 policy。
  4. 验证是 group-level 而非 pointwise。 同一组内的正负错误可以互相抵消,模型通过也不等于 individual CATE correct。
  5. Power 强烈依赖 partition。 论文自己的 \(X_5\) experiment 显示,只有分组对齐 omitted structure 时 power 才显著提高。
  6. 探索多个 partition 或 \(K\) 会产生 multiplicity。 若看过结果再挑 propensity/CATE/proxy strata 或 \(K=3,4,5\),需要预注册、sample splitting 或多重检验校正;正文没有形成统一选择协议。
  7. General-learner null 需要给定 \(r_m\) 对所谓 black-box model,如果训练细节、复杂度和 convergence rate 都未知,定理条件很难在实践中核验。
  8. OS learner uncertainty 未进入 finite-sample variance。 论文靠 \(m\) 相对 \(n\) 足够大使其渐近可忽略;中小 observational sample 下可能过度 rejection。
  9. 组大小条件与论文实施规则并未字面吻合。 Assumption 3 要求最小组样本为 \(\omega(n^{5/7})\),而 simulations 采用 \(K_n=\lfloor n^{2/7}\rfloor\) 的 quantile groups,等分时每组只是 \(\Theta(n^{5/7})\),不是严格更快的 \(\omega(n^{5/7})\)。因此 paper implementation 并不直接落在 stated theorem condition 内。
  10. CAFE-M 的 small-\(K\) calibration 缺少保障,而且误差可能不是温和的。 Gumbel approximation 是 extreme-value asymptotic,但 simulations 中 \(K=\lfloor n^{2/7}\rfloor\) 实际只有 2--3,STAR 也只试 \(K=3,4,5\)。做一个不代替正式证明的 independent-\(Z_k\) sanity check:当 \(K=2\) 时,论文的 normalization 给 \(a_K\approx0.674,b_K\approx1.483\);若观测到 \(M=2.5\),Gumbel p-value 约为 0.253,而两个独立标准正态的 exact \(\max|Z_k|\) tail 约为 0.0247;对应 5% critical value 约为 5.08 对 2.24。真实组统计量未必独立正态,但这个量级差已经说明:small-\(K\) 情况需要 finite-\(K\) Gaussian/multiplier bootstrap 或专门模拟校准,不能把 asymptotic Gumbel p-value 当作精确小样本 p-value。
  11. Power theorem 偏好单向、非抵消 alternative。 高频 oscillation、窄小区域错误或组内 sign changes 可以逃过 CAFE/CAFE-M。
  12. 正文使用 homoskedastic simplification。 Heteroskedastic derivation 被称为 straightforward,却没有在当前 artifact 中给出。
  13. Raw RCT difference in means 的适用范围需要收紧。 论文 formal Assumption 1 允许 \(e_1(x)\)\(X\) 变化,但 coarse group 内若 assignment probability 不恒定,未调整 difference in means 未必估计 simple group-average CATE;应额外要求完全/组内恒定 randomization,或改用已知 propensity 的 adjusted estimator。
  14. 两阶段 confounding attribution 是间接的,Stage 2 benchmark 本身也需额外识别条件。 Stage 2 不拒绝 CATD family 既可能因为它真的 fit,也可能因为 hold-out 很小、test power 不足;而 coarse observational group 内的 raw treated-minus-control mean 一般不等于组内 \(E[\psi(X)]\),除非分组足够细、组内 balance 成立,或另做 propensity/outcome adjustment。D2 因而不是 hidden confounder 的直接证据。
  15. 第二阶段目前主要是 parametric story,parametric alternative 的写法也需澄清。 Flexible CATD learner、learner-selection uncertainty 和重复使用 data 的 calibration 尚未完整解决。Assumption 9 又要求“parametric estimator”收敛到参数族之外的 \(\tau_c\);若每个有限样本拟合函数都被约束在闭合的同一参数族内,通常 pseudo-true limit 仍在族内,除非参数族不闭、参数发散或 learner 实际未受该族约束。
  16. 现实 discrepancy 不只两类。 Transport、measurement、interference、noncompliance、treatment implementation 与 dataset shift 都可能被“confounding vs misspecification”的二分法遗漏。
  17. Supplementary material 缺失。 正文把 proofs、related work、dependent-covariate/covariate-shift simulations、proxy simulations 和 implementation details 指向 supplement,但当前 PDF/source archive 未包含它。
  18. 没有可执行代码。 Source archive 只有 TeX、bibliography 与 figure files,无法从官方 artifact 重跑 simulation 或 STAR construction。
  19. Simulation replication 数较小。 多数设置只做 100 次重复,难以精细判断 nominal 0.05 calibration、tail behavior 或 learner/partition interaction。
  20. STAR 是 controlled construction,而且并非干净的 iid 外部验证。 它没有验证一个真实 observational hospital model 能否被独立 trial 成功或失败地审计;STAR 原始 assignment 的 classroom/school clustering、可能的 peer interference 与 complete-case filtering 也没有进入正文的 iid variance analysis。
  21. Average p-value 不是 rejection-rate calibration。 STAR tables 不能直接回答 type-I error、power 或 false discovery frequency。
  22. 没有直接评价 decision utility。 Group calibration 即使通过,也不保证 top-q policy、treatment budget 或 regret 最优。
10 · Stronger tests

什么实验会让结论更强

第一,发布正文反复引用的 supplement、完整 proofs、simulation/STAR scripts、environment lockfile 与 raw result seeds,让 theorem assumptions 和 finite-sample claims真正可审计。

第二,在 covariate-adaptive、stratified 与 unequal-probability RCT 中,把 raw difference in means 与 known-propensity IPW、regression adjustment、AIPW 比较,明确每种 group estimator 的 target 与 variance。

第三,预注册 partition 与 \(K\),或用独立 sample 学 partition,再对 propensity、predicted CATE、RCT-only proxy 和 tree-based partitions 做 multiplicity-controlled omnibus test。

第四,系统模拟 transport failure、support mismatch、heteroskedasticity、noncompliance、measurement mismatch、interference、组内 oscillating bias 与 very-small localized bias,区分 false attribution 和 low power。

第五,使用真正独立的 RCT 与 observational cohort 做 prospective audit;在 publication 前冻结 \(\widehat\tau_O\),公开 RCT inclusion、endpoint harmonization 与 target population contract。

第六,把 CAFE calibration 与 RATE/TOC ranking、policy value/regret、PEHE-like semi-synthetic error 并列报告,展示哪些模型“幅度错但排序对”、哪些“粗校准对但局部决策错”。

第七,与 influence-function validation、R-score/model-selection criteria、SES、trial-grounding/data-fusion 方法做更广泛 matched comparison,而不是只在一个 partition experiment 里比较 SES。

第八,为 D1/D2/D3 给出 finite-sample confusion matrix:在 confounding、misspecification、二者并存、transport failure 与 null 场景中分别报告 attribution accuracy,而不只展示两条理想化 simulation curves。

11 · Claim boundary

论文可以支持什么结论

可以说:在独立 RCT、共同 support、可运输 CATE、outcome-independent partition 和相应 rate/moment/group-size 条件下,比较 RCT group effects 与 observational model group-average predictions,可以形成渐近校准的 CATE goodness-of-fit test。

可以说:sum-of-squares CAFE 与 maximum-type CAFE-M 分别面向较分散和较局部的 group-level lack of fit;论文的 simulations 与 STAR controlled constructions展示了对 model mismatch 和某些 hidden-confounding designs 的敏感性。

不能说:CAFE 观察到了 individual treatment effects;不拒绝证明模型正确或 OS 无混杂;拒绝单独证明 hidden confounding;或者一项小 RCT 可以验证 OS support 上每个个体的 CATE。

不能说:论文已经完成可复现的理论与实验闭环。当前 arXiv v1 缺少被正文引用的 supplement 和代码,theorem proofs、额外 simulations 与实现细节未在公开 artifact 中出现。

也不能把 CAFE 直接等同于 RATE/TOC。CAFE 是 effect-magnitude compatibility test;RATE/TOC 是 treatment prioritization/ranking evaluation。两者可以共享 RCT evaluation data,也可以在同一产品验收中互补,但回答不同 estimand。

12 · Research connection

为什么它与当前研究有关

对 Causality Primer,这篇论文应进入“识别 - 估计 - 评估”三者分离的位置。无混淆与 overlap 让 observational CATE 可能被识别;causal forest、R-learner、AIPW 等负责 estimation;CAFE 则引入 independent randomized evidence做 assessment。教材需要明确:更好的 estimator 不自动带来可验证的 causal fit。

对刚才的 top-20% treatment question,它给出一个非常具体的后续动作:如果历史模型决定谁进入优先治疗组,可以在独立 RCT 中按同一 score 分层,检查 top group 预测幅度与 randomized group effect 是否一致;再用 TOC/RATE 回答排序与 targeting gain。CAFE 与 RATE 正好构成 calibration-versus-ranking 两个验收面。

对 P23/HCGM/USL,它建立一个重要否定边界:unit-specific representation 或 learned heterogeneity 不能靠普通 test loss 自证。即使 CAFE 通过,也只说明所选 strata 上的平均兼容,不能把它升级成 persistent individual mechanism、unit belief 或 ITE truth。

对 L05 survey,它补上了那篇综述明确没有展开的 ML-for-causal-inference validation 线:L05 给 scope map,L06 给一个可计算的 RCT-grounded assessment object。二者应该相邻阅读,但证据等级和任务完全不同。

13 · Reading path

推荐阅读顺序

第一遍用 25 分钟抓住问题和方法:Abstract;Section 1;Sections 2.3--2.4;Sections 3.1--3.2;Section 9。先确认为什么 observational validation 不够,以及 CAFE 实际比较什么。

第二遍读数学边界:Sections 3.3--3.4 的两套 null;Section 4 的 Assumptions 3--8 与 Theorems 1--4;Section 5 的 CAFE-M。重点不是背 rate exponent,而是理解 OS learner error为什么必须相对 RCT uncertainty 足够小,以及 power 为什么依赖 partition alignment。

第三遍专门审查 hidden-confounding claim:Section 6 的 CATD decomposition、D1/D2/D3 与 Proposition 1;再对照 Section 7.3。每次看到 “attributed to unobserved confounding”,都补问 transportability、Stage-2 power 与 alternative explanations。

第四遍看 evidence:Section 7.1 的 calibration/power;Section 7.2 的 partition sensitivity;Section 7.4 的 high-dimensional learner mismatch;Section 8 的 STAR controlled construction。注意 tables 报 average p-values,而不是所有场景的 rejection rates。

最后回到官方 source archive,确认当前 v1 没有正文反复引用的 supplement。若后续出现 v2 或 journal version,应优先刷新 proofs、heteroskedastic extension、covariate shift、proxy simulation、implementation 与 code availability,再决定是否提升证据等级。

14 · Sources and next reading

论文来源与相邻阅读

  • Official arXiv abstract and v1 metadata: https://arxiv.org/abs/2605.20710
  • Official arXiv v1 PDF: https://arxiv.org/pdf/2605.20710
  • Official arXiv TeX source archive: https://arxiv.org/src/2605.20710
  • arXiv DOI: https://doi.org/10.48550/arXiv.2605.20710
  • Public WeHub projection: https://wehub.us/gong/10-paper-portfolio/causality-scout/paper-digests/h4-cafe-observational-cate-assessment/

本导读按官方 v1 核对标题、作者、日期、34 页正文、五个 figures、六个 theorem statements、Proposition 1、three-layer simulations 与 STAR construction,并核对 source archive 文件清单。没有独立证明定理、运行代码、重建 STAR data、复现 figures/tables,或把论文的 hidden-confounding attribution 当作无条件事实。