TYPE-UNRESOLVED CURRENT DRAFT — UNIT SEMANTICS SUSPENDED
TYPE-UNRESOLVED CURRENT DRAFT — UNIT SEMANTICS SUSPENDED

本页的 \(U,Q_\phi\)、“unit belief” 与 “Unit-Abductive” 只保留为 historical v0.3 terminology。当前 executable object 仅是 row/evidence-conditioned latent response-modulation law:没有 Population selector,没有 world conditional 与 learner approximation contract,不支持 \(Q_\phi\approx P(U\mid\mathcal O)\),也没有 repeated-individual linkage 或 exact USL-01 claim。因此不能作为 USL-01 exact selector reduction。Branch A / B 的 owner decision 仍然 pending;本页不预先选择任何分支。

P32 rejected default objective · retained design note

特征函数不是黑魔法

从一根“旋转箭头”开始,理解一个 historical v0.3 proposed extension:怎样让一批 row-conditioned latent-coordinate laws 接近标准 Cauchy;更重要的是,理解它为什么虽然可计算,却不适合作为 P32 的默认训练目标。

排除方案数学记录 可计算 ≠ 应采用 不是 P32 默认目标 尚未纳入 v0.3 证据
当前方法决定

把 source aggregate 强行拉成标准 Cauchy,作为 P32 的默认训练目标,目前并不合适。

最直接的原因是:有限 Cauchy mixture 一般不是单个 Cauchy。

因此我们不删除本页:它记录了一个数学上可行、但被排除为默认目标的选项。理解它为什么被排除,本身就是有价值的方法信息。

当前推荐的最小约束:只固定 robust location 与 scale

对 mixture 不再假装存在单一 Cauchy 参数,而是用 aggregate median 作为 location、MAD 作为 scale。令

\[ F_B(u)=\frac1M\sum_{i=1}^{M} \left[ \frac12+\frac1\pi\operatorname{atan2}(u-\mu_i,\gamma_i) \right]. \]

要把 aggregate median 固定为 0、MAD 固定为 1,只需两个解析、可批量计算的约束:

\[ \mathcal R_{\mathrm{loc}} =[F_B(0)-\tfrac12]^2, \qquad \mathcal R_{\mathrm{scale}} =[F_B(1)-F_B(-1)-\tfrac12]^2. \]

它们只固定中心与中央尺度,不要求 mixture 的峰形、尾部、多峰结构或完整 characteristic function 像标准 Cauchy;多维 latent-coordinate law 时逐 coordinate 应用。这个 loc/scale 方案仍是后续待验证设计,不属于当前 v0.3 实验证据。

1. 30 秒理解:被排除的候选曾让一个 batch 同时做两件事

给模型一个 batch:\((x_i,y_i)\),\(i=1,\ldots,M\)。这个候选方案让模型一方面把每个 \(y_i\) 预测好,另一方面把每条 row 产生的 historical latent-coordinate law \(Q_i\) 聚合起来匹配共同 reference。

下面保留的是候选方案的计算方法,不是当前推荐目标。它帮助我们准确定位:问题不在“算不出来”,而在“为何要施加完整 Cauchy shape”缺少充分依据。

\[ \mathcal L_{\text{batch}} =\underbrace{\mathcal L_{\text{prediction}}}_{\text{每个样本预测得对}} +\lambda_{\text{pop}} \underbrace{\mathcal L_{\text{CF}}}_{\text{batch 的 belief 指纹接近参考指纹}}. \]
belief \(Q_1\)belief \(Q_2\)belief \(Q_3\)
在 batch 内等权混合
\(\widehat Q_B=M^{-1}\sum_i Q_i\)
候选:与 standard Cauchy 的“指纹”比较
这是被排除的默认目标;当前只保留 loc/scale 约束。

2. 这里的 source aggregate latent-coordinate law 到底是什么?

P32 v0.3 的 evidence encoder 看见每个 source row 的 \(O_i\)(当前实验里取 \(O_i=X_i\)),输出一个 latent-coordinate law:

\[ Q_i=Q_\phi(du\mid O_i) =\operatorname{Cauchy}(\mu_i,\gamma_i). \]

若从 source 数据中先等概率抽一个样本 \(i\),再从它的 \(Q_i\) 抽一个 \(U\),那么 \(U\) 的分布就是这些 beliefs 的混合:

\[ \widehat Q_S=\frac{1}{N_S}\sum_{i=1}^{N_S}Q_i. \]
这里的两个 selection 不是一回事

当前不能把 \(U\) 解释为 Unit Selection Variable。 row \(i\) 的 evidence \(O_i\) 直接参数化 \(Q_i=Q_\phi(du\mid O_i)\),candidate latent coordinate 进入 coefficient map 后诱导 affine view。数据没有 individual key、persistent referent 或 repeated-individual linkage。sample selection 仍是另一层 across-row inclusion / weighting 问题;\(Q_i\) 不是 sample-inclusion propensity,\(\widehat Q_S\) 只是 observed source rows 所诱导的 empirical latent-law aggregate。

打开专页:从 ontology 理解 Unit 与 Sample →

这里有一个反直觉但很重要的表达力来源:每个 conditional coordinate law \(Q_i\) 都可以是简单的 Cauchy,但不同 rows 给出的 location 与 scale 会随 evidence 改变;把它们聚合以后,model-induced source aggregate 可以形成多峰、不对称或局部尺度变化明显的复杂 mixture。我们不必把这份复杂性“纠正”成一个单一 Cauchy。复杂性发生在跨 source rows 的 aggregate;固定 \(O,X\) 时,P32 的 conditional predictive law 仍是一个简单的 stable law。

复杂 aggregate 是容量来源之一,但不是预测非线性的充分条件

\(Q_\phi(U\mid O)\) 是 historical v0.3 row-conditioned coordinate law;经 \(u\mapsto(w(u),b(u))\) push forward 后,得到当前 row 在 affine views 上的 predictive mass。如果 coordinate law 与 \(O\) 无关、对所有 rows 都固定,那么即使 aggregate 形状复杂,也不保证 response location 会随 \(X\) 形成非线性。这里的表达力来自“复杂 aggregate + evidence-conditioned coordinate law + shared bilinear response map”的组合,不能只归功于一条 density curve。

为了避免把任意 latent axis 当成有真实含义的坐标,下面不直接挑一个 \(U_j\),而画一个 response-relevant pushforward:模型对 observed predictor weight 的 effective local slope。对第 \(i\) 个 source row,独立 Cauchy coordinate law 经过共享的 \(B\) 后仍给出一个解析 Cauchy law:

\[ W_{\mathrm{weight}}\mid O_i \sim\operatorname{Cauchy}(\ell_i,s_i), \] \[ \begin{aligned} \ell_i &=\beta_{\mathrm{weight}}+B_{\mathrm{weight},:}\mu_i,\\ s_i &=\sum_j |B_{\mathrm{weight},j}|\,\gamma_{ij}. \end{aligned} \]
Auto MPG clean seed 42 上训练的 Cauchy UALBM 所诱导的 weight effective-local-slope source density。左图是五个代表性 conditional Cauchy laws,中图是 235 个 source-row laws 的解析等权 mixture 与标准 Cauchy 参考,右图是 conditional slope location 随 standardized weight 的变化。
Learned-source diagnostic,而不是预设的标准 Cauchy。这是 Auto MPG、clean arm、seed 42 的一次 exploratory Cauchy UALBM refit;它是网页解释性 diagnostic,不计入 v0.3 prospective evidence。左图给出五个代表性 conditional local-slope laws;中图把全部 235 个 source-train rows 的解析 Cauchy laws 等权混合,并与 standard-Cauchy reference 比较;右图显示 conditional slope location 与 observed standardized weight 的关系。Weight 是在六个 standardized numeric predictors 中按“aggregate mixture MAD 最大”的确定规则选出的。横轴用该 mixture 的 median / MAD 做 post-hoc 显示归一化,训练时没有施加这个 gauge。曲线不是 KDE,也不是重尾抽样后的平滑结果。它说明简单 components 可以组成复杂 model-induced aggregate,但不证明“真实 unit population”已被识别,也不单独证明总体 response fit 或 universal approximation。窄屏可点击图片打开原尺寸。

这为什么不是 VAE?

两者确实有一个重要共同点:都可以用一个 amortized、distribution-valued encoder,把每个 \(O\) 映射为一个带 location 与 scale 的条件分布。差别不在于一个用了 Cauchy、另一个常用 Gaussian;把两边的 family 互换,也不会消除下面的结构差异。

VAE

\[ p(z)\,p_\theta(O\mid z),\qquad q_\phi(z\mid O), \] \[ \operatorname{ELBO} =\mathbb E_{q_\phi(z\mid O)}[\log p_\theta(O\mid z)] \] \[ \hphantom{\operatorname{ELBO}} -\operatorname{KL}\!\left(q_\phi(z\mid O)\Vert p(z)\right). \]

它声明 latent prior \(p(z)\) 与 evidence likelihood / decoder \(p_\theta(O\mid z)\),通过 reconstruction term 与逐样本 prior KL 来训练 encoder。

P32 UALBM

\[ Q_\phi(U\mid O), \] \[ \begin{aligned} p_\theta(Y\mid X,O) &=\int p_\theta(Y\mid X,u)\\[-2pt] &\qquad Q_\phi(du\mid O), \end{aligned} \] \[ \begin{aligned} w(u)&=\beta+Bu,\\ b(u)&=\alpha_0+a^\top u. \end{aligned} \]

它让 row-conditioned latent-coordinate law 调制 affine slope 与 intercept,并直接最小化监督式 predictive NLL \(-\log p_\theta(Y\mid X,O)\)。基础模型没有 \(p(O\mid U)\)、没有 evidence reconstruction、没有 ELBO,也没有把每个 \(Q_\phi(U\mid O_i)\) 拉向 prior 的逐样本 KL;coordinate law 通过 bilinear mechanism 被解析 marginalize 到 response law。

共同的 encoder 形式,不等于共同的模型语义

Cauchy / Gaussian 的选择决定尾部、scale aggregation 与可用 likelihood,但不是 VAE 与 UALBM 的根本分界。根本分界是:前者建立 \(O\) 的 latent generative model 并优化 ELBO,后者建立监督式 \(Y\mid X,O\) predictor 并优化 predictive NLL。即使 learned aggregate 很复杂,\(U\) 仍只是 learner-side computational candidate;本图不把它升级为被识别的真实 unit。

如果未来另行加入 prior \(p\!\left(U\right)\)、evidence model \(p_\theta(O\mid U)\),并用 reconstruction / ELBO 与 prior KL 联合训练,那么这个扩展会更 VAE-like;但那将是一个新增的 latent generative model,不是当前 P32 基础模型。

被排除候选的准确说法

它曾试图鼓励模型诱导的 aggregated source unit-belief mixture,在多个 frequencies 上接近 location 为 0、scale 为 1 的 Cauchy reference。即使如此准确表述,它仍然加入了完整 shape prior;这比固定 latent location/scale 强得多,因此不作为 P32 默认训练目标。

3. 被排除方案为什么会想到 characteristic function?

比较普通分布时,我们可能先比较均值和方差。但 Cauchy 没有有限的 mean 和 variance,所以“把均值拉到 0、方差拉到 1”这条路在数学上不成立。

Characteristic function(特征函数)提供另一种分布指纹。对任意随机变量 \(U\),它在频率 \(t\) 处记录:

\[ \varphi_U(t)=\mathbb E\!\left[e^{\mathrm i tU}\right] =\mathbb E[\cos(tU)]+\mathrm i\,\mathbb E[\sin(tU)]. \]

先不用怕复数:右边只是两个普通实数——一个横坐标和一个纵坐标。把它们画在平面上,就是一根二维箭头。每个概率分布都有特征函数;完整特征函数还能唯一确定该分布。

较粗探针 \(t_1\)

unit 值跨过较宽区间,箭头才完成一次旋转。

中等探针 \(t_2\)

从另一个观察倍率记录分布的响应。

较细探针 \(t_3\)

与前两个频率一起提供互补的分布指纹。

不要简单把它说成“高频率检查尾部”。准确的说法是:多尺度 frequencies 提供互补指纹;只看一个频率,两个不同分布可能碰巧给出相近响应。

4. \(z_{ik}\):第 \(i\) 个 belief 对第 \(k\) 个探针的响应箭头

ibatch 中的样本编号。
kfrequency bank 中的探针编号。
tk第 \(k\) 个探针的 frequency。
Qi第 \(i\) 个 source row 的 historical latent-coordinate law。
zik\(Q_i\) 对 \(t_k\) 的响应箭头。
ckreference 对同一 \(t_k\) 的目标箭头。

固定频率 \(t_k\) 后,每个可能的 unit value \(u\) 都变成单位圆上的箭头:角度是 \(t_ku\)。按照 \(Q_i\) 把所有可能箭头平均,就得到 \(z_{ik}\)。

\[ \boxed{ \mathbf z_{ik} =e^{-\gamma_i|t_k|} \begin{bmatrix} \cos(t_k\mu_i)\\ \sin(t_k\mu_i) \end{bmatrix}} \]
  1. location \(\mu_i\) 决定方向。改变 location,平均箭头会旋转。
  2. scale \(\gamma_i\) 决定长度。belief 越宽,不同方向越容易互相抵消,箭头越短。
  3. frequency \(t_k\) 改变观察倍率。同一个 belief 在不同 frequency 下会给出不同箭头。

数学里常把二维坐标压成一个复数:

\[ z_{ik}=e^{-\gamma_i|t_k|} [\cos(t_k\mu_i)+\mathrm i\sin(t_k\mu_i)]. \]

下标中的 \(i\) 是样本编号;直立的 \(\mathrm i=\sqrt{-1}\) 是虚数单位。它们不是同一个东西。

自己转动这根箭头

青色是当前 belief 的 \(z\),金色是 standard Cauchy 的 \(c\)。

1.00
0.50
1.00
当前 \(z\)参考 \(c\)
方向 \(t\mu\)1.000 rad
长度 \(e^{-\gamma|t|}\)0.607
当前 \(z\)0.328 + 0.510i
参考 \(c\)0.368 + 0.000i

5. \(c_k\):standard Cauchy 给出的参考箭头

Standard Cauchy 指的是 location 为 0、scale 为 1 的 Cauchy;绝不能写成“均值为 0、方差为 1”。它在 \(t_k\) 处的响应为:

\[ \boxed{ \mathbf c_k= \begin{bmatrix} e^{-|t_k|}\\[2pt]0 \end{bmatrix}} \qquad\Longleftrightarrow\qquad c_k=e^{-|t_k|}. \]

因为 location 是 0,目标箭头不向上或向下转;scale 是 1,所以长度为 \(e^{-|t_k|}\)。\(c_k\) 不是类别标签,也不是概率,它只是 reference distribution 对第 \(k\) 个探针的响应。

6. 为什么在 batch 内直接平均 \(z_{ik}\)?

这里用到一个非常友好的性质:混合分布的 characteristic function,正好等于各组成分布 characteristic functions 的加权平均。

\[ \widehat Q_B=\frac1M\sum_{i=1}^{M}Q_i \quad\Longrightarrow\quad \overline{\mathbf z}_k =\frac1M\sum_{i=1}^{M}\mathbf z_{ik}. \]

因此我们不需要从重尾的 Cauchy mixture 里抽样,也不需要写出复杂的 mixture density;解析地计算并平均这些箭头就够了。最直观的距离是:

\[ \boxed{ \mathcal L_{\mathrm{CF}}^{V} =\frac1K\sum_{k=1}^{K} \left\| \overline{\mathbf z}_k-\mathbf c_k \right\|_2^2.} \]

这个式子只是在每个 frequency 上计算“batch 平均箭头与目标箭头之间的平方距离”,再对 \(K\) 个探针取平均。

不要去平均 \(\mu_i\) 和 \(\gamma_i\)

Cauchy mixtures 一般不会因为 component locations/scales 的简单平均而变成另一个 Cauchy。我们平均的是分布指纹 \(\mathbf z_{ik}\),不是参数本身。

为什么不把每个 \(Q_i\) 分别用 KL 拉向 standard Cauchy?

那会改变问题。令 \(P_0\) 是 reference、\(Q_S\) 是所有 conditional beliefs 的 aggregate,在相应密度和 KL 有限时有分解:

\[ \mathbb E_O\!\left[ \operatorname{KL}\!\left(Q(U\mid O)\,\Vert\,P_0\right) \right] = \operatorname{KL}\!\left(Q_S(U)\,\Vert\,P_0\right) +I_Q(U;O). \]

左边的逐样本 KL 不仅匹配 aggregate,还额外惩罚 \(U\) 保留关于 evidence \(O\) 的信息。这个 \(I_Q(U;O)\) 项会推动不同 \(Q_i\) 彼此相似,正好可能损害 row-conditioned heterogeneity。CF loss 直接作用在 aggregate 指纹上,不自动加入这项逐-law 收缩。

一个连续 population 中的特殊非坍缩例子

\[ A\sim\operatorname{Cauchy}(0,0.7),\qquad U\mid A=a\sim\operatorname{Cauchy}(a,0.3). \]

不同条件 belief 的 location \(a\) 可以完全不同,但 \(U=A+E\)、\(E\sim\operatorname{Cauchy}(0,0.3)\)。由 Cauchy 的稳定性,连续 population 聚合后恰好有 \(U\sim\operatorname{Cauchy}(0,1)\)。这说明某些特殊的连续 mixing law可以产生 Cauchy aggregate。

它不能证明一般有限 batch mixture 也有这个性质。对有限个正权重的 location-scale Cauchy components,若要求完整 characteristic function 严格等于一个 Cauchy,非零权重 components 实质上必须相同;而所有 \(Q_i\equiv\operatorname{Cauchy}(0,1)\) 正是一个 collapse 解。

7. 一个真的能手算出来的例子

假设 batch 里只有两个一维 beliefs:

\[ Q_1=\operatorname{Cauchy}(-1,0.5), \qquad Q_2=\operatorname{Cauchy}(1,0.5). \]

在 \(t=1\) 时,两根响应箭头分别是

\[ \mathbf z_1\approx(0.3277,-0.5104),\qquad \mathbf z_2\approx(0.3277,0.5104). \]

纵坐标一正一负,平均后抵消:

\[ \overline{\mathbf z}\approx(0.3277,0),\qquad \mathbf c=(e^{-1},0)\approx(0.3679,0). \]

这一频率的平方距离约为 \((0.3277-0.3679)^2\approx0.0016\)。看起来已经很近,但换几个 frequencies 就会发现更多信息:

探针 \(t\)两个 beliefs 的平均响应横坐标standard Cauchy平方差
0.50.68350.60650.0059
1.00.32770.36790.0016
2.0−0.15310.13530.0832

只看 \(t=1\),差别很小;到了 \(t=2\),差别立即显现。因此若把这个排除方案作为受控 ablation,就应使用一组固定、多尺度、非零 frequencies,而不是只用一个探针。

8. 如果实现这个被排除的候选,一个 batch 怎样计算?

下面保留一维 historical latent-coordinate law 的完整计算,作为方法审计和未来 negative-control / ablation 的依据;它不是 P32 当前默认训练配方。

步骤 1
encoder

用 \(O_i\) 产生 \(\mu_i,\gamma_i>0\),也就是 \(Q_i=\operatorname{Cauchy}(\mu_i,\gamma_i)\)。当前 P32 实验取 \(O_i=X_i\),但概念上 evidence 与 predictor 是两个角色。

步骤 2
prediction

令 \(g_i=a+B^\top x_i\),再解析得到 predictive location \(m_i=\alpha_0+\beta^\top x_i+g_i^\top\mu_i\) 与 scale \(s_i=\sigma+\sum_j|g_{ij}|\gamma_{ij}\)。

步骤 3
CF arrows

对每个 frequency \(t_k\),计算所有 \(\mathbf z_{ik}\),在 batch 内取平均,再与 \(\mathbf c_k\) 比较。

步骤 4
candidate

若专门研究这个被排除的候选,再把 predictive NLL 与 \(\lambda_{\text{pop}}\mathcal L_{\mathrm{CF}}\) 组合;P32 默认设置应取 \(\lambda_{\text{pop}}=0\)。

每个样本的 Cauchy predictive negative log-likelihood 可以稳定地写成:

\[ \ell_i^{\mathrm{pred}} =\log\pi+2\log\!\operatorname{hypot}(y_i-m_i,s_i)-\log s_i. \]

这里的 hypot(residual, scale) 比先算残差平方再相加更不容易数值溢出。等价的教科书写法是 \(\log(\pi s_i)+\log[1+((y_i-m_i)/s_i)^2]\)。

\[ \boxed{ \mathcal L_{\mathrm{batch}} =\frac1M\sum_{i=1}^{M}\ell_i^{\mathrm{pred}} +\lambda_{\mathrm{pop}} \frac1K\sum_{k=1}^{K} \left\| \frac1M\sum_{i=1}^{M}\mathbf z_{ik}-\mathbf c_k \right\|_2^2.} \]
可计算性不是采用理由

上式只证明该候选能在 mini-batch 内解析计算。它没有证明 source aggregate 应服从标准 Cauchy,也没有解除 finite-mixture collapse 与 shape-misspecification 风险。因此它只保留为被排除方案或受控 ablation。

训练与推理完全不同

\(y_i\) 只进入第一项;第二项只看当前 batch 产生的 row-conditioned coordinate laws。训练时可以在每个 mini-batch 内计算 composite loss。训练结束以后,预测一个新样本只需一次 forward pass,不再计算 aggregate loss,也不需要读取整个训练集

为什么它数值上可算,科学上却仍不适合做默认目标?

进一步展开:P32 多维 product-Cauchy 版本

若各坐标条件独立,\(Q_i=\bigotimes_j\operatorname{Cauchy}(\mu_{ij},\gamma_{ij})\),则对向量 frequency \(t_k\):

\[ \mathbf z_{ik} =e^{-\gamma_i^\top|t_k|} \begin{bmatrix} \cos(t_k^\top\mu_i)\\ \sin(t_k^\top\mu_i) \end{bmatrix}, \qquad \mathbf c_k=e^{-\lVert t_k\rVert_1} \begin{bmatrix}1\\0\end{bmatrix}. \]

这里的 reference 是 independent-coordinate standard product-Cauchy。它不应被含混地叫作“the standard multivariate Cauchy”,因为后者可能指另一种 multivariate stable law。

9. 进阶但重要:V-statistic 与 U-statistic 有什么区别?

上面的平方 batch mean 是最直观的 V-statistic。有限 batch 下,它会把每个样本与自己也纳入平方展开,因此带有一个 \(O(1/M)\) 的额外异质性惩罚,可能轻微鼓励 row-conditioned coordinate laws 变得相似。

怎样删掉“样本与自己比较”?

令 \(\mathbf h_{ik}=\mathbf z_{ik}-\mathbf c_k\)。删掉 \(i=j\) 的自我比较后,得到:

\[ \boxed{ \mathcal L_{\mathrm{CF}}^{U} =\frac1K\sum_{k=1}^{K} \frac{ \left\|\sum_i\mathbf h_{ik}\right\|_2^2 -\sum_i\lVert\mathbf h_{ik}\rVert_2^2 }{M(M-1)}.} \]

减掉第二项,就是删除每个样本和自己的比较,只保留 \(i\neq j\) 的交叉项。

V-statisticU-statistic
优点直观、始终非负、容易调试对 population CF distance 无偏
代价有 \(O(1/M)\) 的额外异质性惩罚单个 mini-batch 可能为负,方差可能更大
适合教学、large-batch / full-source diagnostics研究这个排除方案时的 estimator ablation
条件\(M\ge1\)\(M\ge2\),batch 近似 i.i.d. source sample

U-statistic 某个 batch 小于 0 不一定是程序错误。它是一个无偏但带噪声的 estimator;其期望对应非负的 population distance,单次抽样值不必非负。

10. 若作为 negative control 或受控 ablation

01固定 frequency bank

不要每个 batch 都换探针;使用多尺度、非零 frequencies,并留一组 held-out frequencies 做诊断。

02Batch sampling 定义 source

若用 class-balanced oversampling,匹配的就不再是原始 source empirical population。

03监测而非只看 loss

同时看 predictive NLL、full-source CF distance、\(\mu\)/\(\log\gamma\) 的 IQR、\(\lVert B\rVert_F\) 与 unit-scale contribution。

只有在专门研究这个排除选项时,才应优化 mini-batch CF loss;同时每个 epoch 对完整 source train 分块计算无梯度 diagnostic。若进入后续实验,优先候选是 predictive loss 加最小 loc/scale gauge,而不是完整 CF shape matching;当前 v0.3 证据保持不变。

11. 最后:它意味着什么,又不意味着什么?

本页保留下来的价值

  • 它精确记录了一个曾被考虑的 source-aggregate shape-matching 方案。
  • 它解释 characteristic function 如何在不采样重尾变量时比较 mixture 指纹。
  • 它有解析、无需重尾采样的 mini-batch estimator。
  • 它可作为 compatibility diagnostic、negative control 或受控 ablation。

不能说

  • 真实 source population 已被证明是 Cauchy。
  • 每个 row-conditioned coordinate law 都是 standard Cauchy,或已经成为 calibrated posterior。
  • Population individual 已被选择,或低 CF loss 排除了 collapse。
  • 有限 frequencies 上 loss 为零,就证明完整分布完全相同。
  • 它本身就是 IPW、propensity score 或因果识别方法。
  • 它已经改善 P32 的 prediction 或 transport performance。
  • 它只是 location/scale gauge,或应该成为 P32 默认训练目标。
Source 与 target 不应被机械地拉成同一个 reference

如果未来研究 target-population shift,当前 proposal 只规范 source coordinate system。把 source 与 target 都强迫成同一 reference,可能人为擦掉真正需要建模的 population difference。是否能进一步产生有效 importance weights,需要额外的 overlap、calibration、density-ratio 与 transport 实验证据。

现在你应该既能读懂它,也知道为何不默认采用

\[ \underbrace{\mathbf z_{ik}}_{\text{第 }i\text{ 个 belief 的响应}} =e^{-\gamma_i|t_k|} \begin{bmatrix}\cos(t_k\mu_i)\\\sin(t_k\mu_i)\end{bmatrix}, \quad \underbrace{\mathbf c_k}_{\text{reference 响应}} =\begin{bmatrix}e^{-|t_k|}\\0\end{bmatrix}, \quad \mathcal L_{\mathrm{CF}}^{V} =\frac1K\sum_k\left\|\frac1M\sum_i\mathbf z_{ik}-\mathbf c_k\right\|_2^2. \]

一句人话总结:这个被排除的候选是用几个不同观察倍率,比较“这一批 beliefs 合起来的平均箭头”和“标准 Cauchy 的参考箭头”;数学上很漂亮,但它额外规定了完整 distribution shape。P32 当前只保留 median/MAD 所表达的 location/scale 规范。