本页的 \(U,Q_\phi\)、“unit belief” 与 “Unit-Abductive” 只保留为 historical v0.3 terminology。当前 executable object 仅是 row/evidence-conditioned latent response-modulation law:没有 Population selector,没有 world conditional 与 learner approximation contract,不支持 \(Q_\phi\approx P(U\mid\mathcal O)\),也没有 repeated-individual linkage 或 exact USL-01 claim。因此不能作为 USL-01 exact selector reduction。Branch A / B 的 owner decision 仍然 pending;本页不预先选择任何分支。
P32 rejected default objective · retained design note
特征函数不是黑魔法
从一根“旋转箭头”开始,理解一个 historical v0.3 proposed extension:怎样让一批 row-conditioned latent-coordinate laws 接近标准 Cauchy;更重要的是,理解它为什么虽然可计算,却不适合作为 P32 的默认训练目标。
把 source aggregate 强行拉成标准 Cauchy,作为 P32 的默认训练目标,目前并不合适。
最直接的原因是:有限 Cauchy mixture 一般不是单个 Cauchy。
- 每个 conditional belief 是 Cauchy,并不推出跨样本形成的有限 Cauchy mixture 仍是一个 Cauchy。
- P32 的 stable-closure theorem 只需要在固定样本的 \(Q_\phi(U\mid O=o)\) 内传播 \(U\);它不要求 source aggregate 具有 Cauchy shape。
- 匹配完整 characteristic function 是 distribution-shape prior,不只是 location/scale gauge;对有限正权重 mixture,严格匹配单个 Cauchy 还会产生很强的 collapse 压力。
- 只匹配有限个 frequencies 虽然放松了约束,却只能说明几个探针相近,不能证明 aggregate 真的是 Cauchy。
因此我们不删除本页:它记录了一个数学上可行、但被排除为默认目标的选项。理解它为什么被排除,本身就是有价值的方法信息。
对 mixture 不再假装存在单一 Cauchy 参数,而是用 aggregate median 作为 location、MAD 作为 scale。令
要把 aggregate median 固定为 0、MAD 固定为 1,只需两个解析、可批量计算的约束:
它们只固定中心与中央尺度,不要求 mixture 的峰形、尾部、多峰结构或完整 characteristic function 像标准 Cauchy;多维 latent-coordinate law 时逐 coordinate 应用。这个 loc/scale 方案仍是后续待验证设计,不属于当前 v0.3 实验证据。
1. 30 秒理解:被排除的候选曾让一个 batch 同时做两件事
给模型一个 batch:\((x_i,y_i)\),\(i=1,\ldots,M\)。这个候选方案让模型一方面把每个 \(y_i\) 预测好,另一方面把每条 row 产生的 historical latent-coordinate law \(Q_i\) 聚合起来匹配共同 reference。
下面保留的是候选方案的计算方法,不是当前推荐目标。它帮助我们准确定位:问题不在“算不出来”,而在“为何要施加完整 Cauchy shape”缺少充分依据。
\(\widehat Q_B=M^{-1}\sum_i Q_i\)
2. 这里的 source aggregate latent-coordinate law 到底是什么?
P32 v0.3 的 evidence encoder 看见每个 source row 的 \(O_i\)(当前实验里取 \(O_i=X_i\)),输出一个 latent-coordinate law:
若从 source 数据中先等概率抽一个样本 \(i\),再从它的 \(Q_i\) 抽一个 \(U\),那么 \(U\) 的分布就是这些 beliefs 的混合:
当前不能把 \(U\) 解释为 Unit Selection Variable。 row \(i\) 的 evidence \(O_i\) 直接参数化 \(Q_i=Q_\phi(du\mid O_i)\),candidate latent coordinate 进入 coefficient map 后诱导 affine view。数据没有 individual key、persistent referent 或 repeated-individual linkage。sample selection 仍是另一层 across-row inclusion / weighting 问题;\(Q_i\) 不是 sample-inclusion propensity,\(\widehat Q_S\) 只是 observed source rows 所诱导的 empirical latent-law aggregate。
打开专页:从 ontology 理解 Unit 与 Sample →这里有一个反直觉但很重要的表达力来源:每个 conditional coordinate law \(Q_i\) 都可以是简单的 Cauchy,但不同 rows 给出的 location 与 scale 会随 evidence 改变;把它们聚合以后,model-induced source aggregate 可以形成多峰、不对称或局部尺度变化明显的复杂 mixture。我们不必把这份复杂性“纠正”成一个单一 Cauchy。复杂性发生在跨 source rows 的 aggregate;固定 \(O,X\) 时,P32 的 conditional predictive law 仍是一个简单的 stable law。
\(Q_\phi(U\mid O)\) 是 historical v0.3 row-conditioned coordinate law;经 \(u\mapsto(w(u),b(u))\) push forward 后,得到当前 row 在 affine views 上的 predictive mass。如果 coordinate law 与 \(O\) 无关、对所有 rows 都固定,那么即使 aggregate 形状复杂,也不保证 response location 会随 \(X\) 形成非线性。这里的表达力来自“复杂 aggregate + evidence-conditioned coordinate law + shared bilinear response map”的组合,不能只归功于一条 density curve。
为了避免把任意 latent axis 当成有真实含义的坐标,下面不直接挑一个 \(U_j\),而画一个 response-relevant pushforward:模型对 observed predictor weight 的 effective local slope。对第 \(i\) 个 source row,独立 Cauchy coordinate law 经过共享的 \(B\) 后仍给出一个解析 Cauchy law:
这为什么不是 VAE?
两者确实有一个重要共同点:都可以用一个 amortized、distribution-valued encoder,把每个 \(O\) 映射为一个带 location 与 scale 的条件分布。差别不在于一个用了 Cauchy、另一个常用 Gaussian;把两边的 family 互换,也不会消除下面的结构差异。
VAE
它声明 latent prior \(p(z)\) 与 evidence likelihood / decoder \(p_\theta(O\mid z)\),通过 reconstruction term 与逐样本 prior KL 来训练 encoder。
P32 UALBM
它让 row-conditioned latent-coordinate law 调制 affine slope 与 intercept,并直接最小化监督式 predictive NLL \(-\log p_\theta(Y\mid X,O)\)。基础模型没有 \(p(O\mid U)\)、没有 evidence reconstruction、没有 ELBO,也没有把每个 \(Q_\phi(U\mid O_i)\) 拉向 prior 的逐样本 KL;coordinate law 通过 bilinear mechanism 被解析 marginalize 到 response law。
Cauchy / Gaussian 的选择决定尾部、scale aggregation 与可用 likelihood,但不是 VAE 与 UALBM 的根本分界。根本分界是:前者建立 \(O\) 的 latent generative model 并优化 ELBO,后者建立监督式 \(Y\mid X,O\) predictor 并优化 predictive NLL。即使 learned aggregate 很复杂,\(U\) 仍只是 learner-side computational candidate;本图不把它升级为被识别的真实 unit。
如果未来另行加入 prior \(p\!\left(U\right)\)、evidence model \(p_\theta(O\mid U)\),并用 reconstruction / ELBO 与 prior KL 联合训练,那么这个扩展会更 VAE-like;但那将是一个新增的 latent generative model,不是当前 P32 基础模型。
它曾试图鼓励模型诱导的 aggregated source unit-belief mixture,在多个 frequencies 上接近 location 为 0、scale 为 1 的 Cauchy reference。即使如此准确表述,它仍然加入了完整 shape prior;这比固定 latent location/scale 强得多,因此不作为 P32 默认训练目标。
3. 被排除方案为什么会想到 characteristic function?
比较普通分布时,我们可能先比较均值和方差。但 Cauchy 没有有限的 mean 和 variance,所以“把均值拉到 0、方差拉到 1”这条路在数学上不成立。
Characteristic function(特征函数)提供另一种分布指纹。对任意随机变量 \(U\),它在频率 \(t\) 处记录:
先不用怕复数:右边只是两个普通实数——一个横坐标和一个纵坐标。把它们画在平面上,就是一根二维箭头。每个概率分布都有特征函数;完整特征函数还能唯一确定该分布。
unit 值跨过较宽区间,箭头才完成一次旋转。
从另一个观察倍率记录分布的响应。
与前两个频率一起提供互补的分布指纹。
不要简单把它说成“高频率检查尾部”。准确的说法是:多尺度 frequencies 提供互补指纹;只看一个频率,两个不同分布可能碰巧给出相近响应。
4. \(z_{ik}\):第 \(i\) 个 belief 对第 \(k\) 个探针的响应箭头
ibatch 中的样本编号。kfrequency bank 中的探针编号。tk第 \(k\) 个探针的 frequency。Qi第 \(i\) 个 source row 的 historical latent-coordinate law。zik\(Q_i\) 对 \(t_k\) 的响应箭头。ckreference 对同一 \(t_k\) 的目标箭头。固定频率 \(t_k\) 后,每个可能的 unit value \(u\) 都变成单位圆上的箭头:角度是 \(t_ku\)。按照 \(Q_i\) 把所有可能箭头平均,就得到 \(z_{ik}\)。
- location \(\mu_i\) 决定方向。改变 location,平均箭头会旋转。
- scale \(\gamma_i\) 决定长度。belief 越宽,不同方向越容易互相抵消,箭头越短。
- frequency \(t_k\) 改变观察倍率。同一个 belief 在不同 frequency 下会给出不同箭头。
数学里常把二维坐标压成一个复数:
下标中的 \(i\) 是样本编号;直立的 \(\mathrm i=\sqrt{-1}\) 是虚数单位。它们不是同一个东西。
青色是当前 belief 的 \(z\),金色是 standard Cauchy 的 \(c\)。
5. \(c_k\):standard Cauchy 给出的参考箭头
Standard Cauchy 指的是 location 为 0、scale 为 1 的 Cauchy;绝不能写成“均值为 0、方差为 1”。它在 \(t_k\) 处的响应为:
因为 location 是 0,目标箭头不向上或向下转;scale 是 1,所以长度为 \(e^{-|t_k|}\)。\(c_k\) 不是类别标签,也不是概率,它只是 reference distribution 对第 \(k\) 个探针的响应。
6. 为什么在 batch 内直接平均 \(z_{ik}\)?
这里用到一个非常友好的性质:混合分布的 characteristic function,正好等于各组成分布 characteristic functions 的加权平均。
因此我们不需要从重尾的 Cauchy mixture 里抽样,也不需要写出复杂的 mixture density;解析地计算并平均这些箭头就够了。最直观的距离是:
这个式子只是在每个 frequency 上计算“batch 平均箭头与目标箭头之间的平方距离”,再对 \(K\) 个探针取平均。
Cauchy mixtures 一般不会因为 component locations/scales 的简单平均而变成另一个 Cauchy。我们平均的是分布指纹 \(\mathbf z_{ik}\),不是参数本身。
为什么不把每个 \(Q_i\) 分别用 KL 拉向 standard Cauchy?
那会改变问题。令 \(P_0\) 是 reference、\(Q_S\) 是所有 conditional beliefs 的 aggregate,在相应密度和 KL 有限时有分解:
左边的逐样本 KL 不仅匹配 aggregate,还额外惩罚 \(U\) 保留关于 evidence \(O\) 的信息。这个 \(I_Q(U;O)\) 项会推动不同 \(Q_i\) 彼此相似,正好可能损害 row-conditioned heterogeneity。CF loss 直接作用在 aggregate 指纹上,不自动加入这项逐-law 收缩。
一个连续 population 中的特殊非坍缩例子
不同条件 belief 的 location \(a\) 可以完全不同,但 \(U=A+E\)、\(E\sim\operatorname{Cauchy}(0,0.3)\)。由 Cauchy 的稳定性,连续 population 聚合后恰好有 \(U\sim\operatorname{Cauchy}(0,1)\)。这说明某些特殊的连续 mixing law可以产生 Cauchy aggregate。
它不能证明一般有限 batch mixture 也有这个性质。对有限个正权重的 location-scale Cauchy components,若要求完整 characteristic function 严格等于一个 Cauchy,非零权重 components 实质上必须相同;而所有 \(Q_i\equiv\operatorname{Cauchy}(0,1)\) 正是一个 collapse 解。
7. 一个真的能手算出来的例子
假设 batch 里只有两个一维 beliefs:
在 \(t=1\) 时,两根响应箭头分别是
纵坐标一正一负,平均后抵消:
这一频率的平方距离约为 \((0.3277-0.3679)^2\approx0.0016\)。看起来已经很近,但换几个 frequencies 就会发现更多信息:
| 探针 \(t\) | 两个 beliefs 的平均响应横坐标 | standard Cauchy | 平方差 |
|---|---|---|---|
| 0.5 | 0.6835 | 0.6065 | 0.0059 |
| 1.0 | 0.3277 | 0.3679 | 0.0016 |
| 2.0 | −0.1531 | 0.1353 | 0.0832 |
只看 \(t=1\),差别很小;到了 \(t=2\),差别立即显现。因此若把这个排除方案作为受控 ablation,就应使用一组固定、多尺度、非零 frequencies,而不是只用一个探针。
8. 如果实现这个被排除的候选,一个 batch 怎样计算?
下面保留一维 historical latent-coordinate law 的完整计算,作为方法审计和未来 negative-control / ablation 的依据;它不是 P32 当前默认训练配方。
encoder
用 \(O_i\) 产生 \(\mu_i,\gamma_i>0\),也就是 \(Q_i=\operatorname{Cauchy}(\mu_i,\gamma_i)\)。当前 P32 实验取 \(O_i=X_i\),但概念上 evidence 与 predictor 是两个角色。
prediction
令 \(g_i=a+B^\top x_i\),再解析得到 predictive location \(m_i=\alpha_0+\beta^\top x_i+g_i^\top\mu_i\) 与 scale \(s_i=\sigma+\sum_j|g_{ij}|\gamma_{ij}\)。
CF arrows
对每个 frequency \(t_k\),计算所有 \(\mathbf z_{ik}\),在 batch 内取平均,再与 \(\mathbf c_k\) 比较。
candidate
若专门研究这个被排除的候选,再把 predictive NLL 与 \(\lambda_{\text{pop}}\mathcal L_{\mathrm{CF}}\) 组合;P32 默认设置应取 \(\lambda_{\text{pop}}=0\)。
每个样本的 Cauchy predictive negative log-likelihood 可以稳定地写成:
这里的 hypot(residual, scale) 比先算残差平方再相加更不容易数值溢出。等价的教科书写法是 \(\log(\pi s_i)+\log[1+((y_i-m_i)/s_i)^2]\)。
上式只证明该候选能在 mini-batch 内解析计算。它没有证明 source aggregate 应服从标准 Cauchy,也没有解除 finite-mixture collapse 与 shape-misspecification 风险。因此它只保留为被排除方案或受控 ablation。
\(y_i\) 只进入第一项;第二项只看当前 batch 产生的 row-conditioned coordinate laws。训练时可以在每个 mini-batch 内计算 composite loss。训练结束以后,预测一个新样本只需一次 forward pass,不再计算 aggregate loss,也不需要读取整个训练集。
为什么它数值上可算,科学上却仍不适合做默认目标?
- 无需真的从 Cauchy 抽样;\(\cos\)、\(\sin\) 和 \(e^{-\gamma|t|}\) 都直接解析计算。
- 因为 \(\gamma>0\),指数项位于 \((0,1]\),不会向上爆炸。
- 在 frequency bank 有界时,location/scale gradients 也有界。
- 这只说明 regularizer 的数值构件温和;整个 neural training objective 仍然是 non-convex,不能保证一定容易优化。
进一步展开:P32 多维 product-Cauchy 版本
若各坐标条件独立,\(Q_i=\bigotimes_j\operatorname{Cauchy}(\mu_{ij},\gamma_{ij})\),则对向量 frequency \(t_k\):
这里的 reference 是 independent-coordinate standard product-Cauchy。它不应被含混地叫作“the standard multivariate Cauchy”,因为后者可能指另一种 multivariate stable law。
9. 进阶但重要:V-statistic 与 U-statistic 有什么区别?
上面的平方 batch mean 是最直观的 V-statistic。有限 batch 下,它会把每个样本与自己也纳入平方展开,因此带有一个 \(O(1/M)\) 的额外异质性惩罚,可能轻微鼓励 row-conditioned coordinate laws 变得相似。
怎样删掉“样本与自己比较”?
令 \(\mathbf h_{ik}=\mathbf z_{ik}-\mathbf c_k\)。删掉 \(i=j\) 的自我比较后,得到:
减掉第二项,就是删除每个样本和自己的比较,只保留 \(i\neq j\) 的交叉项。
| V-statistic | U-statistic | |
|---|---|---|
| 优点 | 直观、始终非负、容易调试 | 对 population CF distance 无偏 |
| 代价 | 有 \(O(1/M)\) 的额外异质性惩罚 | 单个 mini-batch 可能为负,方差可能更大 |
| 适合 | 教学、large-batch / full-source diagnostics | 研究这个排除方案时的 estimator ablation |
| 条件 | \(M\ge1\) | \(M\ge2\),batch 近似 i.i.d. source sample |
U-statistic 某个 batch 小于 0 不一定是程序错误。它是一个无偏但带噪声的 estimator;其期望对应非负的 population distance,单次抽样值不必非负。
10. 若作为 negative control 或受控 ablation
不要每个 batch 都换探针;使用多尺度、非零 frequencies,并留一组 held-out frequencies 做诊断。
若用 class-balanced oversampling,匹配的就不再是原始 source empirical population。
同时看 predictive NLL、full-source CF distance、\(\mu\)/\(\log\gamma\) 的 IQR、\(\lVert B\rVert_F\) 与 unit-scale contribution。
只有在专门研究这个排除选项时,才应优化 mini-batch CF loss;同时每个 epoch 对完整 source train 分块计算无梯度 diagnostic。若进入后续实验,优先候选是 predictive loss 加最小 loc/scale gauge,而不是完整 CF shape matching;当前 v0.3 证据保持不变。
11. 最后:它意味着什么,又不意味着什么?
本页保留下来的价值
- 它精确记录了一个曾被考虑的 source-aggregate shape-matching 方案。
- 它解释 characteristic function 如何在不采样重尾变量时比较 mixture 指纹。
- 它有解析、无需重尾采样的 mini-batch estimator。
- 它可作为 compatibility diagnostic、negative control 或受控 ablation。
不能说
- 真实 source population 已被证明是 Cauchy。
- 每个 row-conditioned coordinate law 都是 standard Cauchy,或已经成为 calibrated posterior。
- Population individual 已被选择,或低 CF loss 排除了 collapse。
- 有限 frequencies 上 loss 为零,就证明完整分布完全相同。
- 它本身就是 IPW、propensity score 或因果识别方法。
- 它已经改善 P32 的 prediction 或 transport performance。
- 它只是 location/scale gauge,或应该成为 P32 默认训练目标。
如果未来研究 target-population shift,当前 proposal 只规范 source coordinate system。把 source 与 target 都强迫成同一 reference,可能人为擦掉真正需要建模的 population difference。是否能进一步产生有效 importance weights,需要额外的 overlap、calibration、density-ratio 与 transport 实验证据。
现在你应该既能读懂它,也知道为何不默认采用
一句人话总结:这个被排除的候选是用几个不同观察倍率,比较“这一批 beliefs 合起来的平均箭头”和“标准 Cauchy 的参考箭头”;数学上很漂亮,但它额外规定了完整 distribution shape。P32 当前只保留 median/MAD 所表达的 location/scale 规范。
