同一个 unit 可以留下多条 samples;一条 sample 也可能牵涉多个 units。
Unit 和 sample 到底有什么不同?
这不是术语游戏。它决定数据按谁计数、哪些记录相关、测试集应该怎样切,以及模型究竟是在预测一条新记录,还是一个新的对象。
experimental unit、subject、cluster、random effect、causal unit、group split 都是已有处理。
当 unit 与 record 在当前 design/query 下 operationally collapse,就没必要强造 latent unit。
两个词分别指什么?
Population selector / Individual
Population Unit Selection Variable \(U\sim\Pi\) 执行 selection,它的随机性回答 which individual;事件 \(U=u\) 固定/表示其 definite persistent referent,患者、设备、注册账户、企业或医院都可在当前任务声明下成为 unit。realized \(u\in\mathcal U\) 表示 persistent referent,并以语义方式索引 \(f(x;u)\);\(\mathcal U\) 不必是数值空间。Direct-ID 下 \(k\mapsto u(k)\) 固定 referent 与稳定 response/update address,而 embedding、factor 或 random effect \(u_\theta(k)\) 仍由 downstream objective 在该地址学习。
Sample / observation
关于某个 individual 的一次 realized record,例如一次就诊、一个传感器窗口、一轮 interaction 或一张图像;sample index 只定位 realized values,其中哪些 values 可以成为 evidence,取决于 answer-time information protocol。
这里要分开两种随机性:\(U\) 表示 which-individual randomness;固定 \(u\) 后,kernel 仍保留 context、event 与 exogenous variation。需要显式 disturbance 时可以写:
但这不自动假设 \(\varepsilon\perp U\)、\(\varepsilon\perp X\mid U\)、IID observations 或 causal exogeneity。
若 factual evidence 是正概率 population event,使用 ordinary conditioning;若它是连续 random element 的 realized value,则上式表示 regular conditional kernel 在该 value 处的版本,而不是对零概率 singleton 做比值。\(P\) 是 world conditional,\(Q_\phi\) 是以它为目标的 learner belief;二者未经 calibration、correct specification 或 sufficient evidence 不必相等。
Evidence–query boundary:\(\mathcal O^F\) 一次形成 unit belief;多个 \((x^Q,c^Q)\) queries 复用它。Candidate \(x^Q\) 不重新进入 Unit Abduction,也不会因为被送入 predictor 就自动成为 evidence;fixed-\(u\) 后直接改变 response 的信息必须显式声明为 \(c^Q\),不能把整包 \(\mathcal O^F\) 回灌 response kernel。\(\mathcal O^F\) 中若含 \(Y^{\mathrm{hist}}\),它只能是已观察的历史 response,不是当前要预测的 target \(Y^Q\)。
需要抽样时怎样写:使用 evidence-explicit 的 \(\widetilde U_\phi\mid\mathcal O^F\sim Q_\phi(\cdot\mid\mathcal O^F)\)。它是 learner-side 抽到的 candidate unit,不是 belief measure 本身、world-side 已实现的 individual、row attribution,也不是 direct-ID 模型在固定地址学习的 \(u_\theta(k)\)。旧式 \(U_i^{\mathrm{abd}}\) 至多是这个 draw 的 deprecated shorthand。
每位患者只有一次基线记录;当前任务中常可折叠。
同一设备产生 100 个窗口;通常不能直接折叠。
一场比赛、多方交易或一条 graph edge;须声明 focal unit 与 interaction。
只关心独立事件的下一次边际分布;sample-only 可能正好。
先声明 Population-to-Individual selection,再讨论观测 attribution
一般问题从 \(U\sim\Pi\)、event \(\mathcal O\) 与 fixed-individual response 开始。只有 observation protocol 已观察或可靠揭示 attribution 时,数据才可额外记录 \(u_i\):
这里 \(i\mapsto u_i\) 只记录 protocol 已知的 attribution;一般 latent-attribution learner 不能预先接收 unknown \(u_i\)。Repeated observations 的 joint assignment law 也尚未被这个记号冻结,不能默认为 independent Population draws。
随机性回答 population 中 which individual 被选择。
固定/表示 definite individual,并以语义方式索引 \(f(x;u)\);\(\mathcal U\) 不必是数值空间。
population law 在 factual evidence 下给出的 which-individual conditional。
以 world conditional 为目标的 learner belief;多个 queries 通过 explicit \(c^Q\) response law 复用它。
trusted ID 按声明的 registry contract 固定 persistent referent 与稳定 response/update address。
该地址上的 embedding、factor 或 random effect,由 response objective 学习;坐标可重参数化,不是 person 本身。
Known-ID boundary:只有当 protocol 明确保证 ID evidence 揭示 selected individual,which-individual conditional 才退化为 Dirac;这个 Dirac 落在 persistent referent \(u(k)\) 上,绝不在 trainable \(u_\theta(k)\) 上——embedding、factor 或 random effect 的估计误差仍属于 response model,identity certainty 不等于 response-content certainty。
1000 行不一定是 1000 个独立对象
100 位患者 × 每人 10 次就诊 = 1000 rows
数据表有 1000 行,但不等于有 1000 个彼此独立的患者。如果直接把每一行当作一个新对象,至少有五种风险:
- 计数和加权错位。就诊更多的患者会自动获得更大权重;这只有在目标确实是“随机一条就诊记录”时才合理。
- 个体差异与当次波动混在一起。同一人的短期变化和不同人的长期差异被压成普通 sample variation。
- 训练—测试泄漏。同一患者的记录可能同时进入 train 和 test,却被误报为对新患者的泛化。
- 有效信息量被夸大。同一 unit 的多次相关观测不能无条件冒充同样数量的独立 units。
- Same-unit question 失去锚点。模型可以预测条件响应,却不能仅凭“找到一条相似记录”把结果解释成同一个对象在另一种 treatment 下会怎样;similarity 不等于 same-unit counterfactual。
服务“随机一条 observation”。
服务“随机一个 unit”。
二者都可能合理;错误在于没有声明 estimand 就把一个当成另一个。区分 unit/sample 的好处,是迫使论文回答:你到底在随机抽一行,还是随机抽一个对象?
同一数据,两个 generalization problems:看过患者 A 的历史后预测 A 的下一次就诊;或者预测一位从未见过的新患者。随机逐行切分可以评估前者,却常被误报成后者。Saeb et al. (2017) ↗ 在临床传感数据中发现 record-wise CV 会显著高估面向新受试者的性能。
区分以后,具体得到什么?
区分 unit 与 sample 并不自动带来一种新模型;它先让以下六层对齐:
Data
哪些 records 属于同一个持续对象?
Objective
每条 record 等权,还是每个 unit 等权?
Split
评估同一 unit 的新 observation,还是从未见过的新 unit?
Persistent unit / address
哪一个 referent 跨 observations 持续;哪些 records 路由到同一稳定 response/update address?
Response property / state
embedding、factor、random effect 或 dynamic state 如何由 response objective 学习或更新?
Query
treatment 或 context 改变时,回答是否仍指向同一个响应承受者?
推荐系统把所有边界放进同一条链
固定注册账户 42
User / registered account 是 unit;一次 interaction 是 sample;实际曝光的 item / slate 是 treatment / action;click、purchase、retention 是 outcome。同一个 user 会贡献多条 interaction rows,因此 unit 与 sample 不再能靠“一行一个对象”自动折叠。此时还必须区分普通 logged prediction 与 same-user alternative-treatment question;能写出后者,不等于现有日志已经识别它。
这个式子只给 alternative-treatment question 一个 same-unit referential anchor;它不证明 counterfactual identification。账户 42 的完整 estimand、future policy 和 logged-policy boundary 留给案例页。
进入完整贯穿案例:推荐系统为什么需要 unit?从账户 42 的 interaction log 与 candidate reuse,一直走到 PMF known-referent property 和 causal-identification boundary。→学界是不是从来没有区分过?
不是。多个传统已经局部处理了 unit:
| 传统 | unit 怎样出现 | 已经解决什么 |
|---|---|---|
| 实验设计 / sampling | experimental unit、sampling unit、cluster | 随机化层级、真正复制数、pseudoreplication |
| 纵向 / repeated-measures 统计 | subject / entity index | within-unit dependence、within/between variation |
| Mixed / hierarchical models | group-specific random effect | partial pooling、subject-specific prediction |
| 因果推断 | unit-indexed potential outcomes | 定义同一 unit 在不同 treatment 下的 response |
| 推荐、grouped learning 与 evaluation | user ID、group latent、grouped split | personalization、共享表示、避免 group leakage |
为什么没有一个通用的 unit primitive?
不需要诉诸“大家没有想到”。更自然的原因是:
很多常见数据集恰好一 unit 一 record。 此时显式 unit layer 不增加可见信息。
i.i.d. sample 是非常成功的抽象。 主动忽略来源历史,换来了统一的优化与泛化语言。
unit 的声明粒度依赖具体问题。 人、家庭、医院或组织都可能是正确尺度;声明后不能在回答过程中偷换。
有可靠 ID 时局部工具往往已经够用。 known-individual grouping 或 response modeling 即可工作;ID 可以按声明的 registry contract 固定 referent 与稳定 update address,但该地址上的 embedding、factor 或 state 仍可由 response objective 学习。
没有证据时不能凭空恢复 unit。 缺少 ID、repeats 或 linkage evidence 时,唯一 unit 无法被凭空恢复。
只有 sample、没有显式 unit,可以吗?
可以。用下面的判断就够了:关键是区分“unit 对当前问题不需要”和“unit 很重要,但现有数据无法识别”。
Operational collapse
- 每个目标 unit 恰好贡献一条 record
- records 对当前 query 可视为独立
- 目标是新 unit 的边际预测
- 不需要 same-unit history、alternative-treatment comparison 或 unit-level attribution
- train/test split 和 metric 的计数对象与部署目标一致
结构被丢失
- 同一 unit 有多条相关 observations
- observation 频次会改变 unit 的隐含权重
- 需要区分 known-unit 与 new-unit generalization
- query 要求固定同一个对象再改变 treatment、context 或 policy
- unit 很重要,但 grouping / linkage 在数据中不可见
在 observed-attribution regime,令 \(m(u):=\sum_{i=1}^N\mathbf 1\{u_i=u\}\) 计数已声明 individual \(u\) 的 records。一种最清楚的退化情形是:
这里是任务层面的 operational collapse,不是宣称 sample 与 unit 在本体上永远相同,也不是要求引入一个 latent-unit integral。
最后一种情况尤其要保守:数据不够时,应降级问题、补充证据或 abstain,而不是把“最相似 sample”宣布成同一个 unit。
这只是论文地基,还不是贡献本身
到这里,我们只得到一个基础结论:当任务要求跨 observations、contexts 或 queries 保持“同一个对象”时,sample 不能独自承担全部语义,unit 必须被单独声明。
不足以构成 novelty
- 只说 unit ≠ sample
- 只加 subject ID
- 只加 random effect
- 把 ordinary latent 改名为 unit
- 声称全领域没有 unit
USL-01 必须继续建立
- Population selection 与 persistent referent/address
- learned response content 与 population-event evidence
- world conditional 与 learner belief 的分离
- fixed-individual variation、objective、split 与 query
- 按 event subject 区分 formal \(u\)、既有 entity embeddings、grouped latent models 与 random effects
论文还需要证明这些对象是否构成额外且可证伪的共同 contract。这些更强内容属于论文正文与附录,不应阻塞概念入口。
代表性一手来源
这是概念地图的 anchor,不是完整 novelty audit。
这页现在应该先接受你的基础审查
最值得反馈的是三条边界:unit 的声明尺度是否清楚且声明后不再偷换;sample-only 判断条件是否过严或过松;USL-01 还需要什么形式条件,才不会被 mixed effects / grouped latent 完全吸收。