USL-01Unit as Primitive
USL-01 conceptual primer · foundations first

Unit 和 sample 到底有什么不同?

这不是术语游戏。它决定数据按谁计数、哪些记录相关、测试集应该怎样切,以及模型究竟是在预测一条新记录,还是一个新的对象。

public owner-review preview · not a formal releasev1.4 · 2026-07-28 direct-address-response-content contractlocal source v0.15 · public contract v0.12verified main PDF v0.14 · supplement v0.9noindex · navigation refreshed 2026-07-31
THE DISTINCTIONUnit 是对象,sample 是一次观测

同一个 unit 可以留下多条 samples;一条 sample 也可能牵涉多个 units。

ACADEMIC REALITY学界早已局部地区分

experimental unit、subject、cluster、random effect、causal unit、group split 都是已有处理。

SAMPLE-ONLY?可以,而且有时正是正确做法

当 unit 与 record 在当前 design/query 下 operationally collapse,就没必要强造 latent unit。

Question 0 · vocabulary

两个词分别指什么?

Population selector / Individual

Population Unit Selection Variable \(U\sim\Pi\) 执行 selection,它的随机性回答 which individual;事件 \(U=u\) 固定/表示其 definite persistent referent,患者、设备、注册账户、企业或医院都可在当前任务声明下成为 unit。realized \(u\in\mathcal U\) 表示 persistent referent,并以语义方式索引 \(f(x;u)\);\(\mathcal U\) 不必是数值空间。Direct-ID 下 \(k\mapsto u(k)\) 固定 referent 与稳定 response/update address,而 embedding、factor 或 random effect \(u_\theta(k)\) 仍由 downstream objective 在该地址学习。

Sample / observation

关于某个 individual 的一次 realized record,例如一次就诊、一个传感器窗口、一轮 interaction 或一张图像;sample index 只定位 realized values,其中哪些 values 可以成为 evidence,取决于 answer-time information protocol。

$$U\sim\Pi,\qquad u\in\mathcal U,\qquad (X_u,Y_u)\sim K_{X,Y}(\cdot;u),\qquad P_\theta(dy\mid x;u)$$

这里要分开两种随机性:\(U\) 表示 which-individual randomness;固定 \(u\) 后,kernel 仍保留 context、event 与 exogenous variation。需要显式 disturbance 时可以写:

$$Y_u=g(X_u,\varepsilon;u)$$

但这不自动假设 \(\varepsilon\perp U\)、\(\varepsilon\perp X\mid U\)、IID observations 或 causal exogeneity。

$$\mathcal O^F=\text{admissible factual information},\qquad P(U\in du\mid\mathcal O^F),\qquad Q_\phi(du\mid\mathcal O^F)$$

若 factual evidence 是正概率 population event,使用 ordinary conditioning;若它是连续 random element 的 realized value,则上式表示 regular conditional kernel 在该 value 处的版本,而不是对零概率 singleton 做比值。\(P\) 是 world conditional,\(Q_\phi\) 是以它为目标的 learner belief;二者未经 calibration、correct specification 或 sufficient evidence 不必相等。

$$\widehat P_{\theta,\phi}(dy^Q\mid\mathcal O^F;x^Q,c^Q)=\int_{\mathcal U}P_\theta(dy^Q\mid x^Q,c^Q,u)Q_\phi(du\mid\mathcal O^F)$$

Evidence–query boundary:\(\mathcal O^F\) 一次形成 unit belief;多个 \((x^Q,c^Q)\) queries 复用它。Candidate \(x^Q\) 不重新进入 Unit Abduction,也不会因为被送入 predictor 就自动成为 evidence;fixed-\(u\) 后直接改变 response 的信息必须显式声明为 \(c^Q\),不能把整包 \(\mathcal O^F\) 回灌 response kernel。\(\mathcal O^F\) 中若含 \(Y^{\mathrm{hist}}\),它只能是已观察的历史 response,不是当前要预测的 target \(Y^Q\)。

需要抽样时怎样写:使用 evidence-explicit 的 \(\widetilde U_\phi\mid\mathcal O^F\sim Q_\phi(\cdot\mid\mathcal O^F)\)。它是 learner-side 抽到的 candidate unit,不是 belief measure 本身、world-side 已实现的 individual、row attribution,也不是 direct-ID 模型在固定地址学习的 \(u_\theta(k)\)。旧式 \(U_i^{\mathrm{abd}}\) 至多是这个 draw 的 deprecated shorthand。

1 : 1一 unit / 一 sample

每位患者只有一次基线记录;当前任务中常可折叠。

1 : MANY一 unit / 多 samples

同一设备产生 100 个窗口;通常不能直接折叠。

MANY : 1一 sample / 多 units

一场比赛、多方交易或一条 graph edge;须声明 focal unit 与 interaction。

NONE没有任务相关的持续 unit

只关心独立事件的下一次边际分布;sample-only 可能正好。

先声明 Population-to-Individual selection,再讨论观测 attribution

一般问题从 \(U\sim\Pi\)、event \(\mathcal O\) 与 fixed-individual response 开始。只有 observation protocol 已观察或可靠揭示 attribution 时,数据才可额外记录 \(u_i\):

$$\mathcal D_U^{\rm obs}=\{(x_i,y_i;u_i)\}_{i=1}^N,\qquad i\neq j,\ u_i=u_j\Longrightarrow\text{两条 observations 属于同一个 individual}$$

这里 \(i\mapsto u_i\) 只记录 protocol 已知的 attribution;一般 latent-attribution learner 不能预先接收 unknown \(u_i\)。Repeated observations 的 joint assignment law 也尚未被这个记号冻结,不能默认为 independent Population draws。

\(U\sim\Pi\)Population selector

随机性回答 population 中 which individual 被选择。

\(U=u\)Persistent referent

固定/表示 definite individual,并以语义方式索引 \(f(x;u)\);\(\mathcal U\) 不必是数值空间。

\(P(U\in du\mid\mathcal O^F)\)World conditional

population law 在 factual evidence 下给出的 which-individual conditional。

\(Q_\phi(du\mid\mathcal O^F)\)One reusable belief

以 world conditional 为目标的 learner belief;多个 queries 通过 explicit \(c^Q\) response law 复用它。

\(k\mapsto u(k)\)Resolver key → referent + address

trusted ID 按声明的 registry contract 固定 persistent referent 与稳定 response/update address。

\(u_\theta(k)\)Learned response content

该地址上的 embedding、factor 或 random effect,由 response objective 学习;坐标可重参数化,不是 person 本身。

Known-ID boundary:只有当 protocol 明确保证 ID evidence 揭示 selected individual,which-individual conditional 才退化为 Dirac;这个 Dirac 落在 persistent referent \(u(k)\) 上,绝不在 trainable \(u_\theta(k)\) 上——embedding、factor 或 random effect 的估计误差仍属于 response model,identity certainty 不等于 response-content certainty。

深入:\(U=u\) 到底是什么意思?Population selection、world conditional、learner belief 与 fixed-individual response noise 怎样分型。
Question 1 · concrete consequence

1000 行不一定是 1000 个独立对象

100 位患者 × 每人 10 次就诊 = 1000 rows

数据表有 1000 行,但不等于有 1000 个彼此独立的患者。如果直接把每一行当作一个新对象,至少有五种风险:

  1. 计数和加权错位。就诊更多的患者会自动获得更大权重;这只有在目标确实是“随机一条就诊记录”时才合理。
  2. 个体差异与当次波动混在一起。同一人的短期变化和不同人的长期差异被压成普通 sample variation。
  3. 训练—测试泄漏。同一患者的记录可能同时进入 train 和 test,却被误报为对新患者的泛化。
  4. 有效信息量被夸大。同一 unit 的多次相关观测不能无条件冒充同样数量的独立 units。
  5. Same-unit question 失去锚点。模型可以预测条件响应,却不能仅凭“找到一条相似记录”把结果解释成同一个对象在另一种 treatment 下会怎样;similarity 不等于 same-unit counterfactual。
ROW-WEIGHTED RISK
$$I(u):=\{i:u_i=u\},\quad m(u):=|I(u)|,\qquad \widehat R_{\mathrm{row}}=\frac{1}{N}\sum_{i=1}^{N}\ell_i$$

服务“随机一条 observation”。

UNIT-WEIGHTED RISK
$$\widehat R_{\mathrm{unit}}=\frac1{|\mathcal U_D|}\sum_{u\in\mathcal U_D}\frac1{m(u)}\sum_{i\in I(u)}\ell_i$$

服务“随机一个 unit”。

二者都可能合理;错误在于没有声明 estimand 就把一个当成另一个。区分 unit/sample 的好处,是迫使论文回答:你到底在随机抽一行,还是随机抽一个对象?

$$\mathcal U(D):=\{u_i:i\in D\},\qquad\begin{aligned}\mathcal U(D_{\rm test})&\subseteq\mathcal U(D_{\rm train}) &&\text{known-unit evaluation},\\ \mathcal U(D_{\rm test})&\cap\mathcal U(D_{\rm train})=\varnothing &&\text{new-unit evaluation}.\end{aligned}$$

同一数据,两个 generalization problems:看过患者 A 的历史后预测 A 的下一次就诊;或者预测一位从未见过的新患者。随机逐行切分可以评估前者,却常被误报成后者。Saeb et al. (2017) ↗ 在临床传感数据中发现 record-wise CV 会显著高估面向新受试者的性能。

Question 2 · benefits

区分以后,具体得到什么?

区分 unit 与 sample 并不自动带来一种新模型;它先让以下六层对齐:

01

Data

哪些 records 属于同一个持续对象?

02

Objective

每条 record 等权,还是每个 unit 等权?

03

Split

评估同一 unit 的新 observation,还是从未见过的新 unit?

04

Persistent unit / address

哪一个 referent 跨 observations 持续;哪些 records 路由到同一稳定 response/update address?

05

Response property / state

embedding、factor、random effect 或 dynamic state 如何由 response objective 学习或更新?

06

Query

treatment 或 context 改变时,回答是否仍指向同一个响应承受者?

这套对齐可以服务普通预测、个性化、纵向建模和因果问题;它本身不承诺因果识别,也不要求 latent variable、Bayesian posterior 或某一种 neural architecture。
Running example · recommender system

推荐系统把所有边界放进同一条链

固定注册账户 42

User / registered account 是 unit;一次 interaction 是 sample;实际曝光的 item / slate 是 treatment / action;click、purchase、retention 是 outcome。同一个 user 会贡献多条 interaction rows,因此 unit 与 sample 不再能靠“一行一个对象”自动折叠。此时还必须区分普通 logged prediction 与 same-user alternative-treatment question;能写出后者,不等于现有日志已经识别它。

$$Y_{u_{42}}(a)\quad\text{versus}\quad Y_{u_{42}}(a'),\qquad U=u_{42}\ \text{held fixed}$$

这个式子只给 alternative-treatment question 一个 same-unit referential anchor;它不证明 counterfactual identification。账户 42 的完整 estimand、future policy 和 logged-policy boundary 留给案例页。

进入完整贯穿案例:推荐系统为什么需要 unit?从账户 42 的 interaction log 与 candidate reuse,一直走到 PMF known-referent property 和 causal-identification boundary。
Question 3 · academic landscape

学界是不是从来没有区分过?

不是。多个传统已经局部处理了 unit:

传统unit 怎样出现已经解决什么
实验设计 / samplingexperimental unit、sampling unit、cluster随机化层级、真正复制数、pseudoreplication
纵向 / repeated-measures 统计subject / entity indexwithin-unit dependence、within/between variation
Mixed / hierarchical modelsgroup-specific random effectpartial pooling、subject-specific prediction
因果推断unit-indexed potential outcomes定义同一 unit 在不同 treatment 下的 response
推荐、grouped learning 与 evaluationuser ID、group latent、grouped splitpersonalization、共享表示、避免 group leakage
不能写的 novelty 叙事USL-01 不能声称“机器学习没有 unit”,也不能把“unit 不等于 sample”本身当作 novelty。本文真正要追问的是:这些局部做法中的 data group、statistical subject、model representation、evaluation group 和 query focal entity,能否被一套清楚的 contract 贯穿,而不在 pipeline 中偷偷换对象。
Question 4 · why no universal primitive

为什么没有一个通用的 unit primitive?

不需要诉诸“大家没有想到”。更自然的原因是:

很多常见数据集恰好一 unit 一 record。 此时显式 unit layer 不增加可见信息。

i.i.d. sample 是非常成功的抽象。 主动忽略来源历史,换来了统一的优化与泛化语言。

unit 的声明粒度依赖具体问题。 人、家庭、医院或组织都可能是正确尺度;声明后不能在回答过程中偷换。

有可靠 ID 时局部工具往往已经够用。 known-individual grouping 或 response modeling 即可工作;ID 可以按声明的 registry contract 固定 referent 与稳定 update address,但该地址上的 embedding、factor 或 state 仍可由 response objective 学习。

没有证据时不能凭空恢复 unit。 缺少 ID、repeats 或 linkage evidence 时,唯一 unit 无法被凭空恢复。

所以问题不是所有任务都要增加一个 unit variable,而是:当前问题是否依赖一个跨 observations 或 queries 持续不变的响应承受者?
Question 5 · sample only?

只有 sample、没有显式 unit,可以吗?

可以。用下面的判断就够了:关键是区分“unit 对当前问题不需要”和“unit 很重要,但现有数据无法识别”。

YES · 可以安全折叠

Operational collapse

  • 每个目标 unit 恰好贡献一条 record
  • records 对当前 query 可视为独立
  • 目标是新 unit 的边际预测
  • 不需要 same-unit history、alternative-treatment comparison 或 unit-level attribution
  • train/test split 和 metric 的计数对象与部署目标一致
NO · 不能无声明地折叠

结构被丢失

  • 同一 unit 有多条相关 observations
  • observation 频次会改变 unit 的隐含权重
  • 需要区分 known-unit 与 new-unit generalization
  • query 要求固定同一个对象再改变 treatment、context 或 policy
  • unit 很重要,但 grouping / linkage 在数据中不可见

在 observed-attribution regime,令 \(m(u):=\sum_{i=1}^N\mathbf 1\{u_i=u\}\) 计数已声明 individual \(u\) 的 records。一种最清楚的退化情形是:

$$\begin{gathered}m(u)=1\quad\forall u\in\mathcal U_{\mathcal D}^{\mathrm{obs}},\\ \text{target}=\text{new-unit marginal prediction},\\ \Longrightarrow\quad\text{one record may operationally represent}\\ \text{one unit in this task}.\end{gathered}$$

这里是任务层面的 operational collapse,不是宣称 sample 与 unit 在本体上永远相同,也不是要求引入一个 latent-unit integral。

最后一种情况尤其要保守:数据不够时,应降级问题、补充证据或 abstain,而不是把“最相似 sample”宣布成同一个 unit。

What this means for USL-01

这只是论文地基,还不是贡献本身

到这里,我们只得到一个基础结论:当任务要求跨 observations、contexts 或 queries 保持“同一个对象”时,sample 不能独自承担全部语义,unit 必须被单独声明。

不足以构成 novelty

  • 只说 unit ≠ sample
  • 只加 subject ID
  • 只加 random effect
  • 把 ordinary latent 改名为 unit
  • 声称全领域没有 unit

USL-01 必须继续建立

  • Population selection 与 persistent referent/address
  • learned response content 与 population-event evidence
  • world conditional 与 learner belief 的分离
  • fixed-individual variation、objective、split 与 query
  • 按 event subject 区分 formal \(u\)、既有 entity embeddings、grouped latent models 与 random effects

论文还需要证明这些对象是否构成额外且可证伪的共同 contract。这些更强内容属于论文正文与附录,不应阻塞概念入口。

Primary-source reading map

代表性一手来源

这是概念地图的 anchor,不是完整 novelty audit。