DiscoCATECompanion technical note
Technical note · rationale / proposal 2026-07-18 · first-person research note

Unit Abduction · probability measures · causal localization

我为什么把
Unit Abduction
看成一种 Attention

从两个 learned unit beliefs 的对称几何,到 focal belief 对 donor evidence 的不对称 likelihood pairing。

我不是想把一个流行术语贴到已有公式上。我真正关心的是:当一个 unit 不再由单个向量代表, 而由一个关于其 response-relevant identity 的完整 belief 表示时,我们应该怎样决定“谁可以为它发言”?

这篇文章的位置

它解释论文背后的 modeling rationale,不是 manuscript 已证明的新 theorem,也不把 proposal 写成完成态的 Attention Network。

01 · Starting point

我先学习的不是 attention weight,而是“这个 unit 可能是谁”

在 DiscoSCM / Unit Abduction 的语言里,我不把每个样本直接压成一个确定向量。 世界侧有一个 model-level Unit Selection Variable \(U\),record \(i\) 对应事件 \(U=u_i\); learner 看不见真实 \(u_i\),只能从合法的 factual evidence \(X_i\) 中学习一张 belief:

\[ \widehat Q_i(du) = \mathcal A_{\widehat\phi}(X_i)(du). \]

这里的 \(\mathcal A_{\widehat\phi}\) 是可学习的 Abduction Network。 因此 \(\widehat Q_i\) 不是人工给定的标签,也不是 parameter-free 的统计量;它是模型从 evidence 中学出的、 probability-measure-valued unit representation。训练完成后在 application time 冻结它,是为了 honesty, 不是说它没有被学习。

一旦有了这张 belief,新的问题自然出现:面对 focal unit \(i\),哪些 observed donors \(j\) 的 causal evidence 值得被读取?这正是 attention 要回答的问题。

02 · Computational grammar

Attention 的本体不是向量,而是 compatibility、normalization 与 Reduction

标准 attention 经常写成 query vector、key vector 与 value vector 的矩阵计算。但从 operator 的角度看, 更基本的骨架是:让一个 focal query 评价多个 candidate keys,把 compatibility 归一化成非负权重,再聚合 values。

\[ \operatorname{Attn}(q;\{k_j,v_j\}) = \sum_j \frac{\exp\{a(q,k_j)\}} {\sum_\ell\exp\{a(q,k_\ell)\}} v_j. \]

DiscoCATE 保留了这套计算语法,但改变了 attention 所作用的数学对象。 Query 不再必须是 \(\mathbb R^d\) 中的 point vector;它可以是对一个 latent unit variable 的完整 probability measure。 而 value 也不只是 hidden state:在当前 causal estimator 中,它是 honest、cross-fitted 的 orthogonal causal score \(\widehat\Gamma_j\)。

我现在更愿意这样概括:Abduction 学习 unit-belief geometry;Attention 决定怎样在这张 geometry 中读取 donor evidence;Reduction 把读取结果变成 causal estimand。

03 · Operator A

第一种是对称的 belief-kernel attention

最直接的路线,是比较 focal belief \(\widehat Q_i\) 与 donor belief \(\widehat Q_j\) 在同一 latent candidate-type space 中是否接近:

AMeasure–measure metric pairing
\[ s_{ij}^{\mathrm{metric}} = -d(\widehat Q_i,\widehat Q_j), \qquad \widehat\alpha_{ij} \propto K_h\{d(\widehat Q_i,\widehat Q_j)\}. \]

如果 \(d\) 取 Hellinger、Jensen--Shannon 等 symmetric distance,那么 pairwise compatibility 本身是对称的。 归一化后的 attention matrix 未必对称,因为 focal row 的 donor set、mask 与分母可能不同;但它的底层问题仍然是: “这两个 learned beliefs 是否把概率质量放在相近的 response-relevant candidate types 上?”

这条路线保留 multimodality、dispersion 与 heavy-tailed uncertainty,避免把完整 belief 过早压成 posterior mean 或 hard class。 它是当前 DiscoCATE-DR 的默认 localization route。

04 · Operator B

第二种不是“另一种距离”,而是不对称的 likelihood attention

另一条路线改变了 key 的类型。对 donor \(j\),我先把它的 pretreatment evidence 写成 latent-unit space 上的 likelihood function:

BMeasure–function likelihood pairing
\[ L_j^X(u):=p_{\widehat\psi}(X_j\mid u), \qquad s_{i\to j}^{X} = \langle\widehat Q_i,L_j^X\rangle = \int p_{\widehat\psi}(X_j\mid u)\,\widehat Q_i(du). \]

这时 query 是 focal belief \(\widehat Q_i\),key 是 donor evidence 所定义的 likelihood profile \(L_j^X\)。 这个积分问的不是“两个 posterior 看起来像不像”,而是:

如果我对 focal unit \(i\) 的 candidate identity / mechanism belief 是合理的,那么 donor \(j\) 的 evidence 有多大可能由这些 candidates 生成?

因而它在归一化之前就天然有方向:通常 \(s_{i\to j}^{X}\neq s_{j\to i}^{X}\)。箭头表示 focal belief \(i\) 在评价 donor evidence \(j\); 真正聚合 causal information 时,value 仍然从 donor \(j\) 流向 focal \(i\)。

这条式子也揭示了它与 standard query–key dot product 的更深联系:

Vector attention\(q_i^\top k_j\)vector ↔ vector
Likelihood attention\(\langle Q_i,L_j^X\rangle\)measure → function

它同样是 learned 的:\(Q_i\) 由 \(\widehat\phi\) 学得,generative evidence model \(p_{\widehat\psi}(x\mid u)\) 也可以在外部数据或 outer folds 上学习,然后在 application time 冻结。 所以这不是一个固定 likelihood table,而是一个有明确 probabilistic semantics 的 learned asymmetric attention operator。

05 · One theory, two operators

它们属于同一条理论链,但不能被合并成同一个“相似度”

共同起点

Learned Unit Abduction

两条路线都从 factual evidence 形成 query-invariant \(Q_i\),并保持同一个 unit belief 跨 causal queries 复用。

不同问题

Similarity vs predictability

A 问两个 beliefs 是否接近;B 问 focal belief 能否预测 donor evidence。一个是 geometry,一个是 generative compatibility。

共同终点

Observed-donor Reduction

两条 compatibility 都必须被拉回 observed donor rows,归一化后再聚合 \(\widehat\Gamma_j\)。\(Q_i\) 本身不是 row weight。

\[ \widehat\alpha_{ij}^{(r)} = \operatorname{Normalize}_{j\in\mathcal I_i^{\mathrm{donor}}} \{s_{ij}^{(r)}\}, \qquad \widehat\tau_i^{(r)} = \sum_j\widehat\alpha_{ij}^{(r)}\widehat\Gamma_j, \quad r\in\{\mathrm{metric},X\text{-likelihood}\}. \]

从这个角度看,DiscoCATE 不是只有一条 belief distance 公式。它提供的是一个更一般的接口: learned distribution-valued unit query,可以通过不同、但有清晰语义的 pairing operators 去读取 causal donor memory。

06 · Causal boundary

我希望扩大的是建模视角,不是扩大未经证明的 claim

01

这首先是 learner-side information routing。 \(j\) 获得较高 attention weight,不表示 world-side unit \(j\) 导致 unit \(i\)。

02

只有一个 model-level \(U\)。 \(Q_i,Q_j\) 是 evidence-indexed beliefs,不是为每一行新造的 row-indexed selector variables。

03

Ex-ante likelihood attention 只读取 pretreatment evidence。 如果 score 使用 realized \(Y_j,T_j\),而同一 row 又贡献 \(\Gamma_j\),就发生 outcome-dependent selection。

04

Distributional attention 本身不是我们的 priority claim。 我们更窄的候选贡献,是 unit ontology、learned abduction、honest donor localization 与 causal estimand 的组合。

特别是 response likelihood \(\int p_{\widehat\theta}(Y_j,T_j\mid X_j,u)\widehat Q_i(du)\) 确实还会产生另一种 asymmetric attention;但它属于 ex-post matching / explanation estimand,不能未经区分地进入当前 ex-ante DiscoCATE-DR。

07 · My current formulation

我现在会怎样说这两个理论之间的联系

Unit Abduction 先从 factual evidence 中学习一个关于 focal unit 的 probability-measure-valued query。 DiscoCATE 再给出两种让这个 query 读取 donor evidence 的机制:一种通过两个 unit beliefs 的对称几何, 另一种通过 focal belief 与 donor likelihood function 的不对称配对。二者都把 learned epistemic compatibility 转换为 observed-donor attention weights,并通过 honest causal Reduction 得到明确的 soft-population estimand。

这个联系既解释了当前论文为什么不是简单的“换一种距离做 CATE”,也指出了一条未来路线: learned metric、learned likelihood scorer、multi-head belief attention 或 query-conditioned attention。 但这些是下一步 research program,不是本文已经完成的理论或实验结果。

References and positioning

延伸阅读