01 · Starting point
我先学习的不是 attention weight,而是“这个 unit 可能是谁”
在 DiscoSCM / Unit Abduction 的语言里,我不把每个样本直接压成一个确定向量。 世界侧有一个 model-level Unit Selection Variable \(U\),record \(i\) 对应事件 \(U=u_i\); learner 看不见真实 \(u_i\),只能从合法的 factual evidence \(X_i\) 中学习一张 belief:
这里的 \(\mathcal A_{\widehat\phi}\) 是可学习的 Abduction Network。 因此 \(\widehat Q_i\) 不是人工给定的标签,也不是 parameter-free 的统计量;它是模型从 evidence 中学出的、 probability-measure-valued unit representation。训练完成后在 application time 冻结它,是为了 honesty, 不是说它没有被学习。
一旦有了这张 belief,新的问题自然出现:面对 focal unit \(i\),哪些 observed donors \(j\) 的 causal evidence 值得被读取?这正是 attention 要回答的问题。
02 · Computational grammar
Attention 的本体不是向量,而是 compatibility、normalization 与 Reduction
标准 attention 经常写成 query vector、key vector 与 value vector 的矩阵计算。但从 operator 的角度看, 更基本的骨架是:让一个 focal query 评价多个 candidate keys,把 compatibility 归一化成非负权重,再聚合 values。
DiscoCATE 保留了这套计算语法,但改变了 attention 所作用的数学对象。 Query 不再必须是 \(\mathbb R^d\) 中的 point vector;它可以是对一个 latent unit variable 的完整 probability measure。 而 value 也不只是 hidden state:在当前 causal estimator 中,它是 honest、cross-fitted 的 orthogonal causal score \(\widehat\Gamma_j\)。
我现在更愿意这样概括:Abduction 学习 unit-belief geometry;Attention 决定怎样在这张 geometry 中读取 donor evidence;Reduction 把读取结果变成 causal estimand。
03 · Operator A
第一种是对称的 belief-kernel attention
最直接的路线,是比较 focal belief \(\widehat Q_i\) 与 donor belief \(\widehat Q_j\) 在同一 latent candidate-type space 中是否接近:
如果 \(d\) 取 Hellinger、Jensen--Shannon 等 symmetric distance,那么 pairwise compatibility 本身是对称的。 归一化后的 attention matrix 未必对称,因为 focal row 的 donor set、mask 与分母可能不同;但它的底层问题仍然是: “这两个 learned beliefs 是否把概率质量放在相近的 response-relevant candidate types 上?”
这条路线保留 multimodality、dispersion 与 heavy-tailed uncertainty,避免把完整 belief 过早压成 posterior mean 或 hard class。 它是当前 DiscoCATE-DR 的默认 localization route。
04 · Operator B
第二种不是“另一种距离”,而是不对称的 likelihood attention
另一条路线改变了 key 的类型。对 donor \(j\),我先把它的 pretreatment evidence 写成 latent-unit space 上的 likelihood function:
这时 query 是 focal belief \(\widehat Q_i\),key 是 donor evidence 所定义的 likelihood profile \(L_j^X\)。 这个积分问的不是“两个 posterior 看起来像不像”,而是:
如果我对 focal unit \(i\) 的 candidate identity / mechanism belief 是合理的,那么 donor \(j\) 的 evidence 有多大可能由这些 candidates 生成?
因而它在归一化之前就天然有方向:通常 \(s_{i\to j}^{X}\neq s_{j\to i}^{X}\)。箭头表示 focal belief \(i\) 在评价 donor evidence \(j\); 真正聚合 causal information 时,value 仍然从 donor \(j\) 流向 focal \(i\)。
这条式子也揭示了它与 standard query–key dot product 的更深联系:
它同样是 learned 的:\(Q_i\) 由 \(\widehat\phi\) 学得,generative evidence model \(p_{\widehat\psi}(x\mid u)\) 也可以在外部数据或 outer folds 上学习,然后在 application time 冻结。 所以这不是一个固定 likelihood table,而是一个有明确 probabilistic semantics 的 learned asymmetric attention operator。
05 · One theory, two operators
它们属于同一条理论链,但不能被合并成同一个“相似度”
Learned Unit Abduction
两条路线都从 factual evidence 形成 query-invariant \(Q_i\),并保持同一个 unit belief 跨 causal queries 复用。
Similarity vs predictability
A 问两个 beliefs 是否接近;B 问 focal belief 能否预测 donor evidence。一个是 geometry,一个是 generative compatibility。
Observed-donor Reduction
两条 compatibility 都必须被拉回 observed donor rows,归一化后再聚合 \(\widehat\Gamma_j\)。\(Q_i\) 本身不是 row weight。
从这个角度看,DiscoCATE 不是只有一条 belief distance 公式。它提供的是一个更一般的接口: learned distribution-valued unit query,可以通过不同、但有清晰语义的 pairing operators 去读取 causal donor memory。
06 · Causal boundary
我希望扩大的是建模视角,不是扩大未经证明的 claim
这首先是 learner-side information routing。 \(j\) 获得较高 attention weight,不表示 world-side unit \(j\) 导致 unit \(i\)。
只有一个 model-level \(U\)。 \(Q_i,Q_j\) 是 evidence-indexed beliefs,不是为每一行新造的 row-indexed selector variables。
Ex-ante likelihood attention 只读取 pretreatment evidence。 如果 score 使用 realized \(Y_j,T_j\),而同一 row 又贡献 \(\Gamma_j\),就发生 outcome-dependent selection。
Distributional attention 本身不是我们的 priority claim。 我们更窄的候选贡献,是 unit ontology、learned abduction、honest donor localization 与 causal estimand 的组合。
特别是 response likelihood \(\int p_{\widehat\theta}(Y_j,T_j\mid X_j,u)\widehat Q_i(du)\) 确实还会产生另一种 asymmetric attention;但它属于 ex-post matching / explanation estimand,不能未经区分地进入当前 ex-ante DiscoCATE-DR。
07 · My current formulation
我现在会怎样说这两个理论之间的联系
Unit Abduction 先从 factual evidence 中学习一个关于 focal unit 的 probability-measure-valued query。 DiscoCATE 再给出两种让这个 query 读取 donor evidence 的机制:一种通过两个 unit beliefs 的对称几何, 另一种通过 focal belief 与 donor likelihood function 的不对称配对。二者都把 learned epistemic compatibility 转换为 observed-donor attention weights,并通过 honest causal Reduction 得到明确的 soft-population estimand。
这个联系既解释了当前论文为什么不是简单的“换一种距离做 CATE”,也指出了一条未来路线: learned metric、learned likelihood scorer、multi-head belief attention 或 query-conditioned attention。 但这些是下一步 research program,不是本文已经完成的理论或实验结果。
References and positioning
延伸阅读
- DiscoCATE 论文入口:当前 estimator、identification ladder 与 claim boundary。
- Vaswani et al., Attention Is All You Need:standard scaled dot-product attention。
- Vuckovic, Baratin & Tachet des Combes, A Mathematical Theory of Attention:measure-theoretic attention 的既有基础。