设 X \mathcal{X} X 为输入空间,y ∈ { 1 , … , K } y \in \{1, \dots, K\} y ∈ { 1 , … , K } 为类别标签。一个 K K K 分类器的输出在数学上究竟是什么?若要求它给出「属于各类别的概率」,则输出必须落在
Δ K − 1 = { p ∈ R K : p k ≥ 0 , ∑ k = 1 K p k = 1 } \Delta^{K-1} = \left\{ \mathbf{p} \in \mathbb{R}^K : p_k \ge 0,\ \textstyle\sum_{k=1}^K p_k = 1 \right\} Δ K − 1 = { p ∈ R K : p k ≥ 0 , ∑ k = 1 K p k = 1 } 之中——概率单纯形 上的一个点。这是分类器输出的自然状态空间:它不是 R K \mathbb{R}^K R K ,而是一个 ( K − 1 ) (K-1) ( K − 1 ) 维的紧凸集。
一旦承认了这一点,一个二阶问题便随即出现:分类器对自身输出的把握 有多大?若把输出建模为单纯形上的一个确定点 p \mathbf{p} p ,则这个问题在表达力上是被禁止的:单纯形内部不存在可以指代「无信息」的元素,因为每个点都是一份完整的、和为 1 1 1 的断言。要回答二阶问题,必须把输出从「单纯形上的点」提升为「单纯形上的分布」。承担这一角色的标准对象正是 迪利克雷分布(Dirichlet distribution) 。
本文的组织如下。第一部分给出迪利克雷分布的形式化定义、生成性刻画与几何图像。第二部分展开其矩结构、重参数化、共轭更新与分裂构造,并澄清「伪计数」这一常见的直观说法在何处成立、在何处失效。第三部分经由主观逻辑(subjective logic)建立迪利克雷分布与神经网络输出之间的双射,由此引入证据深度学习(Evidential Deep Learning, EDL)。第四部分推导 EDL 的损失函数族及其理论缺陷。第五部分讨论其应用形态与边界。第六部分总结。
定义 1.1(概率单纯形) 对整数 K ≥ 2 K \ge 2 K ≥ 2 ,K − 1 K-1 K − 1 维标准单纯形定义为
Δ K − 1 = { x = ( x 1 , … , x K ) ∈ R K : x i ≥ 0 , ∑ i = 1 K x i = 1 } \Delta^{K-1} = \left\{ \mathbf{x} = (x_1, \dots, x_K) \in \mathbb{R}^K : x_i \ge 0,\ \textstyle\sum_{i=1}^K x_i = 1 \right\} Δ K − 1 = { x = ( x 1 , … , x K ) ∈ R K : x i ≥ 0 , ∑ i = 1 K x i = 1 }
其内部记作 int Δ K − 1 = { x ∈ Δ K − 1 : x i > 0 , ∀ i } \operatorname{int}\Delta^{K-1} = \{\mathbf{x} \in \Delta^{K-1} : x_i > 0,\ \forall i\} int Δ K − 1 = { x ∈ Δ K − 1 : x i > 0 , ∀ i } 。
Δ K − 1 \Delta^{K-1} Δ K − 1 是 R K \mathbb{R}^K R K 中的紧凸集,其顶点为坐标向量 e 1 , … , e K \mathbf{e}_1, \dots, \mathbf{e}_K e 1 , … , e K 。低维特例给出了全部几何直观:K = 2 K = 2 K = 2 时它是一维线段,K = 3 K = 3 K = 3 时是二维三角形,K = 4 K = 4 K = 4 时是三维四面体。它与 K K K 个取值上的离散概率分布全体一一对应,因此「分类器的输出」与「单纯形上的点」是同一件事的两种说法。
本文采用如下测度约定:以 x 1 , … , x K − 1 x_1, \dots, x_{K-1} x 1 , … , x K − 1 为自由坐标、x K = 1 − ∑ i < K x i x_K = 1 - \sum_{i<K} x_i x K = 1 − ∑ i < K x i ,并以 x \mathbf{x} x 上的 ( K − 1 ) (K-1) ( K − 1 ) 维 Lebesgue 测度 d x 1 ⋯ d x K − 1 \mathrm{d}x_1 \cdots \mathrm{d}x_{K-1} d x 1 ⋯ d x K − 1 为参考测度。在该约定下 Δ K − 1 \Delta^{K-1} Δ K − 1 的体积为 1 / ( K − 1 ) ! 1/(K-1)! 1/ ( K − 1 )! ,这一点在后文讨论熵时会重新出现。
定义 1.2(Dirichlet 分布) 设参数向量 α = ( α 1 , … , α K ) ∈ R > 0 K \boldsymbol{\alpha} = (\alpha_1, \dots, \alpha_K) \in \mathbb{R}_{>0}^K α = ( α 1 , … , α K ) ∈ R > 0 K ,记 α 0 = ∑ i = 1 K α i \alpha_0 = \sum_{i=1}^K \alpha_i α 0 = ∑ i = 1 K α i 。若随机向量 x \mathbf{x} x 取值于 int Δ K − 1 \operatorname{int}\Delta^{K-1} int Δ K − 1 ,且关于上述参考测度的密度为
f ( x ∣ α ) = 1 B ( α ) ∏ i = 1 K x i α i − 1 f(\mathbf{x} \mid \boldsymbol{\alpha}) = \frac{1}{B(\boldsymbol{\alpha})} \prod_{i=1}^K x_i^{\alpha_i - 1} f ( x ∣ α ) = B ( α ) 1 ∏ i = 1 K x i α i − 1
则称 x \mathbf{x} x 服从参数为 α \boldsymbol{\alpha} α 的迪利克雷分布,记作 x ∼ Dir ( α ) \mathbf{x} \sim \operatorname{Dir}(\boldsymbol{\alpha}) x ∼ Dir ( α ) 。其中归一化常数为多元 Beta 函数 B ( α ) = ∏ i = 1 K Γ ( α i ) Γ ( α 0 ) B(\boldsymbol{\alpha}) = \frac{\prod_{i=1}^K \Gamma(\alpha_i)}{\Gamma\left(\alpha_0\right)} B ( α ) = Γ ( α 0 ) ∏ i = 1 K Γ ( α i )
该定义之所以合法,依赖于下述恒等式。它是整个理论的算术基础,值得单独给出证明。
命题 1.3(归一化恒等式) 对任意 α ∈ R > 0 K \boldsymbol{\alpha} \in \mathbb{R}_{>0}^K α ∈ R > 0 K ,
∫ Δ K − 1 ∏ i = 1 K x i α i − 1 d x = B ( α ) \int_{\Delta^{K-1}} \prod_{i=1}^K x_i^{\alpha_i - 1} \,\mathrm{d}\mathbf{x} = B(\boldsymbol{\alpha}) ∫ Δ K − 1 ∏ i = 1 K x i α i − 1 d x = B ( α )
证明 考虑 R > 0 K \mathbb{R}_{>0}^K R > 0 K 上的 Gamma 积分之积:
∏ i = 1 K Γ ( α i ) = ∫ R > 0 K ∏ i = 1 K t i α i − 1 e − t i d t \prod_{i=1}^K \Gamma(\alpha_i) = \int_{\mathbb{R}_{>0}^K} \prod_{i=1}^K t_i^{\alpha_i - 1} e^{-t_i} \,\mathrm{d}\mathbf{t} i = 1 ∏ K Γ ( α i ) = ∫ R > 0 K i = 1 ∏ K t i α i − 1 e − t i d t 作变量替换 t i = s x i t_i = s\, x_i t i = s x i ,其中 s = ∑ i t i > 0 s = \sum_i t_i > 0 s = ∑ i t i > 0 、x ∈ Δ K − 1 \mathbf{x} \in \Delta^{K-1} x ∈ Δ K − 1 。该替换的 Jacobi 行列式绝对值为 ∣ det J ∣ = s K − 1 |\det J| = s^{K-1} ∣ det J ∣ = s K − 1 (可由 K = 2 K = 2 K = 2 时的 det ( x 1 s x 2 − s ) = − s \det\begin{pmatrix} x_1 & s \\ x_2 & -s\end{pmatrix} = -s det ( x 1 x 2 s − s ) = − s 归纳验证)。代入得
∏ i = 1 K Γ ( α i ) = ∫ 0 ∞ ∫ Δ K − 1 s K − 1 ∏ i = 1 K ( s x i ) α i − 1 e − s ∑ i x i d x d s \prod_{i=1}^K \Gamma(\alpha_i) = \int_0^\infty \!\!\int_{\Delta^{K-1}} s^{K-1} \prod_{i=1}^K (s x_i)^{\alpha_i - 1} e^{-s \sum_i x_i} \,\mathrm{d}\mathbf{x} \,\mathrm{d}s i = 1 ∏ K Γ ( α i ) = ∫ 0 ∞ ∫ Δ K − 1 s K − 1 i = 1 ∏ K ( s x i ) α i − 1 e − s ∑ i x i d x d s 利用约束 ∑ i x i = 1 \sum_i x_i = 1 ∑ i x i = 1 ,被积函数中的 s s s 因子合并为 s K − 1 + α 0 − K = s α 0 − 1 s^{K - 1 + \alpha_0 - K} = s^{\alpha_0 - 1} s K − 1 + α 0 − K = s α 0 − 1 ,指数因子合并为 e − s e^{-s} e − s ,二者均与 x \mathbf{x} x 解耦:
∏ i = 1 K Γ ( α i ) = ( ∫ 0 ∞ s α 0 − 1 e − s d s ) ( ∫ Δ K − 1 ∏ i = 1 K x i α i − 1 d x ) = Γ ( α 0 ) ∫ Δ K − 1 ∏ i = 1 K x i α i − 1 d x \prod_{i=1}^K \Gamma(\alpha_i) = \left(\int_0^\infty s^{\alpha_0 - 1} e^{-s} \,\mathrm{d}s\right) \left(\int_{\Delta^{K-1}} \prod_{i=1}^K x_i^{\alpha_i - 1} \,\mathrm{d}\mathbf{x}\right) = \\ \Gamma(\alpha_0) \int_{\Delta^{K-1}} \prod_{i=1}^K x_i^{\alpha_i - 1} \,\mathrm{d}\mathbf{x} i = 1 ∏ K Γ ( α i ) = ( ∫ 0 ∞ s α 0 − 1 e − s d s ) ( ∫ Δ K − 1 i = 1 ∏ K x i α i − 1 d x ) = Γ ( α 0 ) ∫ Δ K − 1 i = 1 ∏ K x i α i − 1 d x 两端除以 Γ ( α 0 ) \Gamma(\alpha_0) Γ ( α 0 ) 即得结论。
命题 1.3 的证明过程本身包含了比结论更多的信息:s s s 与 x \mathbf{x} x 的完全可分离性 。下一小节的生成性刻画正是对这一可分离性的直接读解。
命题 1.4(Gamma 商表示) 设 γ 1 , … , γ K \gamma_1, \dots, \gamma_K γ 1 , … , γ K 相互独立且 γ i ∼ Gamma ( α i , 1 ) \gamma_i \sim \operatorname{Gamma}(\alpha_i, 1) γ i ∼ Gamma ( α i , 1 ) (形状 α i \alpha_i α i 、率 1 1 1 )。令
s = ∑ i = 1 K γ i , x i = γ i s , x = ( x 1 , … , x K ) s = \sum_{i=1}^K \gamma_i, \qquad x_i = \frac{\gamma_i}{s}, \qquad \mathbf{x} = (x_1, \dots, x_K) s = ∑ i = 1 K γ i , x i = s γ i , x = ( x 1 , … , x K )
则 x ∼ Dir ( α ) \mathbf{x} \sim \operatorname{Dir}(\boldsymbol{\alpha}) x ∼ Dir ( α ) ,且 x ⊥ ⊥ s \mathbf{x} \perp\!\!\!\perp s x ⊥ ⊥ s ,其中 s ∼ Gamma ( α 0 , 1 ) s \sim \operatorname{Gamma}(\alpha_0, 1) s ∼ Gamma ( α 0 , 1 ) 。
证明 由独立性,γ \boldsymbol{\gamma} γ 的联合密度为 ∏ i γ i α i − 1 e − γ i / Γ ( α i ) \prod_i \gamma_i^{\alpha_i - 1} e^{-\gamma_i} / \Gamma(\alpha_i) ∏ i γ i α i − 1 e − γ i /Γ ( α i ) 。施行与命题 1.3 相同的替换 γ i = s x i \gamma_i = s x_i γ i = s x i ,联合密度变换为
p ( s , x ) = s α 0 − 1 e − s Γ ( α 0 ) ⋅ Γ ( α 0 ) ∏ i = 1 K x i α i − 1 ∏ i = 1 K Γ ( α i ) = Gamma ( s ; α 0 , 1 ) ⋅ Dir ( x ; α ) p(s, \mathbf{x}) = \frac{s^{\alpha_0 - 1} e^{-s}}{\Gamma(\alpha_0)} \cdot \frac{\Gamma(\alpha_0) \prod_{i=1}^K x_i^{\alpha_i - 1}}{\prod_{i=1}^K \Gamma(\alpha_i)}
= \operatorname{Gamma}(s; \alpha_0, 1) \cdot \operatorname{Dir}(\mathbf{x}; \boldsymbol{\alpha}) p ( s , x ) = Γ ( α 0 ) s α 0 − 1 e − s ⋅ ∏ i = 1 K Γ ( α i ) Γ ( α 0 ) ∏ i = 1 K x i α i − 1 = Gamma ( s ; α 0 , 1 ) ⋅ Dir ( x ; α ) 右侧分解为仅含 s s s 与仅含 x \mathbf{x} x 的两个因子的乘积,故 s s s 与 x \mathbf{x} x 独立,且各自的边缘分布如命题所述。
命题 1.4 给出了三条即时的推论。其一,它提供了一个 O ( K ) O(K) O ( K ) 的精确采样算法:独立抽取 K K K 个 Gamma 变量再归一化,无需拒绝采样或逆变换。其二,它说明参数 α 0 = ∑ i α i \alpha_0 = \sum_i \alpha_i α 0 = ∑ i α i 在概率意义上是先于归一化的总质量 ,这一角色将在 2.2 节被重新参数化为一个精度参数。其三,它把迪利克雷分布与 Gamma 分布、进而与 Poisson 过程联系起来,这正是 2.5 节分裂构造的来源。
退化到 Beta 分布。 当 K = 2 K = 2 K = 2 时,约束 x 1 + x 2 = 1 x_1 + x_2 = 1 x 1 + x 2 = 1 使分布由单一变量 x 1 x_1 x 1 完全决定,密度退化为
f ( x 1 ∣ α 1 , α 2 ) = x 1 α 1 − 1 ( 1 − x 1 ) α 2 − 1 B ( α 1 , α 2 ) , 即 Dir ( α 1 , α 2 ) ≡ Beta ( α 1 , α 2 ) f(x_1 \mid \alpha_1, \alpha_2) = \frac{x_1^{\alpha_1 - 1}(1 - x_1)^{\alpha_2 - 1}}{B(\alpha_1, \alpha_2)},
\qquad \text{即} \qquad \operatorname{Dir}(\alpha_1, \alpha_2) \equiv \operatorname{Beta}(\alpha_1, \alpha_2) f ( x 1 ∣ α 1 , α 2 ) = B ( α 1 , α 2 ) x 1 α 1 − 1 ( 1 − x 1 ) α 2 − 1 , 即 Dir ( α 1 , α 2 ) ≡ Beta ( α 1 , α 2 ) 故迪利克雷分布是 Beta 分布在维度上的推广。下文所有关于迪利克雷分布的陈述,在 K = 2 K=2 K = 2 时都应退化为 Beta 分布的相应陈述,这构成了检验公式正确性的一个廉价判据。
边缘分布仍为 Beta。 更一般地,任意单个分量 x i x_i x i 的边缘分布是 Beta ( α i , α 0 − α i ) \operatorname{Beta}(\alpha_i, \alpha_0 - \alpha_i) Beta ( α i , α 0 − α i ) 。这一点可由命题 1.4 直接看出:x i = γ i / ( s ) x_i = \gamma_i / (s) x i = γ i / ( s ) ,而 γ i ⊥ ( s − γ i ) \gamma_i \perp (s - \gamma_i) γ i ⊥ ( s − γ i ) ,故 x i x_i x i 是相互独立的两个 Gamma 变量之比,其分布为 Beta。
与多项分布的共轭关系。 迪利克雷分布之所以在贝叶斯统计中占据中心位置,在于它是多项分布(等价地,分类分布)的共轭先验 。其确切含义与算术后果见 2.4 节。此处只指出其直觉:若先验以「伪计数」α \boldsymbol{\alpha} α 描述对各类别出现次数的初始信念,则观测到计数 n \mathbf{n} n 后,信念的更新只是 α ↦ α + n \boldsymbol{\alpha} \mapsto \boldsymbol{\alpha} + \mathbf{n} α ↦ α + n 。贝叶斯更新的全部计算复杂度,在这个共轭对中退化为一次向量加法。
命题 2.1(期望、方差与协方差) 设 x ∼ Dir ( α ) \mathbf{x} \sim \operatorname{Dir}(\boldsymbol{\alpha}) x ∼ Dir ( α ) 。则对任意 i , j i, j i , j E [ x i ] = α i α 0 , Var ( x i ) = α i ( α 0 − α i ) α 0 2 ( α 0 + 1 ) , Cov ( x i , x j ) = − α i α j α 0 2 ( α 0 + 1 ) ( i ≠ j ) \mathbb{E}[x_i] = \frac{\alpha_i}{\alpha_0}, \qquad \operatorname{Var}(x_i) = \frac{\alpha_i(\alpha_0 - \alpha_i)}{\alpha_0^2(\alpha_0 + 1)}, \qquad \operatorname{Cov}(x_i, x_j) = \frac{-\alpha_i \alpha_j}{\alpha_0^2(\alpha_0 + 1)} \quad (i \ne j) E [ x i ] = α 0 α i , Var ( x i ) = α 0 2 ( α 0 + 1 ) α i ( α 0 − α i ) , Cov ( x i , x j ) = α 0 2 ( α 0 + 1 ) − α i α j ( i = j )
证明 由命题 1.4,x i = γ i / s x_i = \gamma_i / s x i = γ i / s 且 γ i ⊥ s \gamma_i \perp s γ i ⊥ s ,故 E [ x i ] = E [ γ i ] E [ 1 / s ] = α i ⋅ 1 α 0 \mathbb{E}[x_i] = \mathbb{E}[\gamma_i]\,\mathbb{E}[1/s] = \alpha_i \cdot \frac{1}{\alpha_0} E [ x i ] = E [ γ i ] E [ 1/ s ] = α i ⋅ α 0 1 ,末一步用到 Gamma ( α 0 , 1 ) \operatorname{Gamma}(\alpha_0,1) Gamma ( α 0 , 1 ) 的倒数的期望 E [ 1 / s ] = 1 / ( α 0 − 1 ) \mathbb{E}[1/s] = 1/(\alpha_0 - 1) E [ 1/ s ] = 1/ ( α 0 − 1 ) 与 α 0 ↦ α 0 − 1 \alpha_0 \mapsto \alpha_0 - 1 α 0 ↦ α 0 − 1 的平移技巧,或直接由命题 1.3 的矩恒等式 E [ ∏ i x i β i ] = B ( α + β ) / B ( α ) \mathbb{E}[\prod_i x_i^{\beta_i}] = B(\boldsymbol{\alpha} + \boldsymbol{\beta})/B(\boldsymbol{\alpha}) E [ ∏ i x i β i ] = B ( α + β ) / B ( α ) 取 β i = 1 \beta_i = 1 β i = 1 得到。二阶矩由 E [ x i 2 ] = α i ( α i + 1 ) α 0 ( α 0 + 1 ) \mathbb{E}[x_i^2] = \frac{\alpha_i(\alpha_i+1)}{\alpha_0(\alpha_0+1)} E [ x i 2 ] = α 0 ( α 0 + 1 ) α i ( α i + 1 ) 与 E [ x i x j ] = α i α j α 0 ( α 0 + 1 ) \mathbb{E}[x_i x_j] = \frac{\alpha_i \alpha_j}{\alpha_0(\alpha_0+1)} E [ x i x j ] = α 0 ( α 0 + 1 ) α i α j 相减即得。
上述结果可写成更紧凑的矩阵形式。记 μ = α / α 0 ∈ int Δ K − 1 \boldsymbol{\mu} = \boldsymbol{\alpha}/\alpha_0 \in \operatorname{int}\Delta^{K-1} μ = α / α 0 ∈ int Δ K − 1 为均值向量,则
Σ = Cov ( x ) = 1 α 0 + 1 ( diag ( μ ) − μ μ ⊤ ) \boldsymbol{\Sigma} = \operatorname{Cov}(\mathbf{x}) = \frac{1}{\alpha_0 + 1}\left(\operatorname{diag}(\boldsymbol{\mu}) - \boldsymbol{\mu}\boldsymbol{\mu}^\top\right) Σ = Cov ( x ) = α 0 + 1 1 ( diag ( μ ) − μ μ ⊤ ) 这一形式揭示了两个结构性事实。第一,协方差矩阵的秩为 K − 1 K-1 K − 1 :由于 1 ⊤ Σ 1 = 0 \mathbf{1}^\top \boldsymbol{\Sigma} \mathbf{1} = 0 1 ⊤ Σ 1 = 0 ,Σ \boldsymbol{\Sigma} Σ 必然奇异,其零空间由 1 \mathbf{1} 1 张成——这正是「分布在 ( K − 1 ) (K-1) ( K − 1 ) 维对象上」的代数痕迹。第二,全部协方差为负:Cov ( x i , x j ) < 0 ( i ≠ j ) \operatorname{Cov}(x_i, x_j) < 0\ (i \ne j) Cov ( x i , x j ) < 0 ( i = j ) ,因为分量之间必须通过和为 1 1 1 的约束相互竞争,任何一个分量的增加都以其他分量的期望减少为代价。
命题 2.1 中的 μ \boldsymbol{\mu} μ 与 α 0 \alpha_0 α 0 是两个正交的自由度:前者决定「概率质量落在何处」,后者决定「分布在该处聚集得多紧」。据此引入重参数化
α = α 0 μ , α 0 > 0 , μ ∈ int Δ K − 1 \boldsymbol{\alpha} = \alpha_0 \boldsymbol{\mu}, \qquad \alpha_0 > 0,\ \boldsymbol{\mu} \in \operatorname{int}\Delta^{K-1} α = α 0 μ , α 0 > 0 , μ ∈ int Δ K − 1 它把参数空间分解为一个方向 (K − 1 K-1 K − 1 维单纯形)与一个尺度 (正实数)。在此参数化下,协方差为 Σ = 1 α 0 + 1 ( diag μ − μ μ ⊤ ) \boldsymbol{\Sigma} = \frac{1}{\alpha_0+1}(\operatorname{diag}\boldsymbol{\mu} - \boldsymbol{\mu}\boldsymbol{\mu}^\top) Σ = α 0 + 1 1 ( diag μ − μ μ ⊤ ) ,与 μ \boldsymbol{\mu} μ 的取值无关、只随 α 0 \alpha_0 α 0 单调收缩 。因此 α 0 \alpha_0 α 0 是一个纯粹的集中度(或称精度、强度)参数:
命题 2.2(集中性极限) 固定 μ ∈ int Δ K − 1 \boldsymbol{\mu} \in \operatorname{int}\Delta^{K-1} μ ∈ int Δ K − 1 ,令 α ( α 0 ) = α 0 μ \boldsymbol{\alpha}^{(\alpha_0)} = \alpha_0 \boldsymbol{\mu} α ( α 0 ) = α 0 μ 。则当 α 0 → ∞ \alpha_0 \to \infty α 0 → ∞ 时,Dir ( α 0 μ ) \operatorname{Dir}(\alpha_0 \boldsymbol{\mu}) Dir ( α 0 μ ) 弱收敛于位于 μ \boldsymbol{\mu} μ 的退化测度 δ μ \delta_{\boldsymbol{\mu}} δ μ 。
证明 由命题 2.1,E [ x ] = μ \mathbb{E}[\mathbf{x}] = \boldsymbol{\mu} E [ x ] = μ 且 Σ = O ( 1 / α 0 ) → 0 \boldsymbol{\Sigma} = O(1/\alpha_0) \to \mathbf{0} Σ = O ( 1/ α 0 ) → 0 。对任意 ε > 0 \varepsilon > 0 ε > 0 ,由 Chebyshev 不等式 P ( ∥ x − μ ∥ > ε ) ≤ tr Σ / ε 2 → 0 \mathbb{P}(\|\mathbf{x} - \boldsymbol{\mu}\| > \varepsilon) \le \operatorname{tr}\boldsymbol{\Sigma}/\varepsilon^2 \to 0 P ( ∥ x − μ ∥ > ε ) ≤ tr Σ / ε 2 → 0 ,故依概率收敛,进而弱收敛于 δ μ \delta_{\boldsymbol\mu} δ μ 。
这一命题给出了本文后续所有「不确定性」语汇的几何基础:迪利克雷分布的「模糊程度」等于 1 / α 0 1/\alpha_0 1/ α 0 的量级,而它的「中心」由 μ \boldsymbol{\mu} μ 给出。 两者在同一族分布中被参数化为彼此独立的量——这正是证据深度学习能够把「预测什么」与「有多确定」分离开来的数学根据。
命题 2.3(众数) 若 α i > 1 \alpha_i > 1 α i > 1 对一切 i i i 成立,则 f ( x ∣ α ) f(\mathbf{x} \mid \boldsymbol{\alpha}) f ( x ∣ α ) 在 Δ K − 1 \Delta^{K-1} Δ K − 1 的内部有唯一众数
x ⋆ = ( α 1 − 1 α 0 − K , … , α K − 1 α 0 − K ) \mathbf{x}^\star = \left( \frac{\alpha_1 - 1}{\alpha_0 - K}, \dots, \frac{\alpha_K - 1}{\alpha_0 - K} \right) x ⋆ = ( α 0 − K α 1 − 1 , … , α 0 − K α K − 1 )
当某个 α i ≤ 1 \alpha_i \le 1 α i ≤ 1 时密度在对应边界面上无界,众数退化到边界,此时分布呈现 2.6 节所述的稀疏形态。
命题 2.4(微分熵) 在 1.1 节的测度约定下,x ∼ Dir ( α ) \mathbf{x} \sim \operatorname{Dir}(\boldsymbol{\alpha}) x ∼ Dir ( α ) 的微分熵为
H ( x ) = log B ( α ) + ( α 0 − K ) ψ ( α 0 ) − ∑ i = 1 K ( α i − 1 ) ψ ( α i ) H(\mathbf{x}) = \log B(\boldsymbol{\alpha}) + (\alpha_0 - K)\,\psi(\alpha_0) - \sum_{i=1}^K (\alpha_i - 1)\,\psi(\alpha_i) H ( x ) = log B ( α ) + ( α 0 − K ) ψ ( α 0 ) − ∑ i = 1 K ( α i − 1 ) ψ ( α i )
其中 ψ = Γ ′ / Γ \psi = \Gamma'/\Gamma ψ = Γ ′ /Γ 为 digamma 函数。
证明 直接计算 H = − ∫ f log f H = -\int f \log f H = − ∫ f log f ,代入 − log f = log B ( α ) − ∑ i ( α i − 1 ) log x i -\log f = \log B(\boldsymbol{\alpha}) - \sum_i (\alpha_i - 1)\log x_i − log f = log B ( α ) − ∑ i ( α i − 1 ) log x i 与 E [ log x i ] = ψ ( α i ) − ψ ( α 0 ) \mathbb{E}[\log x_i] = \psi(\alpha_i) - \psi(\alpha_0) E [ log x i ] = ψ ( α i ) − ψ ( α 0 ) (由命题 1.3 的矩恒等式对 β i \beta_i β i 求导得到),整理即得。
在对称情形 α = α 1 \boldsymbol{\alpha} = \alpha \mathbf{1} α = α 1 下,H H H 在 α = 1 \alpha = 1 α = 1 处取最大值 − log Γ ( K ) = − log ( K − 1 ) ! -\log \Gamma(K) = -\log (K-1)! − log Γ ( K ) = − log ( K − 1 )! 。该值为负,并不矛盾:它是相对于体积为 1 / ( K − 1 ) ! < 1 1/(K-1)! < 1 1/ ( K − 1 )! < 1 的支撑集而言的。α = 1 \alpha = 1 α = 1 对应单纯形上的均匀分布 ——一个在其支撑集上平坦、却因支撑集体积小于一而具有负微分熵的密度。一般地,由于 Δ K − 1 \Delta^{K-1} Δ K − 1 紧且测度有限,均匀分布是最大熵分布,故
H ( x ) ≤ − log Γ ( K ) , 等号成立 ⟺ α = 1 H(\mathbf{x}) \le -\log \Gamma(K), \qquad \text{等号成立} \iff \boldsymbol{\alpha} = \mathbf{1} H ( x ) ≤ − log Γ ( K ) , 等号成立 ⟺ α = 1 命题 2.5(Dirichlet–Multinomial 共轭) 设先验 π ∼ Dir ( α ) \boldsymbol{\pi} \sim \operatorname{Dir}(\boldsymbol{\alpha}) π ∼ Dir ( α ) ,给定 π \boldsymbol{\pi} π 观测到计数向量 n = ( n 1 , … , n K ) \mathbf{n} = (n_1, \dots, n_K) n = ( n 1 , … , n K ) (n i ∈ N n_i \in \mathbb{N} n i ∈ N ,N = ∑ i n i N = \sum_i n_i N = ∑ i n i ),则后验为
π ∣ n ∼ Dir ( α + n ) \boldsymbol{\pi} \mid \mathbf{n} \sim \operatorname{Dir}(\boldsymbol{\alpha} + \mathbf{n}) π ∣ n ∼ Dir ( α + n )
证明 多项似然正比于 ∏ i π i n i \prod_i \pi_i^{n_i} ∏ i π i n i ,与先验密度相乘得
p ( π ∣ n ) ∝ ∏ i = 1 K π i α i + n i − 1 p(\boldsymbol{\pi} \mid \mathbf{n}) \propto \prod_{i=1}^K \pi_i^{\alpha_i + n_i - 1} p ( π ∣ n ) ∝ i = 1 ∏ K π i α i + n i − 1 该核与 Dir ( α + n ) \operatorname{Dir}(\boldsymbol{\alpha} + \mathbf{n}) Dir ( α + n ) 的核成比例,归一化即得。
由共轭性可立即导出两个推论,它们在应用中的地位不低于命题本身。
推论 2.6(Dirichlet–Multinomial 分布) 计数向量 n \mathbf{n} n 的边缘似然为
p ( n ∣ α ) = N ! ∏ i n i ! ⋅ B ( α + n ) B ( α ) = Γ ( α 0 ) Γ ( α 0 + N ) ∏ i = 1 K Γ ( α i + n i ) Γ ( α i ) p(\mathbf{n} \mid \boldsymbol{\alpha}) = \frac{N!}{\prod_i n_i!} \cdot \frac{B(\boldsymbol{\alpha} + \mathbf{n})}{B(\boldsymbol{\alpha})} = \frac{\Gamma(\alpha_0)}{\Gamma(\alpha_0 + N)} \prod_{i=1}^K \frac{\Gamma(\alpha_i + n_i)}{\Gamma(\alpha_i)} p ( n ∣ α ) = ∏ i n i ! N ! ⋅ B ( α ) B ( α + n ) = Γ ( α 0 + N ) Γ ( α 0 ) ∏ i = 1 K Γ ( α i ) Γ ( α i + n i )
推论 2.7(后验预测与收缩) 对未见样本,
P ( y new = k ∣ n ) = α k + n k α 0 + N \mathbb{P}(y_{\text{new}} = k \mid \mathbf{n}) = \frac{\alpha_k + n_k}{\alpha_0 + N} P ( y new = k ∣ n ) = α 0 + N α k + n k
而 E [ π k ∣ n ] \mathbb{E}[\pi_k \mid \mathbf{n}] E [ π k ∣ n ] 是先验均值与经验频率的凸组合 :
E [ π k ∣ n ] = α 0 α 0 + N ⏟ 收缩权重 ⋅ α k α 0 + N α 0 + N ⏟ 数据权重 ⋅ n k N \mathbb{E}[\pi_k \mid \mathbf{n}] = \underbrace{\frac{\alpha_0}{\alpha_0 + N}}_{\text{收缩权重}} \cdot \frac{\alpha_k}{\alpha_0} + \underbrace{\frac{N}{\alpha_0 + N}}_{\text{数据权重}} \cdot \frac{n_k}{N} E [ π k ∣ n ] = 收缩权重 α 0 + N α 0 ⋅ α 0 α k + 数据权重 α 0 + N N ⋅ N n k
推论 2.7 用一句话概括了加法平滑的全部含义:先验强度的倒数 α 0 \alpha_0 α 0 相对于样本量 N N N 的大小,就是数据与先验的信任分配比例。 取 α i = 1 \alpha_i = 1 α i = 1 得 Laplace 平滑,取 α i > 1 \alpha_i > 1 α i > 1 得 Lidstone 平滑,取 α i → 0 \alpha_i \to 0 α i → 0 得最大似然估计——这三个统计实践中彼此孤立出现的技巧,在此被识别为同一族参数的不同取值。
命题 2.8(聚合性) 设 x ∼ Dir ( α ) \mathbf{x} \sim \operatorname{Dir}(\boldsymbol{\alpha}) x ∼ Dir ( α ) ,{ I 1 , … , I M } \{I_1, \dots, I_M\} { I 1 , … , I M } 是 { 1 , … , K } \{1, \dots, K\} { 1 , … , K } 的一个划分。令 y m = ∑ i ∈ I m x i y_m = \sum_{i \in I_m} x_i y m = ∑ i ∈ I m x i ,则 y ∼ Dir ( β ) \mathbf{y} \sim \operatorname{Dir}(\boldsymbol{\beta}) y ∼ Dir ( β ) ,其中 β m = ∑ i ∈ I m α i \beta_m = \sum_{i \in I_m} \alpha_i β m = ∑ i ∈ I m α i 。
聚合性说明迪利克雷族在粗化 (coarsening)下封闭:把若干类别合并,得到的仍是同一族的成员,参数按分量求和。这一性质在层级分类、LDA 中主题的合并、以及 3.5 节中「由多项分布边缘化得到分类预测」的推导中都扮演关键角色。
由聚合性可导出中立性(neutrality) :对任意 k k k ,x k x_k x k 与其余分量的归一化版本 ( x i / ( 1 − x k ) ) i ≠ k \left(x_i/(1-x_k)\right)_{i \ne k} ( x i / ( 1 − x k ) ) i = k 相互独立,且后者服从 Dir ( α − k ) \operatorname{Dir}(\boldsymbol{\alpha}_{-k}) Dir ( α − k ) 而 x k ∼ Beta ( α k , α 0 − α k ) x_k \sim \operatorname{Beta}(\alpha_k, \alpha_0 - \alpha_k) x k ∼ Beta ( α k , α 0 − α k ) 。反复施用中立性,得到如下构造性表示:
命题 2.9(stick-breaking 表示) 设 v k ∼ Beta ( α k , ∑ j > k α j ) v_k \sim \operatorname{Beta}\!\left(\alpha_k, \sum_{j>k} \alpha_j\right) v k ∼ Beta ( α k , ∑ j > k α j ) 相互独立。令
x 1 = v 1 , x k = v k ∏ j < k ( 1 − v j ) ( k = 2 , … , K ) x_1 = v_1, \qquad x_k = v_k \prod_{j < k}(1 - v_j) \quad (k = 2, \dots, K) x 1 = v 1 , x k = v k ∏ j < k ( 1 − v j ) ( k = 2 , … , K )
则 ( x 1 , … , x K ) ∼ Dir ( α ) (x_1, \dots, x_K) \sim \operatorname{Dir}(\boldsymbol{\alpha}) ( x 1 , … , x K ) ∼ Dir ( α ) 。
命题 2.9 是 Sethuraman 式的「折断木棍」构造在有限维的情形:从长度为 1 1 1 的木棍中依次折断出比例 v k v_k v k 的一段。它在无穷维极限下给出 Dirichlet 过程,因而把本文的有限维话题与贝叶斯非参数方法连接起来。
综合 2.1 至 2.5 节,可以把形状参数 α \boldsymbol{\alpha} α 的语义概括为三点:
在共轭更新中,α \boldsymbol{\alpha} α 起先验样本计数的角色 (命题 2.5),其总强度 α 0 \alpha_0 α 0 是「先验等价样本量」(推论 2.7)。在几何上,α \alpha α 由方向 μ \boldsymbol{\mu} μ 与精度 α 0 \alpha_0 α 0 两个正交分量构成 (2.2 节),精度决定围绕 μ \boldsymbol{\mu} μ 的收缩程度。在似然意义上,α i − 1 \alpha_i - 1 α i − 1 是对数密度中 x i x_i x i 的指数 ,故 α i < 1 \alpha_i < 1 α i < 1 意味着密度在 x i → 0 x_i \to 0 x i → 0 处发散。对于对称 情形 α = α 1 \boldsymbol{\alpha} = \alpha \mathbf{1} α = α 1 ,这三重语义给出一条完整的形态谱:
参数区间 分布的形态 采样的典型特征 典型用途 α → 0 \alpha \to 0 α → 0 质量集中于顶点 { e i } \{\mathbf{e}_i\} { e i } 邻域 极端稀疏,单个分量接近 1 1 1 LDA 文档—主题混合(文档只涉少数主题) α = 1 \alpha = 1 α = 1 单纯形上的均匀分布 各分量量级相当,无偏好 无信息先验 α > 1 \alpha > 1 α > 1 集中于中心 1 / K \mathbf{1}/K 1 / K ,随 α \alpha α 增大而收缩 各分量接近 1 / K 1/K 1/ K 的平滑向量 强正则化、收缩估计
此处必须澄清一个常见但过强的说法:把 α i \alpha_i α i 直接称为「观测到的次数」只在 α i ≥ 1 \alpha_i \ge 1 α i ≥ 1 时在字面上成立。当 α i < 1 \alpha_i < 1 α i < 1 时,α i − 1 < 0 \alpha_i - 1 < 0 α i − 1 < 0 ,隐含的「先验计数」为负,这在计数语义下不可解释,却对应于密度在边界处的发散——一个在稀疏建模中必不可少的形态。准确的说法是:α \boldsymbol{\alpha} α 是伪计数概念的连续化,其在 α i ≥ 1 \alpha_i \ge 1 α i ≥ 1 区域退化回字面意义上的计数解释,而在 α i < 1 \alpha_i < 1 α i < 1 区域承担的是稀疏性先验的角色。 这一区分在 3.4 节将直接决定 EDL 中「证据」一词的适用边界。
证据深度学习的直接理论前身是 Josang 的主观逻辑(subjective logic) ,它为「对一个命题的相信程度」建立了一套带不确定性维度的代数。
定义 3.1(opinion) 在有限域 Y = { 1 , … , K } \mathcal{Y} = \{1, \dots, K\} Y = { 1 , … , K } 上的一个 opinion 是三元组 ω = ( b , u , a ) \omega = (\mathbf{b}, u, \mathbf{a}) ω = ( b , u , a ) ,其中
b = ( b 1 , … , b K ) ∈ [ 0 , 1 ] K \mathbf{b} = (b_1, \dots, b_K) \in [0,1]^K b = ( b 1 , … , b K ) ∈ [ 0 , 1 ] K 为信念质量(belief mass) 。u ∈ [ 0 , 1 ] u \in [0,1] u ∈ [ 0 , 1 ] 为不确定性质量(uncertainty mass) 。a ∈ [ 0 , 1 ] K \mathbf{a} \in [0,1]^K a ∈ [ 0 , 1 ] K ,∑ k a k = 1 \sum_k a_k = 1 ∑ k a k = 1 ,为基准率(base rate) 。并满足单纯形约束 ∑ k = 1 K b k + u = 1 \sum_{k=1}^K b_k + u = 1 ∑ k = 1 K b k + u = 1 。
ω \omega ω 的概率投影(probability projection) 定义为 P k = b k + a k u P_k = b_k + a_k u P k = b k + a k u :在不了解具体类别时退回基准率,在有所了解时按信念质量分配。当基准率取均匀值 a k = 1 / K a_k = 1/K a k = 1/ K 时,P k = b k + u / K P_k = b_k + u/K P k = b k + u / K 。
定义 3.1 的关键在于:opinion 所栖居的空间是 Δ K \Delta^{K} Δ K ——一个 K K K 维单纯形,比 Δ K − 1 \Delta^{K-1} Δ K − 1 多出一个维度。多出来的这一维正是「不确定性」的自由度,而它恰恰是 softmax 输出所没有的。
主观逻辑与迪利克雷分布之间不存在类比关系,而是存在严格的双射 。
命题 3.2(双射) 设先验权重 W = K W = K W = K 、基准率 a k = 1 / K a_k = 1/K a k = 1/ K 。则如下两个映射互逆:
b = α − 1 α 0 , u = K α 0 ⟺ α k = K b k u + 1 , α 0 = K u \mathbf{b} = \frac{\boldsymbol{\alpha} - \mathbf{1}}{\alpha_0}, \qquad u = \frac{K}{\alpha_0} \qquad \Longleftrightarrow \qquad \alpha_k = \frac{K\, b_k}{u} + 1, \qquad \alpha_0 = \frac{K}{u} b = α 0 α − 1 , u = α 0 K ⟺ α k = u K b k + 1 , α 0 = u K
验证 正向:∑ k b k + u = α 0 − K α 0 + K α 0 = 1 \sum_k b_k + u = \frac{\alpha_0 - K}{\alpha_0} + \frac{K}{\alpha_0} = 1 ∑ k b k + u = α 0 α 0 − K + α 0 K = 1 ,满足定义 3.1 的约束。反向:代入即得恒等。此外,概率投影与迪利克雷期望重合:
P k = b k + u K = α k − 1 α 0 + 1 α 0 = α k α 0 = E [ x k ] P_k = b_k + \frac{u}{K} = \frac{\alpha_k - 1}{\alpha_0} + \frac{1}{\alpha_0} = \frac{\alpha_k}{\alpha_0} = \mathbb{E}[x_k] P k = b k + K u = α 0 α k − 1 + α 0 1 = α 0 α k = E [ x k ] 其中最后一个等号由命题 2.1 给出。
命题 3.2 是整篇文章的枢纽:它说明在单纯形上输出一个概率分布,与在 opinion 空间中输出一个带不确定性度量的判断,是同一件事。 于是,「给网络加一个不确定性维度」这一看似需要新架构的任务,被归结为「让网络的输出参数化一个迪利克雷分布」。证据深度学习正是沿着这条路径展开的。
设神经网络 f θ : X → R K f_{\boldsymbol{\theta}}: \mathcal{X} \to \mathbb{R}^K f θ : X → R K 输出 logits z = f θ ( x ) \mathbf{z} = f_{\boldsymbol{\theta}}(\mathbf{x}) z = f θ ( x ) ,softmax 给出 p = softmax ( z ) \mathbf{p} = \operatorname{softmax}(\mathbf{z}) p = softmax ( z ) ,即 p k = e z k / ∑ j e z j p_k = e^{z_k}/\sum_j e^{z_j} p k = e z k / ∑ j e z j 。这一映射存在两个结构性缺陷。
其一,平移不变性抹去了「无信息」这一状态。 对任意常数 c c c ,softmax ( z + c 1 ) = softmax ( z ) \operatorname{softmax}(\mathbf{z} + c\mathbf{1}) = \operatorname{softmax}(\mathbf{z}) softmax ( z + c 1 ) = softmax ( z ) 。因此 logits 的绝对水平不含任何信息,网络的输出只依赖于 { z k } \{z_k\} { z k } 的相对差 。后果是:z = 0 \mathbf{z} = \mathbf{0} z = 0 (「全零 logits」)与 z = 100 ⋅ 1 \mathbf{z} = 100 \cdot \mathbf{1} z = 100 ⋅ 1 不可区分,二者都对应均匀分布 1 / K \mathbf{1}/K 1 / K 。既然均匀分布既可由「无任何信号」也可由「极其强烈的信号恰好相互抵消」产生,输出端就不可能把前者作为一个可辨识的状态标记出来。
其二,交叉熵的最优解在可分数据上把 logits 推向发散。 在训练集线性可分时,以交叉熵为目标的极大似然估计不存在有限最优解:沿方向 z → c z ⋆ , c → ∞ \mathbf{z} \to c\,\mathbf{z}^\star,\ c \to \infty z → c z ⋆ , c → ∞ 可将损失单调压向零。换言之,过度自信不是训练不足的症状,而是 MLE 在可分数据上的退化解 ——模型越是被「训练充分」,其 softmax 输出越接近 one-hot,而这一行为完全不受输入是否为分布内样本的约束 。
两个缺陷合起来解释了 5.1 节的经验事实:以最大 softmax 概率(MSP)作为分布外检测分数存在系统性偏差,因为 softmax 对任何使 logits 相对间距增大的输入都会返回高置信度的断言,而无从表达「这个输入对我而言是陌生的」。
证据深度学习对上述缺陷的回应是:不再用 softmax 把 logits 压缩为概率,而是用非负激活函数把 logits 提升为证据。
定义 3.3(证据网络) 设 g θ : X → R ≥ 0 K g_{\boldsymbol{\theta}}: \mathcal{X} \to \mathbb{R}_{\ge 0}^K g θ : X → R ≥ 0 K 是由主干网络与非负激活函数 复合而成的证据函数,输出 e = g θ ( x ) = ( e 1 , … , e K ) \mathbf{e} = g_{\boldsymbol{\theta}}(\mathbf{x}) = (e_1, \dots, e_K) e = g θ ( x ) = ( e 1 , … , e K ) 。迪利克雷参数取为
α k = e k + 1 , 即 α = e + 1 \alpha_k = e_k + 1, \qquad \text{即} \qquad \boldsymbol{\alpha} = \mathbf{e} + \mathbf{1} α k = e k + 1 , 即 α = e + 1
网络对输入的预测由此被定义为 Dir ( α ) \operatorname{Dir}(\boldsymbol{\alpha}) Dir ( α ) 。
参数化的语义可直接由命题 3.2 读出:e = α − 1 \mathbf{e} = \boldsymbol{\alpha} - \mathbf{1} e = α − 1 正是超出均匀先验 a k W = 1 a_k W = 1 a k W = 1 的那部分伪计数 ,即 2.6 节意义上「可解释为计数」的区域。这就是「证据」一词的来源:e k e_k e k 是与类别 k k k 相关的、由网络从输入中提取出的支持性观测。
非负激活函数的选择影响显著,值得逐一说明:
softplus ( z ) = log ( 1 + e z ) \operatorname{softplus}(z) = \log(1 + e^z) softplus ( z ) = log ( 1 + e z ) :恒正、处处可微、在 z → − ∞ z \to -\infty z → − ∞ 时以 e z e^z e z 的速度趋零、在 z → + ∞ z \to +\infty z → + ∞ 时线性增长。它既提供了精确的零证据状态,又避免了指数爆炸,是实践中默认的选择。exp ( z ) \exp(z) exp ( z ) :严格正、光滑,但无上界,使 α 0 \alpha_0 α 0 可任意大,易造成数值溢出与损失对证据的不稳定响应。ReLU ( z ) \operatorname{ReLU}(z) ReLU ( z ) :计算廉价,但在 z < 0 z < 0 z < 0 处梯度恒为零。处于该区域的单元输出证据 e k = 0 e_k = 0 e k = 0 且永远无法通过梯度逃离 ——α k \alpha_k α k 被锁在 1 1 1 ,形成死区。这使 ReLU 在证据函数中通常劣于 softplus。ELU ( z ) + 1 \operatorname{ELU}(z) + 1 ELU ( z ) + 1 :具有负饱和下界 0 0 0 ,梯度在负半轴非零,是介于二者之间的折中。命题 3.4(EDL 的预测与不确定性) 在定义 3.3 的参数化下,记总强度 S = α 0 = ∑ k = 1 K α k = K + ∑ k = 1 K e k S = \alpha_0 = \sum_{k=1}^K \alpha_k = K + \sum_{k=1}^K e_k S = α 0 = ∑ k = 1 K α k = K + ∑ k = 1 K e k 。则
p k = E [ x k ] = α k S , u = K S p_k = \mathbb{E}[x_k] = \frac{\alpha_k}{S}, \qquad u = \frac{K}{S} p k = E [ x k ] = S α k , u = S K
证明 第一式即命题 2.1。第二式即命题 3.2。对 u u u 的推导亦可独立地由聚合性(命题 2.8)得到:若把全部类别合并为一个事件,其迪利克雷参数为 α 0 \alpha_0 α 0 ,不确定性质量即为 K / α 0 K/\alpha_0 K / α 0 。
在 u u u 的定义下,预测概率具有一个在解释上极有用的分解:
p k = α k − 1 S ⏟ 证据部分 + 1 S ⏟ 先验部分 = ( 1 − u ) α k − 1 α 0 − K + u ⋅ 1 K p_k = \underbrace{\frac{\alpha_k - 1}{S}}_{\text{证据部分}} + \underbrace{\frac{1}{S}}_{\text{先验部分}} = (1 - u)\,\frac{\alpha_k - 1}{\alpha_0 - K} + u \cdot \frac{1}{K} p k = 证据部分 S α k − 1 + 先验部分 S 1 = ( 1 − u ) α 0 − K α k − 1 + u ⋅ K 1 即预测概率是「证据归一化的类比例」与「均匀分布」按 ( 1 − u , u ) (1-u, u) ( 1 − u , u ) 的凸组合 。当证据充分时(u → 0 u \to 0 u → 0 ),预测趋于证据的方向。当证据消失时(u → 1 u \to 1 u → 1 ),预测退回均匀分布。极限行为因此完全符合直觉:
S → K ( e → 0 ) : u → 1 , p → 1 K 1 S → ∞ : u → 0 , p → e ∑ j e j S \to K \ (\mathbf{e} \to \mathbf{0}): \quad u \to 1,\ \ \mathbf{p} \to \tfrac{1}{K}\mathbf{1}
\qquad\qquad
S \to \infty: \quad u \to 0,\ \ \mathbf{p} \to \frac{\mathbf{e}}{\sum_j e_j} S → K ( e → 0 ) : u → 1 , p → K 1 1 S → ∞ : u → 0 , p → ∑ j e j e 命题 3.4 同时也暴露了该参数化的一个结构性局限 :u u u 只是总强度 S S S 的函数,与证据在各类别之间的分布 无关。因此 EDL 的不确定性分数无法区分「少量证据集中于一类」与「大量证据均匀分散」,也无法区分「证据落在正确类别上」与「证据落在错误类别上」。这一局限将在 4.5 节与 5.6 节被重新讨论。
命题 3.4 给出的 u = K / S u = K/S u = K / S 是一个启发式 的不确定性标量。与之相对,Malinin 与 Gales 在 Prior Networks 的工作中给出了一个有信息论根据的分解,它在迪利克雷族内具有闭式解。
设 π ∼ Dir ( α ) \boldsymbol{\pi} \sim \operatorname{Dir}(\boldsymbol{\alpha}) π ∼ Dir ( α ) 且 y ∣ π ∼ Cat ( π ) y \mid \boldsymbol{\pi} \sim \operatorname{Cat}(\boldsymbol{\pi}) y ∣ π ∼ Cat ( π ) 。考虑三个量:
总不确定性(total uncertainty) :预测分布的熵 H [ P ( y ∣ x ) ] H[\mathbb{P}(y \mid \mathbf{x})] H [ P ( y ∣ x )] ,其中 P ( y = k ∣ x ) = p k = α k / α 0 \mathbb{P}(y = k \mid \mathbf{x}) = p_k = \alpha_k/\alpha_0 P ( y = k ∣ x ) = p k = α k / α 0 。偶然不确定性(aleatoric uncertainty) :给定 π \boldsymbol{\pi} π 后仍存在的熵的期望 E π [ H ( π ) ] \mathbb{E}_{\boldsymbol{\pi}}[H(\boldsymbol{\pi})] E π [ H ( π )] 。认知不确定性(epistemic uncertainty) :二者的差,即 y y y 与 π \boldsymbol{\pi} π 之间的互信息。命题 3.5(Dirichlet 族内的不确定性分解) 记 p k = α k / α 0 p_k = \alpha_k/\alpha_0 p k = α k / α 0 ,S = α 0 S = \alpha_0 S = α 0 。则
H [ P ( y ∣ x ) ] = − ∑ k = 1 K p k log p k H[\mathbb{P}(y \mid \mathbf{x})] = -\sum_{k=1}^K p_k \log p_k H [ P ( y ∣ x )] = − ∑ k = 1 K p k log p k E π [ H ( π ) ] = ψ ( S + 1 ) − ∑ k = 1 K p k ψ ( α k + 1 ) \mathbb{E}_{\boldsymbol{\pi}}[H(\boldsymbol{\pi})] = \psi(S + 1) - \sum_{k=1}^K p_k \,\psi(\alpha_k + 1) E π [ H ( π )] = ψ ( S + 1 ) − ∑ k = 1 K p k ψ ( α k + 1 ) I ( y ; π ) = H [ P ( y ∣ x ) ] − E π [ H ( π ) ] = ∑ k = 1 K p k ( ψ ( α k + 1 ) − log p k ) − ψ ( S + 1 ) I(y; \boldsymbol{\pi}) = H[\mathbb{P}(y \mid \mathbf{x})] - \mathbb{E}_{\boldsymbol{\pi}}[H(\boldsymbol{\pi})] = \sum_{k=1}^K p_k\big(\psi(\alpha_k + 1) - \log p_k\big) - \psi(S + 1) I ( y ; π ) = H [ P ( y ∣ x )] − E π [ H ( π )] = ∑ k = 1 K p k ( ψ ( α k + 1 ) − log p k ) − ψ ( S + 1 )
证明 关键在于 H ( π ) = − ∑ k π k log π k H(\boldsymbol{\pi}) = -\sum_k \pi_k \log \pi_k H ( π ) = − ∑ k π k log π k ,故 E [ H ( π ) ] = − ∑ k E [ π k log π k ] \mathbb{E}[H(\boldsymbol{\pi})] = -\sum_k \mathbb{E}[\pi_k \log \pi_k] E [ H ( π )] = − ∑ k E [ π k log π k ] 。由 1.4 节的边缘 Beta 性,π k ∼ Beta ( α k , S − α k ) \pi_k \sim \operatorname{Beta}(\alpha_k, S - \alpha_k) π k ∼ Beta ( α k , S − α k ) ,而对该 Beta 分布有恒等式 E [ X log X ] = a a + b ( ψ ( a + 1 ) − ψ ( a + b + 1 ) ) \mathbb{E}[X \log X] = \frac{a}{a+b}\big(\psi(a+1) - \psi(a+b+1)\big) E [ X log X ] = a + b a ( ψ ( a + 1 ) − ψ ( a + b + 1 ) ) (此处 a = α k a = \alpha_k a = α k ,a + b = S a + b = S a + b = S )。代入 a / ( a + b ) = p k a/(a+b) = p_k a / ( a + b ) = p k 即得第二式。互信息由 I = H [ E π ] − E [ H ( π ) ] I = H[\mathbb{E}\,\boldsymbol{\pi}] - \mathbb{E}[H(\boldsymbol{\pi})] I = H [ E π ] − E [ H ( π )] 得到。
这一分解的意义在于:它把「数据本身的随机性」与「关于类别分布的认知不足」在数学上分离成了两个可分别计算的量。 认知项 I ( y ; π ) I(y;\boldsymbol{\pi}) I ( y ; π ) 在 S → ∞ S \to \infty S → ∞ (证据充分)时趋于零,在证据缺失时增大,与 u = K / S u = K/S u = K / S 的定性行为一致。但它是通过 ψ \psi ψ 函数的差构造的,捕捉了 u u u 所忽略的证据分布 信息,因而是比 u u u 更精细的分数。
不过,这一分解的「认知」标签必须谨慎对待。它在形式上是「关于 π \boldsymbol{\pi} π 的不确定性」,而 π \boldsymbol{\pi} π 在 EDL 中是 g θ ( x ) g_{\boldsymbol{\theta}}(\mathbf{x}) g θ ( x ) 的输出,是网络参数的确定性函数 。因此 I ( y ; π ) I(y;\boldsymbol{\pi}) I ( y ; π ) 度量的是类概率向量 的不确定,而不是模型参数 的不确定——后者才是贝叶斯认识论意义上的 epistemic uncertainty。二者的距离,正是 4.5 节全部批评的技术根源。
EDL 的训练目标不再是「使 p \mathbf{p} p 逼近 one-hot 标签」,而是「使整族 Dir ( α ) \operatorname{Dir}(\boldsymbol{\alpha}) Dir ( α ) 逼近一个理想的分布」。损失函数因此被组织为两项:一项拟合分类目标,一项约束不确定性的行为。
最自然的构造是极小化对数损失在迪利克雷先验下的贝叶斯风险 (亦称 Type-II 极大似然):
L NLL = E π ∼ Dir ( α ) [ − log π y ] \mathcal{L}^{\text{NLL}} = \mathbb{E}_{\boldsymbol{\pi} \sim \operatorname{Dir}(\boldsymbol{\alpha})}\big[-\log \pi_y\big] L NLL = E π ∼ Dir ( α ) [ − log π y ] 命题 4.1(对数风险的闭式) 设真实标签为 y y y ,则
L NLL = ψ ( S ) − ψ ( α y ) \mathcal{L}^{\text{NLL}} = \psi(S) - \psi(\alpha_y) L NLL = ψ ( S ) − ψ ( α y )
证明 由 E [ log x k ] = ψ ( α k ) − ψ ( α 0 ) \mathbb{E}[\log x_k] = \psi(\alpha_k) - \psi(\alpha_0) E [ log x k ] = ψ ( α k ) − ψ ( α 0 ) (命题 2.4 的证明中已给出),取 k = y k = y k = y 并乘以 − 1 -1 − 1 即得。
该损失的梯度结构值得注意:
∂ L NLL ∂ α y = ψ ′ ( S ) − ψ ′ ( α y ) ≤ 0 , ∂ L NLL ∂ α j = ψ ′ ( S ) > 0 ( j ≠ y ) \frac{\partial \mathcal{L}^{\text{NLL}}}{\partial \alpha_y} = \psi'(S) - \psi'(\alpha_y) \le 0,
\qquad
\frac{\partial \mathcal{L}^{\text{NLL}}}{\partial \alpha_j} = \psi'(S) > 0 \quad (j \ne y) ∂ α y ∂ L NLL = ψ ′ ( S ) − ψ ′ ( α y ) ≤ 0 , ∂ α j ∂ L NLL = ψ ′ ( S ) > 0 ( j = y ) 其中 ψ ′ \psi' ψ ′ 为 trigamma 函数(恒正、单调递减)。因此梯度沿两个方向作用:提升真实类别的证据 (α y \alpha_y α y 增大),压低其余类别的证据 (α j \alpha_j α j 减小)。第二条作用有一个退化倾向:若标签之外的证据可被任意压低而不受惩罚,网络便有动机把 α j \alpha_j α j 全部驱向 1 1 1 ,从而收缩总证据 S S S ——这正是 4.3 节引入正则项的直接原因。
推论 4.2(与插值交叉熵的关系) L NLL \mathcal{L}^{\text{NLL}} L NLL 是 one-hot 标签下插值交叉熵的 Jensen 上界:
L NLL = − log p y + 1 2 ( 1 α y − 1 S ) + O ( S − 2 ) ≥ − log p y \mathcal{L}^{\text{NLL}} = -\log p_y + \frac{1}{2}\left(\frac{1}{\alpha_y} - \frac{1}{S}\right) + O\!\left(S^{-2}\right) \ \ge \ -\log p_y L NLL = − log p y + 2 1 ( α y 1 − S 1 ) + O ( S − 2 ) ≥ − log p y
证明 由 Jensen 不等式 E [ log π y ] ≤ log E [ π y ] = log p y \mathbb{E}[\log \pi_y] \le \log \mathbb{E}[\pi_y] = \log p_y E [ log π y ] ≤ log E [ π y ] = log p y ,故 L NLL ≥ − log p y \mathcal{L}^{\text{NLL}} \ge -\log p_y L NLL ≥ − log p y 。渐近展开由 ψ ( a ) = log a − 1 2 a + O ( a − 2 ) \psi(a) = \log a - \frac{1}{2a} + O(a^{-2}) ψ ( a ) = log a − 2 a 1 + O ( a − 2 ) 给出,而 α y ≤ S \alpha_y \le S α y ≤ S 保证修正项非负。
推论 4.2 揭示了一个在文献中常被忽略的事实:EDL 的对数损失并非多项—迪利克雷边缘似然的负对数,而是它加上一个显式的、随证据稀缺而增大的修正项。 该项在 S S S 大时消失,在证据不足时提供额外压力,其作用与下一小节方差惩罚项在平方损失中的地位完全平行。
Sensoy 等人的原始工作采用了平方损失而非对数损失,其闭式更为直观。
命题 4.3(平方风险的闭式) 设 y \mathbf{y} y 为 one-hot 标签,则
L MSE = E π [ ∥ y − π ∥ 2 ] = ∑ k = 1 K [ ( y k − p k ) 2 + p k ( 1 − p k ) S + 1 ] \mathcal{L}^{\text{MSE}} = \mathbb{E}_{\boldsymbol{\pi}}\left[\|\mathbf{y} - \boldsymbol{\pi}\|^2\right] = \sum_{k=1}^K \left[(y_k - p_k)^2 + \frac{p_k(1 - p_k)}{S + 1}\right] L MSE = E π [ ∥ y − π ∥ 2 ] = ∑ k = 1 K [ ( y k − p k ) 2 + S + 1 p k ( 1 − p k ) ]
证明 逐项展开:E [ ( y k − π k ) 2 ] = ( y k − p k ) 2 + Var ( π k ) \mathbb{E}[(y_k - \pi_k)^2] = (y_k - p_k)^2 + \operatorname{Var}(\pi_k) E [( y k − π k ) 2 ] = ( y k − p k ) 2 + Var ( π k ) 。由命题 2.1,Var ( π k ) = α k ( S − α k ) S 2 ( S + 1 ) = p k ( 1 − p k ) S + 1 \operatorname{Var}(\pi_k) = \frac{\alpha_k(S - \alpha_k)}{S^2(S+1)} = \frac{p_k(1-p_k)}{S+1} Var ( π k ) = S 2 ( S + 1 ) α k ( S − α k ) = S + 1 p k ( 1 − p k ) 。求和即得。
该损失的两项具有不同的角色。第一项是拟合项 :在 p k p_k p k 退化为确定性预测时,它退化为 one-hot 编码下的均方误差。第二项是方差惩罚项 :它正比于每个分量的伯努利方差 p k ( 1 − p k ) p_k(1-p_k) p k ( 1 − p k ) ,反比于总证据 S + 1 S + 1 S + 1 。其作用是双重的:
当证据稀缺(S S S 小)时,方差项较大,迫使模型不得 以低方差的方式给出尖锐预测——这是一种自适应的软惩罚,其强度由数据本身决定,而非人为设定的超参数。 当证据变化时,S S S 与 p k p_k p k 同时进入两项,形成张力:增大 S S S 可以压低方差项,却会强化拟合项。因此最优解不会退化为「证据全为零」的平凡解。 仅有拟合损失仍不足以约束错误预测上的证据。原因在于 4.1 节的梯度分析:拟合项只对真实类别 的证据给出直接的提升压力,而对错误类别上的证据,它只通过 ψ ′ ( S ) \psi'(S) ψ ′ ( S ) 给出一个整体的压制信号,这一信号与证据在各类别间的分配无关。后果是:当一个样本被错误分类时,网络可以通过在错误类别上堆积证据来降低损失 ,而这恰恰是我们希望惩罚的行为。
正则项的构造基于一个「反事实」的迪利克雷参数:抹去真实类别的证据,保留其余。
定义 4.4(反事实参数与证据正则) 令 α ~ = y + ( 1 − y ) ⊙ α \tilde{\boldsymbol{\alpha}} = \mathbf{y} + (\mathbf{1} - \mathbf{y}) \odot \boldsymbol{\alpha} α ~ = y + ( 1 − y ) ⊙ α ,即把真实类别处的参数置为 1 1 1 、其余保持不变。证据正则项定义为
L reg = KL [ Dir ( α ~ ) ∥ Dir ( 1 ) ] \mathcal{L}^{\text{reg}} = \operatorname{KL}\left[\operatorname{Dir}(\tilde{\boldsymbol{\alpha}}) \,\big\|\, \operatorname{Dir}(\mathbf{1})\right] L reg = KL [ Dir ( α ~ ) Dir ( 1 ) ]
注意 Dir ( 1 ) \operatorname{Dir}(\mathbf{1}) Dir ( 1 ) 正是无信息均匀先验。该 KL 散度只依赖于非目标类别上的证据:若网络在错误类别上给出大量证据,Dir ( α ~ ) \operatorname{Dir}(\tilde{\boldsymbol{\alpha}}) Dir ( α ~ ) 将显著偏离均匀分布,KL 随之增大。
命题 4.5(Dirichlet 的 KL 散度) 对 α , β ∈ R > 0 K \boldsymbol{\alpha}, \boldsymbol{\beta} \in \mathbb{R}_{>0}^K α , β ∈ R > 0 K ,
KL [ Dir ( α ) ∥ Dir ( β ) ] = log B ( β ) B ( α ) + ∑ k = 1 K ( α k − β k ) ( ψ ( α k ) − ψ ( α 0 ) ) \operatorname{KL}\left[\operatorname{Dir}(\boldsymbol{\alpha}) \,\big\|\, \operatorname{Dir}(\boldsymbol{\beta})\right] = \log\frac{B(\boldsymbol{\beta})}{B(\boldsymbol{\alpha})} + \sum_{k=1}^K (\alpha_k - \beta_k)\big(\psi(\alpha_k) - \psi(\alpha_0)\big) KL [ Dir ( α ) Dir ( β ) ] = log B ( α ) B ( β ) + ∑ k = 1 K ( α k − β k ) ( ψ ( α k ) − ψ ( α 0 ) )
特别地,取 β = 1 \boldsymbol{\beta} = \mathbf{1} β = 1 (此时 B ( 1 ) = 1 / Γ ( K ) B(\mathbf{1}) = 1/\Gamma(K) B ( 1 ) = 1/Γ ( K ) )得
L reg = log Γ ( α ~ 0 ) − ∑ k = 1 K log Γ ( α ~ k ) − log Γ ( K ) + ∑ k = 1 K ( α ~ k − 1 ) ( ψ ( α ~ k ) − ψ ( α ~ 0 ) ) \mathcal{L}^{\text{reg}} = \log\Gamma(\tilde{\alpha}_0) - \sum_{k=1}^K \log\Gamma(\tilde{\alpha}_k) - \log\Gamma(K) + \sum_{k=1}^K (\tilde{\alpha}_k - 1)\big(\psi(\tilde{\alpha}_k) - \psi(\tilde{\alpha}_0)\big) L reg = log Γ ( α ~ 0 ) − ∑ k = 1 K log Γ ( α ~ k ) − log Γ ( K ) + ∑ k = 1 K ( α ~ k − 1 ) ( ψ ( α ~ k ) − ψ ( α ~ 0 ) )
证明 由指数族的一般 KL 公式:KL = E α [ log p α − log p β ] \operatorname{KL} = \mathbb{E}_{\boldsymbol{\alpha}}[\log p_{\boldsymbol{\alpha}} - \log p_{\boldsymbol{\beta}}] KL = E α [ log p α − log p β ] 。代入 1.2 节的密度并利用 E α [ log x k ] = ψ ( α k ) − ψ ( α 0 ) \mathbb{E}_{\boldsymbol{\alpha}}[\log x_k] = \psi(\alpha_k) - \psi(\alpha_0) E α [ log x k ] = ψ ( α k ) − ψ ( α 0 ) 与 ∑ k E [ log x k ] = ψ ( α 0 ) − K ψ ( α 0 ) = − ( K − 1 ) ψ ( α 0 ) \sum_k \mathbb{E}[\log x_k] = \psi(\alpha_0) - K\psi(\alpha_0) = -(K-1)\psi(\alpha_0) ∑ k E [ log x k ] = ψ ( α 0 ) − K ψ ( α 0 ) = − ( K − 1 ) ψ ( α 0 ) 即可化简。
总损失为两项的加权和,其中权重按训练步退火 :
L = L fit + λ t L reg , λ t = min ( 1 , t T anneal ) \mathcal{L} = \mathcal{L}^{\text{fit}} + \lambda_t \,\mathcal{L}^{\text{reg}},
\qquad
\lambda_t = \min\!\left(1, \frac{t}{T_{\text{anneal}}}\right) L = L fit + λ t L reg , λ t = min ( 1 , T anneal t ) 退火的设计意图是分工时段的划分:训练初期 λ t ≈ 0 \lambda_t \approx 0 λ t ≈ 0 ,网络可以自由地按拟合损失调整证据的量级,避免在证据尚未成形时被正则项过早地压向零。训练后期 λ t → 1 \lambda_t \to 1 λ t → 1 ,正则项接管,迫使模型对错误预测给出高不确定性。消融实验一致表明,缺少退火(即使用常数 λ \lambda λ )会显著损害性能——这与该设计的解释相符,而非仅仅是超参数调优的产物。
上述两项可以统一在一个更一般的框架下。所有基于 EDL 的拟合损失都具有形式
L fit = E π ∼ Dir ( α ) [ ℓ ( y , π ) ] \mathcal{L}^{\text{fit}} = \mathbb{E}_{\boldsymbol{\pi} \sim \operatorname{Dir}(\boldsymbol{\alpha})}\left[\ell(\mathbf{y}, \boldsymbol{\pi})\right] L fit = E π ∼ Dir ( α ) [ ℓ ( y , π ) ] 即对某个一阶损失 ℓ \ell ℓ 的先验期望 。取 ℓ = − log π y \ell = -\log \pi_y ℓ = − log π y 得命题 4.1 的 digamma 形式。取 ℓ = ∥ y − π ∥ 2 \ell = \|\mathbf{y} - \boldsymbol{\pi}\|^2 ℓ = ∥ y − π ∥ 2 得命题 4.3 的平方形式。这一视角把「EDL 的损失设计」转化为「选择哪个一阶损失并在迪利克雷族上求其贝叶斯风险」的标准问题,从而使新损失的设计有章可循。
在此基础上,文献中出现的主要变体可归入三类:
正则方式不同 。除 4.3 节的 KL 正则外,也有工作直接以「认知不确定性应随证据增加而衰减」作为约束,或对证据施加 L 2 L_2 L 2 惩罚。其共同目标都是阻止 S S S 的退化。监督方式不同 。Prior Networks 不在期望风险上训练,而是显式地构造一个目标迪利克雷分布 (例如:分布内样本用尖锐的 Dirichlet 匹配、分布外样本用平坦的 Dirichlet 匹配),并在分布层面直接计算 KL。这需要分布外样本来定义目标,因此换取的是更强的不确定性控制与更弱的即插即用性。回归情形的推广 。把分类的迪利克雷替换为 Normal-Inverse-Gamma 先验,即得 Deep Evidential Regression(5.5 节)。统一框架也澄清了一个理论定位问题:EDL 与贝叶斯神经网络(BNN)、深度集成(deep ensembles)、MC Dropout 属于不同的 不确定性来源。后三者通过对网络参数(或其近似后验)的分布求积分得到预测分布。EDL 则在固定的参数点估计上,对输出层的二阶分布 求积分。二者的区分不是工程实现上的,而是概率模型结构上的,这正是下一小节批评的出发点。
EDL 在实践中表现良好,但其理论地位常被过度解读。把边界集中列出,与前文的正式推导互为对照:
它不是贝叶斯不确定性。 严格的后验预测分布应由对网络参数的边缘化给出:
p ( y ∣ x , D ) = ∬ p ( y ∣ π ) p ( π ∣ θ ) p ( θ ∣ D ) d π d θ p(y \mid \mathbf{x}, \mathcal{D}) = \iint p(y \mid \boldsymbol{\pi})\,p(\boldsymbol{\pi} \mid \boldsymbol{\theta})\,p(\boldsymbol{\theta} \mid \mathcal{D})\,\mathrm{d}\boldsymbol{\pi}\,\mathrm{d}\boldsymbol{\theta} p ( y ∣ x , D ) = ∬ p ( y ∣ π ) p ( π ∣ θ ) p ( θ ∣ D ) d π d θ
而 EDL 以点估计 θ ^ \hat{\boldsymbol{\theta}} θ ^ 替换外层积分,取 p ( π ∣ x ) = Dir ( π ; α ( x ; θ ^ ) ) p(\boldsymbol{\pi} \mid \mathbf{x}) = \operatorname{Dir}\big(\boldsymbol{\pi}; \boldsymbol{\alpha}(\mathbf{x}; \hat{\boldsymbol{\theta}})\big) p ( π ∣ x ) = Dir ( π ; α ( x ; θ ^ ) ) 。结果是一个插值(plug-in)估计 ,其内层积分给出 p k = α k / α 0 p_k = \alpha_k/\alpha_0 p k = α k / α 0 (由聚合性),确实正确。但外层积分被抛弃,u u u 与 I ( y ; π ) I(y;\boldsymbol{\pi}) I ( y ; π ) 所度量的是「对输出分布的把握」,而非「对模型的把握」。二者在分布外输入上可以严重分歧:一个被错误训练的网络可以以极低的 u u u 输出一个错误的类别。不确定性分数丢弃了证据的分布信息。 如 3.5 节所述,u = K / S u = K/S u = K / S 仅是总证据的函数。它无法表达「证据分散但充分」与「证据集中但贫乏」的区别,也无法区分证据落在何类。I ( y ; π ) I(y;\boldsymbol{\pi}) I ( y ; π ) 缓解了这一点,但仍不引入任何关于模型参数的信息。拟合损失带有一个与强度耦合的偏置。 推论 4.2 表明,对数形式等价于交叉熵加上 ( 1 2 α y − 1 2 S ) (\frac{1}{2\alpha_y} - \frac{1}{2S}) ( 2 α y 1 − 2 S 1 ) 的修正。因此损失的最小值并不位于「插值交叉熵的最优解」,而是位于一个把证据量级也纳入权衡的点上。这不是缺陷本身,但它意味着EDL 的优化目标与「拟合条件分布」并非同一个目标 ,将其损失解释为似然的做法在术语上应作区分。「以损失最小化实现不确定性量化」这一范式受到根本性质疑。 有研究指出,当认知不确定性被定义为某个二阶损失(即关于 Dir ( α ) \operatorname{Dir}(\boldsymbol{\alpha}) Dir ( α ) 的泛函)的极小化者时,损失可以在与真实认知状态无关的第二阶分布上取得同一最小值,从而该极小化者一般并不落在具有正确认知解释的分布上。换言之,「损失小」并不蕴含「认知不确定性估计正确」。这一批评与本条前三点在方向上是独立的:即便接受 EDL 的目标函数,其最优解也未必具有所宣称的语义。它对主干特征的可分性有隐含依赖。 证据由 e = g θ ( x ) \mathbf{e} = g_{\boldsymbol{\theta}}(\mathbf{x}) e = g θ ( x ) 给出,因此 x \mathbf{x} x 落在分布外时能否给出低证据,完全取决于特征提取器是否把该区域映射到低响应区。若主干网络对分布外输入仍产生高幅 logits,EDL 的不确定性同样失效——它把 OOD 问题从输出层转移到了特征层,而非解决它 。综合以上点,恰当的使用立场是:把 EDL 视为一种参数高效、结构可解释的不确定性启发式,而非贝叶斯推理的替代品。 它在「单次前向代价下同时输出预测与不确定性」这一约束下的性价比是突出的。但凡是论断依赖于「该不确定性具有贝叶斯后验语义」的场合,都应改回到对参数做边缘化的方法,或至少给出与后者的对照实验。
由命题 3.4,u = K / S u = K/S u = K / S 是一个单调反比于总证据 的量,因此可以直接充当分布外(OOD)分数:u u u 高意味着输入未能激活任何类别的证据。以阈值 τ \tau τ 作拒识判决
y ^ ( x ) = { arg max k p k , u ( x ) ≤ τ reject , u ( x ) > τ \hat{y}(\mathbf{x}) = \begin{cases} \arg\max_k p_k, & u(\mathbf{x}) \le \tau \\ \text{reject}, & u(\mathbf{x}) > \tau \end{cases} y ^ ( x ) = { arg max k p k , reject , u ( x ) ≤ τ u ( x ) > τ 即得开放集分类器。与之竞争的分数包括最大 softmax 概率(MSP)、预测熵、ODIN 的温度与输入扰动、Mahalanobis 距离,以及能量分数 LSE ( z ) = log ∑ k e z k \operatorname{LSE}(\mathbf{z}) = \log\sum_k e^{z_k} LSE ( z ) = log ∑ k e z k 。将它们在性质上加以对照:
分数 依赖的结构 是否需要 OOD 数据 不确定性语汇 MSP / 熵 softmax 输出 否 无(受 3.3 节缺陷支配) Mahalanobis 各特征层的类条件高斯 否 距离,几何语义 能量分数 logits 的对数配分 否 无显式不确定性 EDL 的 u u u 迪利克雷总强度 S S S 否 证据缺失量,可解释
EDL 在此项比较中的结构性优势在于两点。第一,它的不确定性是训练目标的一部分 (由 4.3 节的正则项直接优化),而非对训练好的网络做事后加工的产物。第二,它给出的是类概率向量的分布,因此可以在不接触任何 OOD 样本的前提下产生 OOD 分数——这是先验网络之外少有的性质(先验网络需要 OOD 样本以构造目标分布)。
限度同样明确:如 4.5 节第 5 点所述,其成败取决于特征空间的可分性。评价应使用 AUROC、AUPR(In/Out 与 Out/In 分别报告)、FPR@95TPR 以及开放集风险—覆盖曲线,而非仅报单一的准确率。
校准 关心的是 P ( y ^ = y ∣ p ^ = q ) = q \mathbb{P}(\hat{y} = y \mid \hat{p} = q) = q P ( y ^ = y ∣ p ^ = q ) = q 是否成立,常用期望校准误差
ECE = ∑ m = 1 M ∣ B m ∣ n ∣ acc ( B m ) − conf ( B m ) ∣ \text{ECE} = \sum_{m=1}^{M} \frac{|\mathcal{B}_m|}{n}\,\Big|\operatorname{acc}(\mathcal{B}_m) - \operatorname{conf}(\mathcal{B}_m)\Big| ECE = m = 1 ∑ M n ∣ B m ∣ acc ( B m ) − conf ( B m ) 度量,其中 B m \mathcal{B}_m B m 是置信度分箱。EDL 的训练目标隐含地抑制了 3.3 节所述的 logits 发散退化,因此在若干基准上比 MSP 更校准。但这不是免费的:如 4.5 节第 7 点,EDL 的一阶校准同样需要验证,不应默认成立。
选择性预测(selective prediction) 是 u u u 的更自然的落点。经典 Chow 规则指出,在已知真实后验 p ( y ∣ x ) p(y \mid \mathbf{x}) p ( y ∣ x ) 时,最优拒识策略是「当最大后验概率低于某阈值时拒识」,其最优性依赖于 p p p 本身的正确性 。EDL 提供了一条与之互补的路径:直接使用二阶量 u u u 或 I ( y ; π ) I(y;\boldsymbol{\pi}) I ( y ; π ) 作为拒识分数,从而绕开对一阶校准的依赖。其代价是引入了一个新的、校准状况未知的量。实践中应同时考察两条路径并报告风险—覆盖曲线下的面积(AURC)。
主动学习。 采集函数可以直接取 u ( x ) u(\mathbf{x}) u ( x ) 或 I ( y ; π ) ( x ) I(y;\boldsymbol{\pi})(\mathbf{x}) I ( y ; π ) ( x ) :前者是「总证据最少」,后者是「关于类概率的知识增益最大」。选择 I I I 而非 u u u 的好处在于它同时考虑证据的量与分布,等价于 BALD 在迪利克雷族内的闭式对应物。EDL 在此场景的最大优势是代价 :一次前向即可得到采集分数,无需 MC 采样、无需多次前向、无需集成子模型。其风险同样直接来自 4.5 节第 1 点:若 u u u 因特征层的原因而系统性高估某些区域,主动学习会持续采样这些区域,形成采样偏差。缓解办法是在采集函数中叠加批内多样性项。
半监督与伪标签。 伪标签流程中,u u u 提供了比「最大概率」更细的过滤准则:取 u < τ u < \tau u < τ 的样本赋予伪标签,可以同时排除「概率高但实为分布外」的样本——这正是 MSP 过滤所无法处理的失败模式。反之,当 τ \tau τ 过紧时,模型会倾向于只在自己已经熟悉的区域采样伪标签,导致训练集分布收缩、对稀有模式进一步失明。该权衡与 5.6 节讨论的长尾问题同源。
在医学影像、自动驾驶与工业质检等场景中,「放弃预测并移交人类」是一个具有明确成本结构的决策,而非纯粹的统计操作。EDL 在这里的价值不是给出更准的标签,而是提供一个可嵌入决策规则的二阶量 :
分割与体素级不确定性 :对每个体素输出 Dir ( α ) \operatorname{Dir}(\boldsymbol{\alpha}) Dir ( α ) ,得到逐像素的 u u u ,可据此生成「需人工复核区域」的掩码。转诊(referral)机制 :将 u > τ u > \tau u > τ 的样本路由至专家,使自动化系统在其能力边界处显式地退出。开放集动作识别 :视频中存在未见动作时,u u u 提供拒绝信号。分子性质预测与虚拟筛选 :在化学空间中标识训练分布之外的候选物,避免对高不确定性的预测投入昂贵的实验验证。这些应用的共同点是:错误的代价不对称,且「不预测」是允许的动作。 这也划定了 EDL 不适用的场合——当系统必须对所有输入给出一个标签、且拒识没有对应的动作时,u u u 至多是一个监控指标。
分类的目标是单纯形上的向量,回归的目标是实数。相应地把迪利克雷替换为正态—逆 Gamma(Normal-Inverse-Gamma, NIG)先验 :
μ ∼ N ( γ , σ 2 υ ) , σ 2 ∼ Γ − 1 ( α , β ) \mu \sim \mathcal{N}\!\left(\gamma, \frac{\sigma^2}{\upsilon}\right),
\qquad
\sigma^2 \sim \Gamma^{-1}(\alpha, \beta) μ ∼ N ( γ , υ σ 2 ) , σ 2 ∼ Γ − 1 ( α , β ) 网络对每个输入输出四元组 ( γ , υ , α , β ) (\gamma, \upsilon, \alpha, \beta) ( γ , υ , α , β ) ,边缘预测为自由度 2 α 2\alpha 2 α 的 Student-t t t 分布。其预测方差可精确分解为偶然部分 β / ( α − 1 ) \beta/(\alpha - 1) β / ( α − 1 ) 与认知部分 β / [ υ ( α − 1 ) ] \beta/[\upsilon(\alpha - 1)] β / [ υ ( α − 1 )] ,二者之和 β ( υ + 1 ) / [ υ ( α − 1 ) ] \beta(\upsilon + 1)/[\upsilon(\alpha - 1)] β ( υ + 1 ) / [ υ ( α − 1 )] 即自由度 2 α 2\alpha 2 α 的 Student-t t t 分布的方差,形式上与命题 3.5 的分解对应。该推广在分子性质预测、三维重建与不确定性感知的姿态估计中均有应用。
需要指出的是,这一推广的理论状况比分类情形更受争议:有后续研究指出,此类模型所报告的「认知」分量并不随训练数据的增加而按预期衰减,其与偶然分量的分离缺乏理论保证。因此 4.5 节的谨慎立场在回归情形下应进一步加强。
最后讨论一个尚未定型、但在方法上自然的方向:把 EDL 与基于原型的超球面表示学习结合。设主干网络输出归一化特征 f θ ( x ) ∈ S d − 1 \mathbf{f}_{\boldsymbol{\theta}}(\mathbf{x}) \in \mathbb{S}^{d-1} f θ ( x ) ∈ S d − 1 ,各类原型为 { v k } ⊂ S d − 1 \{\mathbf{v}_k\} \subset \mathbb{S}^{d-1} { v k } ⊂ S d − 1 ,相似度 s k = ⟨ f , v k ⟩ s_k = \langle \mathbf{f}, \mathbf{v}_k \rangle s k = ⟨ f , v k ⟩ 。传统原型方法以 z k = κ s k \mathbf{z}_k = \kappa s_k z k = κ s k 作为 logits 并配 softmax 交叉熵,由 3.3 节,这仍受平移不变性与 logits 发散两项缺陷的支配。
一个直接的融合方案是把相似度送入证据函数:
e k = g ( κ s k ) , α k = 1 + g ( κ s k ) , S = K + ∑ k = 1 K g ( κ s k ) e_k = g(\kappa\, s_k), \qquad \alpha_k = 1 + g(\kappa\, s_k), \qquad S = K + \sum_{k=1}^K g(\kappa\, s_k) e k = g ( κ s k ) , α k = 1 + g ( κ s k ) , S = K + k = 1 ∑ K g ( κ s k ) 其中 g g g 取 3.4 节的非负激活,κ \kappa κ 沿用 vMF 分布的集中参数语义。该构造把几何与不确定性直接挂钩:特征落在某原型附近时,s k s_k s k 接近 1 1 1 、证据充分、u u u 小。特征落在所有原型之外(其与全部原型的相似度均低或为负)时,各 e k e_k e k 同时趋零、u → 1 u \to 1 u → 1 。「离原型远」与「证据不足」在此被同一个机制表达。
但这一构造的成立范围必须严格界定。迪利克雷分布定义在类概率单纯形 上,原型方法定义在球面特征空间 上,二者的「不确定性」不是同一个对象:前者是关于类概率向量的二阶分布,后者是关于特征位置的一阶几何量。x ↦ α ( x ) \mathbf{x} \mapsto \boldsymbol{\alpha}(\mathbf{x}) x ↦ α ( x ) 仍然是一个点估计的映射,因此 4.5 节第 1 点的批评在此完全适用——u u u 度量的是「特征到原型的距离」,而不是「模型对该映射的把握」。要真正结合二者,需要构造(特征空间,类概率空间)的联合 模型,例如令 α \boldsymbol{\alpha} α 自身携带分布(层级模型),或以 vMF 构造特征的生成式模型、以迪利克雷构造其上的分类头,使两个不确定性来源可以在同一层级结构中分别标识。
即便在当前的简化形式下,该方向仍有两个值得推进的具体问题:
长尾与稀有类。 稀有类的原型天然缺乏证据支撑,u u u 更高。这既可以被用作保护机制(在损失中对高 u u u 样本降低梯度权重),也可能加剧对稀有类的欠拟合(模型学会用「不确定」来逃避稀有类)。二者孰占主导是一个可以实验判定的问题。与开集/分布外任务的重叠。 在代码漏洞检测这类任务中,异常样本(漏洞)与正常样本在特征空间中高度重叠,其本质是开集问题而非单纯的类别不平衡。u u u 或 I ( y ; π ) I(y;\boldsymbol{\pi}) I ( y ; π ) 可用作告警与拒识的分数,但必须与 4.5 节第 5 点的前提一并验证:只有当特征提取器确实把漏洞样本映射到低证据区时,这一机制才成立,而这正是需要独立验证的假设。 回顾全文,迪利克雷分布在本文中依次扮演了三个层次的角色:
作为单纯形上的分布 ,它是「关于概率的概率」这一二阶对象的标准载体,其参数由方向 μ \boldsymbol{\mu} μ 与精度 α 0 \alpha_0 α 0 两个正交分量构成(命题 2.2)。作为多项分布的共轭先验 ,它把贝叶斯更新化简为一次向量加法(命题 2.5),并在聚合性、中立性与 stick-breaking 构造下形成一个结构完整、边界清晰的分布族(命题 2.8、2.9)。作为神经网络的输出层 ,经由与主观逻辑的严格双射(命题 3.2),它把分类器的输出从「单纯形上的点」提升为「单纯形上的分布」,从而首次让「我不知道」成为一个可表示、可优化的对象。证据深度学习的核心洞见可以压缩为一句话:softmax 的平移不变性丢弃了 logits 的绝对水平,因而无法表示无信息状态。证据函数不是平移不变的,它把这一被丢弃的自由度重新赋值为「证据的量级」。 命题 3.4 中 u = K / S u = K/S u = K / S 的全部行为——证据充分时趋于确定、证据消失时退回均匀——都是这一重新赋值的直接后果。
配合 4.3 节的退火 KL 正则,模型不仅被要求「预测得对」,还被要求「在预测错时承认自己不确定」。
但本文同样花了相当篇幅界定这一范式的边界。EDL 的不确定性是启发式 的,不是贝叶斯后验不确定性:它以点估计替换了对网络参数的边缘化,因而度量的是对输出分布的把握而非对模型的把握(4.5 节第 1 点)。u u u 丢弃了证据在类别间的分布信息(第 2 点)。其拟合损失带有与证据量级耦合的偏置,不等同于边缘似然(第 3 点)。并且「以损失最小化实现不确定性量化」这一范式本身受到根本性质疑(第 4 点)。这些限制并不取消该方法的实用价值——在单次前向的代价约束下同时给出预测与不确定性,其性价比是突出的——但它们决定了正确的使用姿态:在需要二阶量的场合使用它,在需要后验语义的场合验证它,并在两者都不确定时,回到对参数做边缘化的方法上去。
最后应当记住的是,不确定性量化的可靠程度,与因果推断一样,等于你愿意且能够承担的假设的强度 。迪利克雷分布给出的是一个精确而优美的数学结构。把一个精确的结构接到一个近似的映射(神经网络)上,得到的精确性只属于前者。识别出哪一部分是定理、哪一部分是启发式,是使用这套工具时最有价值的一步。