Skip to content

Dirichlet 分布与证据深度学习

Dirichlet 是单纯形上的分布、多项分布的共轭先验,也是「关于概率的概率」这一二阶对象的自然载体。本文先给出它在定义、矩结构、共轭更新与分裂构造上的完整形式化,神经网络的输出重解释为证据并参数化迪利克雷分布,推导证据深度学习的对数损失等应用。

设 X\mathcal{X} 为输入空间,y∈{1,…,K}y \in \{1, \dots, K\} 为类别标签。一个 KK 分类器的输出在数学上究竟是什么?若要求它给出「属于各类别的概率」,则输出必须落在

ΔK−1={p∈RK:pk≥0, ∑k=1Kpk=1}\Delta^{K-1} = \left\{ \mathbf{p} \in \mathbb{R}^K : p_k \ge 0,\ \textstyle\sum_{k=1}^K p_k = 1 \right\}

之中——概率单纯形上的一个点。这是分类器输出的自然状态空间:它不是 RK\mathbb{R}^K,而是一个 (K−1)(K-1) 维的紧凸集。

一旦承认了这一点,一个二阶问题便随即出现:分类器对自身输出的把握有多大?若把输出建模为单纯形上的一个确定点 p\mathbf{p},则这个问题在表达力上是被禁止的:单纯形内部不存在可以指代「无信息」的元素,因为每个点都是一份完整的、和为 11 的断言。要回答二阶问题,必须把输出从「单纯形上的点」提升为「单纯形上的分布」。承担这一角色的标准对象正是 迪利克雷分布(Dirichlet distribution)。

本文的组织如下。第一部分给出迪利克雷分布的形式化定义、生成性刻画与几何图像。第二部分展开其矩结构、重参数化、共轭更新与分裂构造,并澄清「伪计数」这一常见的直观说法在何处成立、在何处失效。第三部分经由主观逻辑(subjective logic)建立迪利克雷分布与神经网络输出之间的双射,由此引入证据深度学习(Evidential Deep Learning, EDL)。第四部分推导 EDL 的损失函数族及其理论缺陷。第五部分讨论其应用形态与边界。第六部分总结。

一、形式化

1.1 概率单纯形

定义 1.1(概率单纯形) 对整数 K≥2K \ge 2,K−1K-1 维标准单纯形定义为 ΔK−1={x=(x1,…,xK)∈RK:xi≥0, ∑i=1Kxi=1}\Delta^{K-1} = \left\{ \mathbf{x} = (x_1, \dots, x_K) \in \mathbb{R}^K : x_i \ge 0,\ \textstyle\sum_{i=1}^K x_i = 1 \right\} 其内部记作 int⁡ΔK−1={x∈ΔK−1:xi>0, ∀i}\operatorname{int}\Delta^{K-1} = \{\mathbf{x} \in \Delta^{K-1} : x_i > 0,\ \forall i\}。

ΔK−1\Delta^{K-1} 是 RK\mathbb{R}^K 中的紧凸集,其顶点为坐标向量 e1,…,eK\mathbf{e}_1, \dots, \mathbf{e}_K。低维特例给出了全部几何直观:K=2K = 2 时它是一维线段,K=3K = 3 时是二维三角形,K=4K = 4 时是三维四面体。它与 KK 个取值上的离散概率分布全体一一对应,因此「分类器的输出」与「单纯形上的点」是同一件事的两种说法。

本文采用如下测度约定:以 x1,…,xK−1x_1, \dots, x_{K-1} 为自由坐标、xK=1−∑i<Kxix_K = 1 - \sum_{i<K} x_i,并以 x\mathbf{x} 上的 (K−1)(K-1) 维 Lebesgue 测度 dx1⋯dxK−1\mathrm{d}x_1 \cdots \mathrm{d}x_{K-1} 为参考测度。在该约定下 ΔK−1\Delta^{K-1} 的体积为 1/(K−1)!1/(K-1)!,这一点在后文讨论熵时会重新出现。

1.2 形式化定义

定义 1.2(Dirichlet 分布) 设参数向量 α=(α1,…,αK)∈R>0K\boldsymbol{\alpha} = (\alpha_1, \dots, \alpha_K) \in \mathbb{R}_{>0}^K,记 α0=∑i=1Kαi\alpha_0 = \sum_{i=1}^K \alpha_i。若随机向量 x\mathbf{x} 取值于 int⁡ΔK−1\operatorname{int}\Delta^{K-1},且关于上述参考测度的密度为 f(x∣α)=1B(α)∏i=1Kxiαi−1f(\mathbf{x} \mid \boldsymbol{\alpha}) = \frac{1}{B(\boldsymbol{\alpha})} \prod_{i=1}^K x_i^{\alpha_i - 1} 则称 x\mathbf{x} 服从参数为 α\boldsymbol{\alpha} 的迪利克雷分布,记作 x∼Dir⁡(α)\mathbf{x} \sim \operatorname{Dir}(\boldsymbol{\alpha})。其中归一化常数为多元 Beta 函数B(α)=∏i=1KΓ(αi)Γ(α0)B(\boldsymbol{\alpha}) = \frac{\prod_{i=1}^K \Gamma(\alpha_i)}{\Gamma\left(\alpha_0\right)}

该定义之所以合法,依赖于下述恒等式。它是整个理论的算术基础,值得单独给出证明。

命题 1.3(归一化恒等式) 对任意 α∈R>0K\boldsymbol{\alpha} \in \mathbb{R}_{>0}^K, ∫ΔK−1∏i=1Kxiαi−1 dx=B(α)\int_{\Delta^{K-1}} \prod_{i=1}^K x_i^{\alpha_i - 1} \,\mathrm{d}\mathbf{x} = B(\boldsymbol{\alpha})

证明 考虑 R>0K\mathbb{R}_{>0}^K 上的 Gamma 积分之积:

∏i=1KΓ(αi)=∫R>0K∏i=1Ktiαi−1e−ti dt\prod_{i=1}^K \Gamma(\alpha_i) = \int_{\mathbb{R}_{>0}^K} \prod_{i=1}^K t_i^{\alpha_i - 1} e^{-t_i} \,\mathrm{d}\mathbf{t}

作变量替换 ti=s xit_i = s\, x_i,其中 s=∑iti>0s = \sum_i t_i > 0、x∈ΔK−1\mathbf{x} \in \Delta^{K-1}。该替换的 Jacobi 行列式绝对值为 ∣det⁡J∣=sK−1|\det J| = s^{K-1}(可由 K=2K = 2 时的 det⁡(x1sx2−s)=−s\det\begin{pmatrix} x_1 & s \\ x_2 & -s\end{pmatrix} = -s 归纳验证)。代入得

∏i=1KΓ(αi)=∫0∞ ⁣ ⁣∫ΔK−1sK−1∏i=1K(sxi)αi−1e−s∑ixi dx ds\prod_{i=1}^K \Gamma(\alpha_i) = \int_0^\infty \!\!\int_{\Delta^{K-1}} s^{K-1} \prod_{i=1}^K (s x_i)^{\alpha_i - 1} e^{-s \sum_i x_i} \,\mathrm{d}\mathbf{x} \,\mathrm{d}s

利用约束 ∑ixi=1\sum_i x_i = 1,被积函数中的 ss 因子合并为 sK−1+α0−K=sα0−1s^{K - 1 + \alpha_0 - K} = s^{\alpha_0 - 1},指数因子合并为 e−se^{-s},二者均与 x\mathbf{x} 解耦:

∏i=1KΓ(αi)=(∫0∞sα0−1e−s ds)(∫ΔK−1∏i=1Kxiαi−1 dx)=Γ(α0)∫ΔK−1∏i=1Kxiαi−1 dx\prod_{i=1}^K \Gamma(\alpha_i) = \left(\int_0^\infty s^{\alpha_0 - 1} e^{-s} \,\mathrm{d}s\right) \left(\int_{\Delta^{K-1}} \prod_{i=1}^K x_i^{\alpha_i - 1} \,\mathrm{d}\mathbf{x}\right) = \\ \Gamma(\alpha_0) \int_{\Delta^{K-1}} \prod_{i=1}^K x_i^{\alpha_i - 1} \,\mathrm{d}\mathbf{x}

两端除以 Γ(α0)\Gamma(\alpha_0) 即得结论。

命题 1.3 的证明过程本身包含了比结论更多的信息:ss 与 x\mathbf{x} 的完全可分离性。下一小节的生成性刻画正是对这一可分离性的直接读解。

1.3 生成性刻画:Gamma 商表示

命题 1.4(Gamma 商表示) 设 γ1,…,γK\gamma_1, \dots, \gamma_K 相互独立且 γi∼Gamma⁡(αi,1)\gamma_i \sim \operatorname{Gamma}(\alpha_i, 1)(形状 αi\alpha_i、率 11)。令 s=∑i=1Kγi,xi=γis,x=(x1,…,xK)s = \sum_{i=1}^K \gamma_i, \qquad x_i = \frac{\gamma_i}{s}, \qquad \mathbf{x} = (x_1, \dots, x_K) 则 x∼Dir⁡(α)\mathbf{x} \sim \operatorname{Dir}(\boldsymbol{\alpha}),且 x⊥ ⁣ ⁣ ⁣⊥s\mathbf{x} \perp\!\!\!\perp s,其中 s∼Gamma⁡(α0,1)s \sim \operatorname{Gamma}(\alpha_0, 1)。

证明 由独立性,γ\boldsymbol{\gamma} 的联合密度为 ∏iγiαi−1e−γi/Γ(αi)\prod_i \gamma_i^{\alpha_i - 1} e^{-\gamma_i} / \Gamma(\alpha_i)。施行与命题 1.3 相同的替换 γi=sxi\gamma_i = s x_i,联合密度变换为

p(s,x)=sα0−1e−sΓ(α0)⋅Γ(α0)∏i=1Kxiαi−1∏i=1KΓ(αi)=Gamma⁡(s;α0,1)⋅Dir⁡(x;α)p(s, \mathbf{x}) = \frac{s^{\alpha_0 - 1} e^{-s}}{\Gamma(\alpha_0)} \cdot \frac{\Gamma(\alpha_0) \prod_{i=1}^K x_i^{\alpha_i - 1}}{\prod_{i=1}^K \Gamma(\alpha_i)} = \operatorname{Gamma}(s; \alpha_0, 1) \cdot \operatorname{Dir}(\mathbf{x}; \boldsymbol{\alpha})

右侧分解为仅含 ss 与仅含 x\mathbf{x} 的两个因子的乘积,故 ss 与 x\mathbf{x} 独立,且各自的边缘分布如命题所述。

命题 1.4 给出了三条即时的推论。其一,它提供了一个 O(K)O(K) 的精确采样算法:独立抽取 KK 个 Gamma 变量再归一化,无需拒绝采样或逆变换。其二,它说明参数 α0=∑iαi\alpha_0 = \sum_i \alpha_i 在概率意义上是先于归一化的总质量,这一角色将在 2.2 节被重新参数化为一个精度参数。其三,它把迪利克雷分布与 Gamma 分布、进而与 Poisson 过程联系起来,这正是 2.5 节分裂构造的来源。

1.4 与 Beta 分布、多项分布的关系

退化到 Beta 分布。 当 K=2K = 2 时,约束 x1+x2=1x_1 + x_2 = 1 使分布由单一变量 x1x_1 完全决定,密度退化为

f(x1∣α1,α2)=x1α1−1(1−x1)α2−1B(α1,α2),即Dir⁡(α1,α2)≡Beta⁡(α1,α2)f(x_1 \mid \alpha_1, \alpha_2) = \frac{x_1^{\alpha_1 - 1}(1 - x_1)^{\alpha_2 - 1}}{B(\alpha_1, \alpha_2)}, \qquad \text{即} \qquad \operatorname{Dir}(\alpha_1, \alpha_2) \equiv \operatorname{Beta}(\alpha_1, \alpha_2)

故迪利克雷分布是 Beta 分布在维度上的推广。下文所有关于迪利克雷分布的陈述,在 K=2K=2 时都应退化为 Beta 分布的相应陈述,这构成了检验公式正确性的一个廉价判据。

边缘分布仍为 Beta。 更一般地,任意单个分量 xix_i 的边缘分布是 Beta⁡(αi,α0−αi)\operatorname{Beta}(\alpha_i, \alpha_0 - \alpha_i)。这一点可由命题 1.4 直接看出:xi=γi/(s)x_i = \gamma_i / (s),而 γi⊥(s−γi)\gamma_i \perp (s - \gamma_i),故 xix_i 是相互独立的两个 Gamma 变量之比,其分布为 Beta。

与多项分布的共轭关系。 迪利克雷分布之所以在贝叶斯统计中占据中心位置,在于它是多项分布(等价地,分类分布)的共轭先验。其确切含义与算术后果见 2.4 节。此处只指出其直觉:若先验以「伪计数」α\boldsymbol{\alpha} 描述对各类别出现次数的初始信念,则观测到计数 n\mathbf{n} 后,信念的更新只是 α↦α+n\boldsymbol{\alpha} \mapsto \boldsymbol{\alpha} + \mathbf{n}。贝叶斯更新的全部计算复杂度,在这个共轭对中退化为一次向量加法。

二、解析性质

2.1 矩结构

命题 2.1(期望、方差与协方差) 设 x∼Dir⁡(α)\mathbf{x} \sim \operatorname{Dir}(\boldsymbol{\alpha})。则对任意 i,ji, jE[xi]=αiα0,Var⁡(xi)=αi(α0−αi)α02(α0+1),Cov⁡(xi,xj)=−αiαjα02(α0+1)(i≠j)\mathbb{E}[x_i] = \frac{\alpha_i}{\alpha_0}, \qquad \operatorname{Var}(x_i) = \frac{\alpha_i(\alpha_0 - \alpha_i)}{\alpha_0^2(\alpha_0 + 1)}, \qquad \operatorname{Cov}(x_i, x_j) = \frac{-\alpha_i \alpha_j}{\alpha_0^2(\alpha_0 + 1)} \quad (i \ne j)

证明 由命题 1.4,xi=γi/sx_i = \gamma_i / s 且 γi⊥s\gamma_i \perp s,故 E[xi]=E[γi] E[1/s]=αi⋅1α0\mathbb{E}[x_i] = \mathbb{E}[\gamma_i]\,\mathbb{E}[1/s] = \alpha_i \cdot \frac{1}{\alpha_0},末一步用到 Gamma⁡(α0,1)\operatorname{Gamma}(\alpha_0,1) 的倒数的期望 E[1/s]=1/(α0−1)\mathbb{E}[1/s] = 1/(\alpha_0 - 1) 与 α0↦α0−1\alpha_0 \mapsto \alpha_0 - 1 的平移技巧,或直接由命题 1.3 的矩恒等式 E[∏ixiβi]=B(α+β)/B(α)\mathbb{E}[\prod_i x_i^{\beta_i}] = B(\boldsymbol{\alpha} + \boldsymbol{\beta})/B(\boldsymbol{\alpha}) 取 βi=1\beta_i = 1 得到。二阶矩由 E[xi2]=αi(αi+1)α0(α0+1)\mathbb{E}[x_i^2] = \frac{\alpha_i(\alpha_i+1)}{\alpha_0(\alpha_0+1)} 与 E[xixj]=αiαjα0(α0+1)\mathbb{E}[x_i x_j] = \frac{\alpha_i \alpha_j}{\alpha_0(\alpha_0+1)} 相减即得。

上述结果可写成更紧凑的矩阵形式。记 μ=α/α0∈int⁡ΔK−1\boldsymbol{\mu} = \boldsymbol{\alpha}/\alpha_0 \in \operatorname{int}\Delta^{K-1} 为均值向量,则

Σ=Cov⁡(x)=1α0+1(diag⁡(μ)−μμ⊤)\boldsymbol{\Sigma} = \operatorname{Cov}(\mathbf{x}) = \frac{1}{\alpha_0 + 1}\left(\operatorname{diag}(\boldsymbol{\mu}) - \boldsymbol{\mu}\boldsymbol{\mu}^\top\right)

这一形式揭示了两个结构性事实。第一,协方差矩阵的秩为 K−1K-1:由于 1⊤Σ1=0\mathbf{1}^\top \boldsymbol{\Sigma} \mathbf{1} = 0,Σ\boldsymbol{\Sigma} 必然奇异,其零空间由 1\mathbf{1} 张成——这正是「分布在 (K−1)(K-1) 维对象上」的代数痕迹。第二,全部协方差为负:Cov⁡(xi,xj)<0 (i≠j)\operatorname{Cov}(x_i, x_j) < 0\ (i \ne j),因为分量之间必须通过和为 11 的约束相互竞争,任何一个分量的增加都以其他分量的期望减少为代价。

2.2 均值—精度重参数化

命题 2.1 中的 μ\boldsymbol{\mu} 与 α0\alpha_0 是两个正交的自由度:前者决定「概率质量落在何处」,后者决定「分布在该处聚集得多紧」。据此引入重参数化

α=α0μ,α0>0, μ∈int⁡ΔK−1\boldsymbol{\alpha} = \alpha_0 \boldsymbol{\mu}, \qquad \alpha_0 > 0,\ \boldsymbol{\mu} \in \operatorname{int}\Delta^{K-1}

它把参数空间分解为一个方向(K−1K-1 维单纯形)与一个尺度(正实数)。在此参数化下,协方差为 Σ=1α0+1(diag⁡μ−μμ⊤)\boldsymbol{\Sigma} = \frac{1}{\alpha_0+1}(\operatorname{diag}\boldsymbol{\mu} - \boldsymbol{\mu}\boldsymbol{\mu}^\top),与 μ\boldsymbol{\mu} 的取值无关、只随 α0\alpha_0 单调收缩。因此 α0\alpha_0 是一个纯粹的集中度(或称精度、强度)参数:

命题 2.2(集中性极限) 固定 μ∈int⁡ΔK−1\boldsymbol{\mu} \in \operatorname{int}\Delta^{K-1},令 α(α0)=α0μ\boldsymbol{\alpha}^{(\alpha_0)} = \alpha_0 \boldsymbol{\mu}。则当 α0→∞\alpha_0 \to \infty 时,Dir⁡(α0μ)\operatorname{Dir}(\alpha_0 \boldsymbol{\mu}) 弱收敛于位于 μ\boldsymbol{\mu} 的退化测度 δμ\delta_{\boldsymbol{\mu}}。

证明 由命题 2.1,E[x]=μ\mathbb{E}[\mathbf{x}] = \boldsymbol{\mu} 且 Σ=O(1/α0)→0\boldsymbol{\Sigma} = O(1/\alpha_0) \to \mathbf{0}。对任意 ε>0\varepsilon > 0,由 Chebyshev 不等式 P(∥x−μ∥>ε)≤tr⁡Σ/ε2→0\mathbb{P}(\|\mathbf{x} - \boldsymbol{\mu}\| > \varepsilon) \le \operatorname{tr}\boldsymbol{\Sigma}/\varepsilon^2 \to 0,故依概率收敛,进而弱收敛于 δμ\delta_{\boldsymbol\mu}。

这一命题给出了本文后续所有「不确定性」语汇的几何基础:迪利克雷分布的「模糊程度」等于 1/α01/\alpha_0 的量级,而它的「中心」由 μ\boldsymbol{\mu} 给出。 两者在同一族分布中被参数化为彼此独立的量——这正是证据深度学习能够把「预测什么」与「有多确定」分离开来的数学根据。

2.3 众数与熵

命题 2.3(众数) 若 αi>1\alpha_i > 1 对一切 ii 成立,则 f(x∣α)f(\mathbf{x} \mid \boldsymbol{\alpha}) 在 ΔK−1\Delta^{K-1} 的内部有唯一众数 x⋆=(α1−1α0−K,…,αK−1α0−K)\mathbf{x}^\star = \left( \frac{\alpha_1 - 1}{\alpha_0 - K}, \dots, \frac{\alpha_K - 1}{\alpha_0 - K} \right)

当某个 αi≤1\alpha_i \le 1 时密度在对应边界面上无界,众数退化到边界,此时分布呈现 2.6 节所述的稀疏形态。

命题 2.4(微分熵) 在 1.1 节的测度约定下,x∼Dir⁡(α)\mathbf{x} \sim \operatorname{Dir}(\boldsymbol{\alpha}) 的微分熵为 H(x)=log⁡B(α)+(α0−K) ψ(α0)−∑i=1K(αi−1) ψ(αi)H(\mathbf{x}) = \log B(\boldsymbol{\alpha}) + (\alpha_0 - K)\,\psi(\alpha_0) - \sum_{i=1}^K (\alpha_i - 1)\,\psi(\alpha_i) 其中 ψ=Γ′/Γ\psi = \Gamma'/\Gamma 为 digamma 函数。

证明 直接计算 H=−∫flog⁡fH = -\int f \log f,代入 −log⁡f=log⁡B(α)−∑i(αi−1)log⁡xi-\log f = \log B(\boldsymbol{\alpha}) - \sum_i (\alpha_i - 1)\log x_i 与 E[log⁡xi]=ψ(αi)−ψ(α0)\mathbb{E}[\log x_i] = \psi(\alpha_i) - \psi(\alpha_0)(由命题 1.3 的矩恒等式对 βi\beta_i 求导得到),整理即得。

在对称情形 α=α1\boldsymbol{\alpha} = \alpha \mathbf{1} 下,HH 在 α=1\alpha = 1 处取最大值 −log⁡Γ(K)=−log⁡(K−1)!-\log \Gamma(K) = -\log (K-1)!。该值为负,并不矛盾:它是相对于体积为 1/(K−1)!<11/(K-1)! < 1 的支撑集而言的。α=1\alpha = 1 对应单纯形上的均匀分布——一个在其支撑集上平坦、却因支撑集体积小于一而具有负微分熵的密度。一般地,由于 ΔK−1\Delta^{K-1} 紧且测度有限,均匀分布是最大熵分布,故

H(x)≤−log⁡Γ(K),等号成立  ⟺  α=1H(\mathbf{x}) \le -\log \Gamma(K), \qquad \text{等号成立} \iff \boldsymbol{\alpha} = \mathbf{1}

2.4 共轭性与贝叶斯更新

命题 2.5(Dirichlet–Multinomial 共轭) 设先验 π∼Dir⁡(α)\boldsymbol{\pi} \sim \operatorname{Dir}(\boldsymbol{\alpha}),给定 π\boldsymbol{\pi} 观测到计数向量 n=(n1,…,nK)\mathbf{n} = (n_1, \dots, n_K)(ni∈Nn_i \in \mathbb{N},N=∑iniN = \sum_i n_i),则后验为 π∣n∼Dir⁡(α+n)\boldsymbol{\pi} \mid \mathbf{n} \sim \operatorname{Dir}(\boldsymbol{\alpha} + \mathbf{n})

证明 多项似然正比于 ∏iπini\prod_i \pi_i^{n_i},与先验密度相乘得

p(π∣n)∝∏i=1Kπiαi+ni−1p(\boldsymbol{\pi} \mid \mathbf{n}) \propto \prod_{i=1}^K \pi_i^{\alpha_i + n_i - 1}

该核与 Dir⁡(α+n)\operatorname{Dir}(\boldsymbol{\alpha} + \mathbf{n}) 的核成比例,归一化即得。

由共轭性可立即导出两个推论,它们在应用中的地位不低于命题本身。

推论 2.6(Dirichlet–Multinomial 分布) 计数向量 n\mathbf{n} 的边缘似然为 p(n∣α)=N!∏ini!⋅B(α+n)B(α)=Γ(α0)Γ(α0+N)∏i=1KΓ(αi+ni)Γ(αi)p(\mathbf{n} \mid \boldsymbol{\alpha}) = \frac{N!}{\prod_i n_i!} \cdot \frac{B(\boldsymbol{\alpha} + \mathbf{n})}{B(\boldsymbol{\alpha})} = \frac{\Gamma(\alpha_0)}{\Gamma(\alpha_0 + N)} \prod_{i=1}^K \frac{\Gamma(\alpha_i + n_i)}{\Gamma(\alpha_i)}

推论 2.7(后验预测与收缩) 对未见样本, P(ynew=k∣n)=αk+nkα0+N\mathbb{P}(y_{\text{new}} = k \mid \mathbf{n}) = \frac{\alpha_k + n_k}{\alpha_0 + N} 而 E[πk∣n]\mathbb{E}[\pi_k \mid \mathbf{n}] 是先验均值与经验频率的凸组合: E[πk∣n]=α0α0+N⏟收缩权重⋅αkα0+Nα0+N⏟数据权重⋅nkN\mathbb{E}[\pi_k \mid \mathbf{n}] = \underbrace{\frac{\alpha_0}{\alpha_0 + N}}_{\text{收缩权重}} \cdot \frac{\alpha_k}{\alpha_0} + \underbrace{\frac{N}{\alpha_0 + N}}_{\text{数据权重}} \cdot \frac{n_k}{N}

推论 2.7 用一句话概括了加法平滑的全部含义:先验强度的倒数 α0\alpha_0 相对于样本量 NN 的大小,就是数据与先验的信任分配比例。 取 αi=1\alpha_i = 1 得 Laplace 平滑,取 αi>1\alpha_i > 1 得 Lidstone 平滑,取 αi→0\alpha_i \to 0 得最大似然估计——这三个统计实践中彼此孤立出现的技巧,在此被识别为同一族参数的不同取值。

2.5 聚合性、中立性与分裂构造

命题 2.8(聚合性) 设 x∼Dir⁡(α)\mathbf{x} \sim \operatorname{Dir}(\boldsymbol{\alpha}),{I1,…,IM}\{I_1, \dots, I_M\} 是 {1,…,K}\{1, \dots, K\} 的一个划分。令 ym=∑i∈Imxiy_m = \sum_{i \in I_m} x_i,则 y∼Dir⁡(β)\mathbf{y} \sim \operatorname{Dir}(\boldsymbol{\beta}),其中 βm=∑i∈Imαi\beta_m = \sum_{i \in I_m} \alpha_i。

聚合性说明迪利克雷族在粗化(coarsening)下封闭:把若干类别合并,得到的仍是同一族的成员,参数按分量求和。这一性质在层级分类、LDA 中主题的合并、以及 3.5 节中「由多项分布边缘化得到分类预测」的推导中都扮演关键角色。

由聚合性可导出中立性(neutrality):对任意 kk,xkx_k 与其余分量的归一化版本 (xi/(1−xk))i≠k\left(x_i/(1-x_k)\right)_{i \ne k} 相互独立,且后者服从 Dir⁡(α−k)\operatorname{Dir}(\boldsymbol{\alpha}_{-k}) 而 xk∼Beta⁡(αk,α0−αk)x_k \sim \operatorname{Beta}(\alpha_k, \alpha_0 - \alpha_k)。反复施用中立性,得到如下构造性表示:

命题 2.9(stick-breaking 表示) 设 vk∼Beta⁡ ⁣(αk,∑j>kαj)v_k \sim \operatorname{Beta}\!\left(\alpha_k, \sum_{j>k} \alpha_j\right) 相互独立。令 x1=v1,xk=vk∏j<k(1−vj)(k=2,…,K)x_1 = v_1, \qquad x_k = v_k \prod_{j < k}(1 - v_j) \quad (k = 2, \dots, K) 则 (x1,…,xK)∼Dir⁡(α)(x_1, \dots, x_K) \sim \operatorname{Dir}(\boldsymbol{\alpha})。

命题 2.9 是 Sethuraman 式的「折断木棍」构造在有限维的情形:从长度为 11 的木棍中依次折断出比例 vkv_k 的一段。它在无穷维极限下给出 Dirichlet 过程,因而把本文的有限维话题与贝叶斯非参数方法连接起来。

2.6 参数的直观:伪计数及其边界

综合 2.1 至 2.5 节,可以把形状参数 α\boldsymbol{\alpha} 的语义概括为三点:

  1. 在共轭更新中,α\boldsymbol{\alpha} 起先验样本计数的角色(命题 2.5),其总强度 α0\alpha_0 是「先验等价样本量」(推论 2.7)。
  2. 在几何上,α\alpha 由方向 μ\boldsymbol{\mu} 与精度 α0\alpha_0 两个正交分量构成(2.2 节),精度决定围绕 μ\boldsymbol{\mu} 的收缩程度。
  3. 在似然意义上,αi−1\alpha_i - 1 是对数密度中 xix_i 的指数,故 αi<1\alpha_i < 1 意味着密度在 xi→0x_i \to 0 处发散。

对于对称情形 α=α1\boldsymbol{\alpha} = \alpha \mathbf{1},这三重语义给出一条完整的形态谱:

参数区间分布的形态采样的典型特征典型用途
α→0\alpha \to 0质量集中于顶点 {ei}\{\mathbf{e}_i\} 邻域极端稀疏,单个分量接近 11LDA 文档—主题混合(文档只涉少数主题)
α=1\alpha = 1单纯形上的均匀分布各分量量级相当,无偏好无信息先验
α>1\alpha > 1集中于中心 1/K\mathbf{1}/K,随 α\alpha 增大而收缩各分量接近 1/K1/K 的平滑向量强正则化、收缩估计

此处必须澄清一个常见但过强的说法:把 αi\alpha_i 直接称为「观测到的次数」只在 αi≥1\alpha_i \ge 1 时在字面上成立。当 αi<1\alpha_i < 1 时,αi−1<0\alpha_i - 1 < 0,隐含的「先验计数」为负,这在计数语义下不可解释,却对应于密度在边界处的发散——一个在稀疏建模中必不可少的形态。准确的说法是:α\boldsymbol{\alpha} 是伪计数概念的连续化,其在 αi≥1\alpha_i \ge 1 区域退化回字面意义上的计数解释,而在 αi<1\alpha_i < 1 区域承担的是稀疏性先验的角色。 这一区分在 3.4 节将直接决定 EDL 中「证据」一词的适用边界。

三、主观逻辑到证据深度学习

3.1 主观逻辑的 opinion 表示

证据深度学习的直接理论前身是 Josang 的主观逻辑(subjective logic),它为「对一个命题的相信程度」建立了一套带不确定性维度的代数。

定义 3.1(opinion) 在有限域 Y={1,…,K}\mathcal{Y} = \{1, \dots, K\} 上的一个 opinion 是三元组 ω=(b,u,a)\omega = (\mathbf{b}, u, \mathbf{a}),其中

  • b=(b1,…,bK)∈[0,1]K\mathbf{b} = (b_1, \dots, b_K) \in [0,1]^K 为信念质量(belief mass)。
  • u∈[0,1]u \in [0,1] 为不确定性质量(uncertainty mass)。
  • a∈[0,1]K\mathbf{a} \in [0,1]^K,∑kak=1\sum_k a_k = 1,为基准率(base rate)。

并满足单纯形约束 ∑k=1Kbk+u=1\sum_{k=1}^K b_k + u = 1。

ω\omega 的概率投影(probability projection) 定义为 Pk=bk+akuP_k = b_k + a_k u:在不了解具体类别时退回基准率,在有所了解时按信念质量分配。当基准率取均匀值 ak=1/Ka_k = 1/K 时,Pk=bk+u/KP_k = b_k + u/K。

定义 3.1 的关键在于:opinion 所栖居的空间是 ΔK\Delta^{K}——一个 KK 维单纯形,比 ΔK−1\Delta^{K-1} 多出一个维度。多出来的这一维正是「不确定性」的自由度,而它恰恰是 softmax 输出所没有的。

3.2 Dirichlet 与 opinion 的双射

主观逻辑与迪利克雷分布之间不存在类比关系,而是存在严格的双射。

命题 3.2(双射) 设先验权重 W=KW = K、基准率 ak=1/Ka_k = 1/K。则如下两个映射互逆: b=α−1α0,u=Kα0⟺αk=K bku+1,α0=Ku\mathbf{b} = \frac{\boldsymbol{\alpha} - \mathbf{1}}{\alpha_0}, \qquad u = \frac{K}{\alpha_0} \qquad \Longleftrightarrow \qquad \alpha_k = \frac{K\, b_k}{u} + 1, \qquad \alpha_0 = \frac{K}{u}

验证 正向:∑kbk+u=α0−Kα0+Kα0=1\sum_k b_k + u = \frac{\alpha_0 - K}{\alpha_0} + \frac{K}{\alpha_0} = 1,满足定义 3.1 的约束。反向:代入即得恒等。此外,概率投影与迪利克雷期望重合:

Pk=bk+uK=αk−1α0+1α0=αkα0=E[xk]P_k = b_k + \frac{u}{K} = \frac{\alpha_k - 1}{\alpha_0} + \frac{1}{\alpha_0} = \frac{\alpha_k}{\alpha_0} = \mathbb{E}[x_k]

其中最后一个等号由命题 2.1 给出。

命题 3.2 是整篇文章的枢纽:它说明在单纯形上输出一个概率分布,与在 opinion 空间中输出一个带不确定性度量的判断,是同一件事。 于是,「给网络加一个不确定性维度」这一看似需要新架构的任务,被归结为「让网络的输出参数化一个迪利克雷分布」。证据深度学习正是沿着这条路径展开的。

3.3 Softmax 的翻译不变性与过度自信

设神经网络 fθ:X→RKf_{\boldsymbol{\theta}}: \mathcal{X} \to \mathbb{R}^K 输出 logits z=fθ(x)\mathbf{z} = f_{\boldsymbol{\theta}}(\mathbf{x}),softmax 给出 p=softmax⁡(z)\mathbf{p} = \operatorname{softmax}(\mathbf{z}),即 pk=ezk/∑jezjp_k = e^{z_k}/\sum_j e^{z_j}。这一映射存在两个结构性缺陷。

其一,平移不变性抹去了「无信息」这一状态。 对任意常数 cc,softmax⁡(z+c1)=softmax⁡(z)\operatorname{softmax}(\mathbf{z} + c\mathbf{1}) = \operatorname{softmax}(\mathbf{z})。因此 logits 的绝对水平不含任何信息,网络的输出只依赖于 {zk}\{z_k\} 的相对差。后果是:z=0\mathbf{z} = \mathbf{0}(「全零 logits」)与 z=100⋅1\mathbf{z} = 100 \cdot \mathbf{1} 不可区分,二者都对应均匀分布 1/K\mathbf{1}/K。既然均匀分布既可由「无任何信号」也可由「极其强烈的信号恰好相互抵消」产生,输出端就不可能把前者作为一个可辨识的状态标记出来。

其二,交叉熵的最优解在可分数据上把 logits 推向发散。 在训练集线性可分时,以交叉熵为目标的极大似然估计不存在有限最优解:沿方向 z→c z⋆, c→∞\mathbf{z} \to c\,\mathbf{z}^\star,\ c \to \infty 可将损失单调压向零。换言之,过度自信不是训练不足的症状,而是 MLE 在可分数据上的退化解——模型越是被「训练充分」,其 softmax 输出越接近 one-hot,而这一行为完全不受输入是否为分布内样本的约束。

两个缺陷合起来解释了 5.1 节的经验事实:以最大 softmax 概率(MSP)作为分布外检测分数存在系统性偏差,因为 softmax 对任何使 logits 相对间距增大的输入都会返回高置信度的断言,而无从表达「这个输入对我而言是陌生的」。

3.4 证据参数化

证据深度学习对上述缺陷的回应是:不再用 softmax 把 logits 压缩为概率,而是用非负激活函数把 logits 提升为证据。

定义 3.3(证据网络) 设 gθ:X→R≥0Kg_{\boldsymbol{\theta}}: \mathcal{X} \to \mathbb{R}_{\ge 0}^K 是由主干网络与非负激活函数复合而成的证据函数,输出 e=gθ(x)=(e1,…,eK)\mathbf{e} = g_{\boldsymbol{\theta}}(\mathbf{x}) = (e_1, \dots, e_K)。迪利克雷参数取为 αk=ek+1,即α=e+1\alpha_k = e_k + 1, \qquad \text{即} \qquad \boldsymbol{\alpha} = \mathbf{e} + \mathbf{1} 网络对输入的预测由此被定义为 Dir⁡(α)\operatorname{Dir}(\boldsymbol{\alpha})。

参数化的语义可直接由命题 3.2 读出:e=α−1\mathbf{e} = \boldsymbol{\alpha} - \mathbf{1} 正是超出均匀先验 akW=1a_k W = 1 的那部分伪计数,即 2.6 节意义上「可解释为计数」的区域。这就是「证据」一词的来源:eke_k 是与类别 kk 相关的、由网络从输入中提取出的支持性观测。

非负激活函数的选择影响显著,值得逐一说明:

  • softplus⁡(z)=log⁡(1+ez)\operatorname{softplus}(z) = \log(1 + e^z):恒正、处处可微、在 z→−∞z \to -\infty 时以 eze^z 的速度趋零、在 z→+∞z \to +\infty 时线性增长。它既提供了精确的零证据状态,又避免了指数爆炸,是实践中默认的选择。
  • exp⁡(z)\exp(z):严格正、光滑,但无上界,使 α0\alpha_0 可任意大,易造成数值溢出与损失对证据的不稳定响应。
  • ReLU⁡(z)\operatorname{ReLU}(z):计算廉价,但在 z<0z < 0 处梯度恒为零。处于该区域的单元输出证据 ek=0e_k = 0 且永远无法通过梯度逃离——αk\alpha_k 被锁在 11,形成死区。这使 ReLU 在证据函数中通常劣于 softplus。
  • ELU⁡(z)+1\operatorname{ELU}(z) + 1:具有负饱和下界 00,梯度在负半轴非零,是介于二者之间的折中。

3.5 预测概率与不确定性的解析形式

命题 3.4(EDL 的预测与不确定性) 在定义 3.3 的参数化下,记总强度 S=α0=∑k=1Kαk=K+∑k=1KekS = \alpha_0 = \sum_{k=1}^K \alpha_k = K + \sum_{k=1}^K e_k。则 pk=E[xk]=αkS,u=KSp_k = \mathbb{E}[x_k] = \frac{\alpha_k}{S}, \qquad u = \frac{K}{S}

证明 第一式即命题 2.1。第二式即命题 3.2。对 uu 的推导亦可独立地由聚合性(命题 2.8)得到:若把全部类别合并为一个事件,其迪利克雷参数为 α0\alpha_0,不确定性质量即为 K/α0K/\alpha_0。

在 uu 的定义下,预测概率具有一个在解释上极有用的分解:

pk=αk−1S⏟证据部分+1S⏟先验部分=(1−u) αk−1α0−K+u⋅1Kp_k = \underbrace{\frac{\alpha_k - 1}{S}}_{\text{证据部分}} + \underbrace{\frac{1}{S}}_{\text{先验部分}} = (1 - u)\,\frac{\alpha_k - 1}{\alpha_0 - K} + u \cdot \frac{1}{K}

即预测概率是「证据归一化的类比例」与「均匀分布」按 (1−u,u)(1-u, u) 的凸组合。当证据充分时(u→0u \to 0),预测趋于证据的方向。当证据消失时(u→1u \to 1),预测退回均匀分布。极限行为因此完全符合直觉:

S→K (e→0):u→1,  p→1K1S→∞:u→0,  p→e∑jejS \to K \ (\mathbf{e} \to \mathbf{0}): \quad u \to 1,\ \ \mathbf{p} \to \tfrac{1}{K}\mathbf{1} \qquad\qquad S \to \infty: \quad u \to 0,\ \ \mathbf{p} \to \frac{\mathbf{e}}{\sum_j e_j}

命题 3.4 同时也暴露了该参数化的一个结构性局限:uu 只是总强度 SS 的函数,与证据在各类别之间的分布无关。因此 EDL 的不确定性分数无法区分「少量证据集中于一类」与「大量证据均匀分散」,也无法区分「证据落在正确类别上」与「证据落在错误类别上」。这一局限将在 4.5 节与 5.6 节被重新讨论。

3.6 不确定性的分解:偶然与认知

命题 3.4 给出的 u=K/Su = K/S 是一个启发式的不确定性标量。与之相对,Malinin 与 Gales 在 Prior Networks 的工作中给出了一个有信息论根据的分解,它在迪利克雷族内具有闭式解。

设 π∼Dir⁡(α)\boldsymbol{\pi} \sim \operatorname{Dir}(\boldsymbol{\alpha}) 且 y∣π∼Cat⁡(π)y \mid \boldsymbol{\pi} \sim \operatorname{Cat}(\boldsymbol{\pi})。考虑三个量:

  1. 总不确定性(total uncertainty):预测分布的熵 H[P(y∣x)]H[\mathbb{P}(y \mid \mathbf{x})],其中 P(y=k∣x)=pk=αk/α0\mathbb{P}(y = k \mid \mathbf{x}) = p_k = \alpha_k/\alpha_0。
  2. 偶然不确定性(aleatoric uncertainty):给定 π\boldsymbol{\pi} 后仍存在的熵的期望 Eπ[H(π)]\mathbb{E}_{\boldsymbol{\pi}}[H(\boldsymbol{\pi})]。
  3. 认知不确定性(epistemic uncertainty):二者的差,即 yy 与 π\boldsymbol{\pi} 之间的互信息。

命题 3.5(Dirichlet 族内的不确定性分解) 记 pk=αk/α0p_k = \alpha_k/\alpha_0,S=α0S = \alpha_0。则 H[P(y∣x)]=−∑k=1Kpklog⁡pkH[\mathbb{P}(y \mid \mathbf{x})] = -\sum_{k=1}^K p_k \log p_kEπ[H(π)]=ψ(S+1)−∑k=1Kpk ψ(αk+1)\mathbb{E}_{\boldsymbol{\pi}}[H(\boldsymbol{\pi})] = \psi(S + 1) - \sum_{k=1}^K p_k \,\psi(\alpha_k + 1)I(y;π)=H[P(y∣x)]−Eπ[H(π)]=∑k=1Kpk(ψ(αk+1)−log⁡pk)−ψ(S+1)I(y; \boldsymbol{\pi}) = H[\mathbb{P}(y \mid \mathbf{x})] - \mathbb{E}_{\boldsymbol{\pi}}[H(\boldsymbol{\pi})] = \sum_{k=1}^K p_k\big(\psi(\alpha_k + 1) - \log p_k\big) - \psi(S + 1)

证明 关键在于 H(π)=−∑kπklog⁡πkH(\boldsymbol{\pi}) = -\sum_k \pi_k \log \pi_k,故 E[H(π)]=−∑kE[πklog⁡πk]\mathbb{E}[H(\boldsymbol{\pi})] = -\sum_k \mathbb{E}[\pi_k \log \pi_k]。由 1.4 节的边缘 Beta 性,πk∼Beta⁡(αk,S−αk)\pi_k \sim \operatorname{Beta}(\alpha_k, S - \alpha_k),而对该 Beta 分布有恒等式 E[Xlog⁡X]=aa+b(ψ(a+1)−ψ(a+b+1))\mathbb{E}[X \log X] = \frac{a}{a+b}\big(\psi(a+1) - \psi(a+b+1)\big)(此处 a=αka = \alpha_k,a+b=Sa + b = S)。代入 a/(a+b)=pka/(a+b) = p_k 即得第二式。互信息由 I=H[E π]−E[H(π)]I = H[\mathbb{E}\,\boldsymbol{\pi}] - \mathbb{E}[H(\boldsymbol{\pi})] 得到。

这一分解的意义在于:它把「数据本身的随机性」与「关于类别分布的认知不足」在数学上分离成了两个可分别计算的量。 认知项 I(y;π)I(y;\boldsymbol{\pi}) 在 S→∞S \to \infty(证据充分)时趋于零,在证据缺失时增大,与 u=K/Su = K/S 的定性行为一致。但它是通过 ψ\psi 函数的差构造的,捕捉了 uu 所忽略的证据分布信息,因而是比 uu 更精细的分数。

不过,这一分解的「认知」标签必须谨慎对待。它在形式上是「关于 π\boldsymbol{\pi} 的不确定性」,而 π\boldsymbol{\pi} 在 EDL 中是 gθ(x)g_{\boldsymbol{\theta}}(\mathbf{x}) 的输出,是网络参数的确定性函数。因此 I(y;π)I(y;\boldsymbol{\pi}) 度量的是类概率向量的不确定,而不是模型参数的不确定——后者才是贝叶斯认识论意义上的 epistemic uncertainty。二者的距离,正是 4.5 节全部批评的技术根源。

四、证据深度学习的损失函数

EDL 的训练目标不再是「使 p\mathbf{p} 逼近 one-hot 标签」,而是「使整族 Dir⁡(α)\operatorname{Dir}(\boldsymbol{\alpha}) 逼近一个理想的分布」。损失函数因此被组织为两项:一项拟合分类目标,一项约束不确定性的行为。

4.1 Type-II 极大似然与对数风险

最自然的构造是极小化对数损失在迪利克雷先验下的贝叶斯风险(亦称 Type-II 极大似然):

LNLL=Eπ∼Dir⁡(α)[−log⁡πy]\mathcal{L}^{\text{NLL}} = \mathbb{E}_{\boldsymbol{\pi} \sim \operatorname{Dir}(\boldsymbol{\alpha})}\big[-\log \pi_y\big]

命题 4.1(对数风险的闭式) 设真实标签为 yy,则 LNLL=ψ(S)−ψ(αy)\mathcal{L}^{\text{NLL}} = \psi(S) - \psi(\alpha_y)

证明 由 E[log⁡xk]=ψ(αk)−ψ(α0)\mathbb{E}[\log x_k] = \psi(\alpha_k) - \psi(\alpha_0)(命题 2.4 的证明中已给出),取 k=yk = y 并乘以 −1-1 即得。

该损失的梯度结构值得注意:

∂LNLL∂αy=ψ′(S)−ψ′(αy)≤0,∂LNLL∂αj=ψ′(S)>0(j≠y)\frac{\partial \mathcal{L}^{\text{NLL}}}{\partial \alpha_y} = \psi'(S) - \psi'(\alpha_y) \le 0, \qquad \frac{\partial \mathcal{L}^{\text{NLL}}}{\partial \alpha_j} = \psi'(S) > 0 \quad (j \ne y)

其中 ψ′\psi' 为 trigamma 函数(恒正、单调递减)。因此梯度沿两个方向作用:提升真实类别的证据(αy\alpha_y 增大),压低其余类别的证据(αj\alpha_j 减小)。第二条作用有一个退化倾向:若标签之外的证据可被任意压低而不受惩罚,网络便有动机把 αj\alpha_j 全部驱向 11,从而收缩总证据 SS——这正是 4.3 节引入正则项的直接原因。

推论 4.2(与插值交叉熵的关系) LNLL\mathcal{L}^{\text{NLL}} 是 one-hot 标签下插值交叉熵的 Jensen 上界: LNLL=−log⁡py+12(1αy−1S)+O ⁣(S−2) ≥ −log⁡py\mathcal{L}^{\text{NLL}} = -\log p_y + \frac{1}{2}\left(\frac{1}{\alpha_y} - \frac{1}{S}\right) + O\!\left(S^{-2}\right) \ \ge \ -\log p_y

证明 由 Jensen 不等式 E[log⁡πy]≤log⁡E[πy]=log⁡py\mathbb{E}[\log \pi_y] \le \log \mathbb{E}[\pi_y] = \log p_y,故 LNLL≥−log⁡py\mathcal{L}^{\text{NLL}} \ge -\log p_y。渐近展开由 ψ(a)=log⁡a−12a+O(a−2)\psi(a) = \log a - \frac{1}{2a} + O(a^{-2}) 给出,而 αy≤S\alpha_y \le S 保证修正项非负。

推论 4.2 揭示了一个在文献中常被忽略的事实:EDL 的对数损失并非多项—迪利克雷边缘似然的负对数,而是它加上一个显式的、随证据稀缺而增大的修正项。 该项在 SS 大时消失,在证据不足时提供额外压力,其作用与下一小节方差惩罚项在平方损失中的地位完全平行。

4.2 平方损失的贝叶斯风险

Sensoy 等人的原始工作采用了平方损失而非对数损失,其闭式更为直观。

命题 4.3(平方风险的闭式) 设 y\mathbf{y} 为 one-hot 标签,则 LMSE=Eπ[∥y−π∥2]=∑k=1K[(yk−pk)2+pk(1−pk)S+1]\mathcal{L}^{\text{MSE}} = \mathbb{E}_{\boldsymbol{\pi}}\left[\|\mathbf{y} - \boldsymbol{\pi}\|^2\right] = \sum_{k=1}^K \left[(y_k - p_k)^2 + \frac{p_k(1 - p_k)}{S + 1}\right]

证明 逐项展开:E[(yk−πk)2]=(yk−pk)2+Var⁡(πk)\mathbb{E}[(y_k - \pi_k)^2] = (y_k - p_k)^2 + \operatorname{Var}(\pi_k)。由命题 2.1,Var⁡(πk)=αk(S−αk)S2(S+1)=pk(1−pk)S+1\operatorname{Var}(\pi_k) = \frac{\alpha_k(S - \alpha_k)}{S^2(S+1)} = \frac{p_k(1-p_k)}{S+1}。求和即得。

该损失的两项具有不同的角色。第一项是拟合项:在 pkp_k 退化为确定性预测时,它退化为 one-hot 编码下的均方误差。第二项是方差惩罚项:它正比于每个分量的伯努利方差 pk(1−pk)p_k(1-p_k),反比于总证据 S+1S + 1。其作用是双重的:

  1. 当证据稀缺(SS 小)时,方差项较大,迫使模型不得以低方差的方式给出尖锐预测——这是一种自适应的软惩罚,其强度由数据本身决定,而非人为设定的超参数。
  2. 当证据变化时,SS 与 pkp_k 同时进入两项,形成张力:增大 SS 可以压低方差项,却会强化拟合项。因此最优解不会退化为「证据全为零」的平凡解。

4.3 证据正则化与退火 KL

仅有拟合损失仍不足以约束错误预测上的证据。原因在于 4.1 节的梯度分析:拟合项只对真实类别的证据给出直接的提升压力,而对错误类别上的证据,它只通过 ψ′(S)\psi'(S) 给出一个整体的压制信号,这一信号与证据在各类别间的分配无关。后果是:当一个样本被错误分类时,网络可以通过在错误类别上堆积证据来降低损失,而这恰恰是我们希望惩罚的行为。

正则项的构造基于一个「反事实」的迪利克雷参数:抹去真实类别的证据,保留其余。

定义 4.4(反事实参数与证据正则) 令 α~=y+(1−y)⊙α\tilde{\boldsymbol{\alpha}} = \mathbf{y} + (\mathbf{1} - \mathbf{y}) \odot \boldsymbol{\alpha},即把真实类别处的参数置为 11、其余保持不变。证据正则项定义为 Lreg=KL⁡[Dir⁡(α~) ∥ Dir⁡(1)]\mathcal{L}^{\text{reg}} = \operatorname{KL}\left[\operatorname{Dir}(\tilde{\boldsymbol{\alpha}}) \,\big\|\, \operatorname{Dir}(\mathbf{1})\right]

注意 Dir⁡(1)\operatorname{Dir}(\mathbf{1}) 正是无信息均匀先验。该 KL 散度只依赖于非目标类别上的证据:若网络在错误类别上给出大量证据,Dir⁡(α~)\operatorname{Dir}(\tilde{\boldsymbol{\alpha}}) 将显著偏离均匀分布,KL 随之增大。

命题 4.5(Dirichlet 的 KL 散度) 对 α,β∈R>0K\boldsymbol{\alpha}, \boldsymbol{\beta} \in \mathbb{R}_{>0}^K, KL⁡[Dir⁡(α) ∥ Dir⁡(β)]=log⁡B(β)B(α)+∑k=1K(αk−βk)(ψ(αk)−ψ(α0))\operatorname{KL}\left[\operatorname{Dir}(\boldsymbol{\alpha}) \,\big\|\, \operatorname{Dir}(\boldsymbol{\beta})\right] = \log\frac{B(\boldsymbol{\beta})}{B(\boldsymbol{\alpha})} + \sum_{k=1}^K (\alpha_k - \beta_k)\big(\psi(\alpha_k) - \psi(\alpha_0)\big) 特别地,取 β=1\boldsymbol{\beta} = \mathbf{1}(此时 B(1)=1/Γ(K)B(\mathbf{1}) = 1/\Gamma(K))得 Lreg=log⁡Γ(α~0)−∑k=1Klog⁡Γ(α~k)−log⁡Γ(K)+∑k=1K(α~k−1)(ψ(α~k)−ψ(α~0))\mathcal{L}^{\text{reg}} = \log\Gamma(\tilde{\alpha}_0) - \sum_{k=1}^K \log\Gamma(\tilde{\alpha}_k) - \log\Gamma(K) + \sum_{k=1}^K (\tilde{\alpha}_k - 1)\big(\psi(\tilde{\alpha}_k) - \psi(\tilde{\alpha}_0)\big)

证明 由指数族的一般 KL 公式:KL⁡=Eα[log⁡pα−log⁡pβ]\operatorname{KL} = \mathbb{E}_{\boldsymbol{\alpha}}[\log p_{\boldsymbol{\alpha}} - \log p_{\boldsymbol{\beta}}]。代入 1.2 节的密度并利用 Eα[log⁡xk]=ψ(αk)−ψ(α0)\mathbb{E}_{\boldsymbol{\alpha}}[\log x_k] = \psi(\alpha_k) - \psi(\alpha_0) 与 ∑kE[log⁡xk]=ψ(α0)−Kψ(α0)=−(K−1)ψ(α0)\sum_k \mathbb{E}[\log x_k] = \psi(\alpha_0) - K\psi(\alpha_0) = -(K-1)\psi(\alpha_0) 即可化简。

总损失为两项的加权和,其中权重按训练步退火:

L=Lfit+λt Lreg,λt=min⁡ ⁣(1,tTanneal)\mathcal{L} = \mathcal{L}^{\text{fit}} + \lambda_t \,\mathcal{L}^{\text{reg}}, \qquad \lambda_t = \min\!\left(1, \frac{t}{T_{\text{anneal}}}\right)

退火的设计意图是分工时段的划分:训练初期 λt≈0\lambda_t \approx 0,网络可以自由地按拟合损失调整证据的量级,避免在证据尚未成形时被正则项过早地压向零。训练后期 λt→1\lambda_t \to 1,正则项接管,迫使模型对错误预测给出高不确定性。消融实验一致表明,缺少退火(即使用常数 λ\lambda)会显著损害性能——这与该设计的解释相符,而非仅仅是超参数调优的产物。

4.4 统一视角与变体

上述两项可以统一在一个更一般的框架下。所有基于 EDL 的拟合损失都具有形式

Lfit=Eπ∼Dir⁡(α)[ℓ(y,π)]\mathcal{L}^{\text{fit}} = \mathbb{E}_{\boldsymbol{\pi} \sim \operatorname{Dir}(\boldsymbol{\alpha})}\left[\ell(\mathbf{y}, \boldsymbol{\pi})\right]

即对某个一阶损失 ℓ\ell 的先验期望。取 ℓ=−log⁡πy\ell = -\log \pi_y 得命题 4.1 的 digamma 形式。取 ℓ=∥y−π∥2\ell = \|\mathbf{y} - \boldsymbol{\pi}\|^2 得命题 4.3 的平方形式。这一视角把「EDL 的损失设计」转化为「选择哪个一阶损失并在迪利克雷族上求其贝叶斯风险」的标准问题,从而使新损失的设计有章可循。

在此基础上,文献中出现的主要变体可归入三类:

  1. 正则方式不同。除 4.3 节的 KL 正则外,也有工作直接以「认知不确定性应随证据增加而衰减」作为约束,或对证据施加 L2L_2 惩罚。其共同目标都是阻止 SS 的退化。
  2. 监督方式不同。Prior Networks 不在期望风险上训练,而是显式地构造一个目标迪利克雷分布(例如:分布内样本用尖锐的 Dirichlet 匹配、分布外样本用平坦的 Dirichlet 匹配),并在分布层面直接计算 KL。这需要分布外样本来定义目标,因此换取的是更强的不确定性控制与更弱的即插即用性。
  3. 回归情形的推广。把分类的迪利克雷替换为 Normal-Inverse-Gamma 先验,即得 Deep Evidential Regression(5.5 节)。

统一框架也澄清了一个理论定位问题:EDL 与贝叶斯神经网络(BNN)、深度集成(deep ensembles)、MC Dropout 属于不同的不确定性来源。后三者通过对网络参数(或其近似后验)的分布求积分得到预测分布。EDL 则在固定的参数点估计上,对输出层的二阶分布求积分。二者的区分不是工程实现上的,而是概率模型结构上的,这正是下一小节批评的出发点。

4.5 使用边界

EDL 在实践中表现良好,但其理论地位常被过度解读。把边界集中列出,与前文的正式推导互为对照:

  1. 它不是贝叶斯不确定性。 严格的后验预测分布应由对网络参数的边缘化给出: p(y∣x,D)=∬p(y∣π) p(π∣θ) p(θ∣D) dπ dθp(y \mid \mathbf{x}, \mathcal{D}) = \iint p(y \mid \boldsymbol{\pi})\,p(\boldsymbol{\pi} \mid \boldsymbol{\theta})\,p(\boldsymbol{\theta} \mid \mathcal{D})\,\mathrm{d}\boldsymbol{\pi}\,\mathrm{d}\boldsymbol{\theta} 而 EDL 以点估计 θ^\hat{\boldsymbol{\theta}} 替换外层积分,取 p(π∣x)=Dir⁡(π;α(x;θ^))p(\boldsymbol{\pi} \mid \mathbf{x}) = \operatorname{Dir}\big(\boldsymbol{\pi}; \boldsymbol{\alpha}(\mathbf{x}; \hat{\boldsymbol{\theta}})\big)。结果是一个插值(plug-in)估计,其内层积分给出 pk=αk/α0p_k = \alpha_k/\alpha_0(由聚合性),确实正确。但外层积分被抛弃,uu 与 I(y;π)I(y;\boldsymbol{\pi}) 所度量的是「对输出分布的把握」,而非「对模型的把握」。二者在分布外输入上可以严重分歧:一个被错误训练的网络可以以极低的 uu 输出一个错误的类别。
  2. 不确定性分数丢弃了证据的分布信息。 如 3.5 节所述,u=K/Su = K/S 仅是总证据的函数。它无法表达「证据分散但充分」与「证据集中但贫乏」的区别,也无法区分证据落在何类。I(y;π)I(y;\boldsymbol{\pi}) 缓解了这一点,但仍不引入任何关于模型参数的信息。
  3. 拟合损失带有一个与强度耦合的偏置。 推论 4.2 表明,对数形式等价于交叉熵加上 (12αy−12S)(\frac{1}{2\alpha_y} - \frac{1}{2S}) 的修正。因此损失的最小值并不位于「插值交叉熵的最优解」,而是位于一个把证据量级也纳入权衡的点上。这不是缺陷本身,但它意味着EDL 的优化目标与「拟合条件分布」并非同一个目标,将其损失解释为似然的做法在术语上应作区分。
  4. 「以损失最小化实现不确定性量化」这一范式受到根本性质疑。 有研究指出,当认知不确定性被定义为某个二阶损失(即关于 Dir⁡(α)\operatorname{Dir}(\boldsymbol{\alpha}) 的泛函)的极小化者时,损失可以在与真实认知状态无关的第二阶分布上取得同一最小值,从而该极小化者一般并不落在具有正确认知解释的分布上。换言之,「损失小」并不蕴含「认知不确定性估计正确」。这一批评与本条前三点在方向上是独立的:即便接受 EDL 的目标函数,其最优解也未必具有所宣称的语义。
  5. 它对主干特征的可分性有隐含依赖。 证据由 e=gθ(x)\mathbf{e} = g_{\boldsymbol{\theta}}(\mathbf{x}) 给出,因此 x\mathbf{x} 落在分布外时能否给出低证据,完全取决于特征提取器是否把该区域映射到低响应区。若主干网络对分布外输入仍产生高幅 logits,EDL 的不确定性同样失效——它把 OOD 问题从输出层转移到了特征层,而非解决它。

综合以上点,恰当的使用立场是:把 EDL 视为一种参数高效、结构可解释的不确定性启发式,而非贝叶斯推理的替代品。 它在「单次前向代价下同时输出预测与不确定性」这一约束下的性价比是突出的。但凡是论断依赖于「该不确定性具有贝叶斯后验语义」的场合,都应改回到对参数做边缘化的方法,或至少给出与后者的对照实验。

五、应用

5.1 分布外检测与开放集识别

由命题 3.4,u=K/Su = K/S 是一个单调反比于总证据的量,因此可以直接充当分布外(OOD)分数:uu 高意味着输入未能激活任何类别的证据。以阈值 τ\tau 作拒识判决

y^(x)={arg⁡max⁡kpk,u(x)≤τreject,u(x)>τ\hat{y}(\mathbf{x}) = \begin{cases} \arg\max_k p_k, & u(\mathbf{x}) \le \tau \\ \text{reject}, & u(\mathbf{x}) > \tau \end{cases}

即得开放集分类器。与之竞争的分数包括最大 softmax 概率(MSP)、预测熵、ODIN 的温度与输入扰动、Mahalanobis 距离,以及能量分数 LSE⁡(z)=log⁡∑kezk\operatorname{LSE}(\mathbf{z}) = \log\sum_k e^{z_k}。将它们在性质上加以对照:

分数依赖的结构是否需要 OOD 数据不确定性语汇
MSP / 熵softmax 输出否无(受 3.3 节缺陷支配)
Mahalanobis各特征层的类条件高斯否距离,几何语义
能量分数logits 的对数配分否无显式不确定性
EDL 的 uu迪利克雷总强度 SS否证据缺失量,可解释

EDL 在此项比较中的结构性优势在于两点。第一,它的不确定性是训练目标的一部分(由 4.3 节的正则项直接优化),而非对训练好的网络做事后加工的产物。第二,它给出的是类概率向量的分布,因此可以在不接触任何 OOD 样本的前提下产生 OOD 分数——这是先验网络之外少有的性质(先验网络需要 OOD 样本以构造目标分布)。

限度同样明确:如 4.5 节第 5 点所述,其成败取决于特征空间的可分性。评价应使用 AUROC、AUPR(In/Out 与 Out/In 分别报告)、FPR@95TPR 以及开放集风险—覆盖曲线,而非仅报单一的准确率。

5.2 校准与选择性预测

校准关心的是 P(y^=y∣p^=q)=q\mathbb{P}(\hat{y} = y \mid \hat{p} = q) = q 是否成立,常用期望校准误差

ECE=∑m=1M∣Bm∣n ∣acc⁡(Bm)−conf⁡(Bm)∣\text{ECE} = \sum_{m=1}^{M} \frac{|\mathcal{B}_m|}{n}\,\Big|\operatorname{acc}(\mathcal{B}_m) - \operatorname{conf}(\mathcal{B}_m)\Big|

度量,其中 Bm\mathcal{B}_m 是置信度分箱。EDL 的训练目标隐含地抑制了 3.3 节所述的 logits 发散退化,因此在若干基准上比 MSP 更校准。但这不是免费的:如 4.5 节第 7 点,EDL 的一阶校准同样需要验证,不应默认成立。

选择性预测(selective prediction) 是 uu 的更自然的落点。经典 Chow 规则指出,在已知真实后验 p(y∣x)p(y \mid \mathbf{x}) 时,最优拒识策略是「当最大后验概率低于某阈值时拒识」,其最优性依赖于 pp 本身的正确性。EDL 提供了一条与之互补的路径:直接使用二阶量 uu 或 I(y;π)I(y;\boldsymbol{\pi}) 作为拒识分数,从而绕开对一阶校准的依赖。其代价是引入了一个新的、校准状况未知的量。实践中应同时考察两条路径并报告风险—覆盖曲线下的面积(AURC)。

5.3 主动学习与半监督学习

主动学习。 采集函数可以直接取 u(x)u(\mathbf{x}) 或 I(y;π)(x)I(y;\boldsymbol{\pi})(\mathbf{x}):前者是「总证据最少」,后者是「关于类概率的知识增益最大」。选择 II 而非 uu 的好处在于它同时考虑证据的量与分布,等价于 BALD 在迪利克雷族内的闭式对应物。EDL 在此场景的最大优势是代价:一次前向即可得到采集分数,无需 MC 采样、无需多次前向、无需集成子模型。其风险同样直接来自 4.5 节第 1 点:若 uu 因特征层的原因而系统性高估某些区域,主动学习会持续采样这些区域,形成采样偏差。缓解办法是在采集函数中叠加批内多样性项。

半监督与伪标签。 伪标签流程中,uu 提供了比「最大概率」更细的过滤准则:取 u<τu < \tau 的样本赋予伪标签,可以同时排除「概率高但实为分布外」的样本——这正是 MSP 过滤所无法处理的失败模式。反之,当 τ\tau 过紧时,模型会倾向于只在自己已经熟悉的区域采样伪标签,导致训练集分布收缩、对稀有模式进一步失明。该权衡与 5.6 节讨论的长尾问题同源。

5.4 安全关键场景

在医学影像、自动驾驶与工业质检等场景中,「放弃预测并移交人类」是一个具有明确成本结构的决策,而非纯粹的统计操作。EDL 在这里的价值不是给出更准的标签,而是提供一个可嵌入决策规则的二阶量:

  • 分割与体素级不确定性:对每个体素输出 Dir⁡(α)\operatorname{Dir}(\boldsymbol{\alpha}),得到逐像素的 uu,可据此生成「需人工复核区域」的掩码。
  • 转诊(referral)机制:将 u>τu > \tau 的样本路由至专家,使自动化系统在其能力边界处显式地退出。
  • 开放集动作识别:视频中存在未见动作时,uu 提供拒绝信号。
  • 分子性质预测与虚拟筛选:在化学空间中标识训练分布之外的候选物,避免对高不确定性的预测投入昂贵的实验验证。

这些应用的共同点是:错误的代价不对称,且「不预测」是允许的动作。 这也划定了 EDL 不适用的场合——当系统必须对所有输入给出一个标签、且拒识没有对应的动作时,uu 至多是一个监控指标。

5.5 回归情形的推广

分类的目标是单纯形上的向量,回归的目标是实数。相应地把迪利克雷替换为正态—逆 Gamma(Normal-Inverse-Gamma, NIG)先验:

μ∼N ⁣(γ,σ2υ),σ2∼Γ−1(α,β)\mu \sim \mathcal{N}\!\left(\gamma, \frac{\sigma^2}{\upsilon}\right), \qquad \sigma^2 \sim \Gamma^{-1}(\alpha, \beta)

网络对每个输入输出四元组 (γ,υ,α,β)(\gamma, \upsilon, \alpha, \beta),边缘预测为自由度 2α2\alpha 的 Student-tt 分布。其预测方差可精确分解为偶然部分 β/(α−1)\beta/(\alpha - 1) 与认知部分 β/[υ(α−1)]\beta/[\upsilon(\alpha - 1)],二者之和 β(υ+1)/[υ(α−1)]\beta(\upsilon + 1)/[\upsilon(\alpha - 1)] 即自由度 2α2\alpha 的 Student-tt 分布的方差,形式上与命题 3.5 的分解对应。该推广在分子性质预测、三维重建与不确定性感知的姿态估计中均有应用。

需要指出的是,这一推广的理论状况比分类情形更受争议:有后续研究指出,此类模型所报告的「认知」分量并不随训练数据的增加而按预期衰减,其与偶然分量的分离缺乏理论保证。因此 4.5 节的谨慎立场在回归情形下应进一步加强。

5.6 与原型学习、超球面几何的融合

最后讨论一个尚未定型、但在方法上自然的方向:把 EDL 与基于原型的超球面表示学习结合。设主干网络输出归一化特征 fθ(x)∈Sd−1\mathbf{f}_{\boldsymbol{\theta}}(\mathbf{x}) \in \mathbb{S}^{d-1},各类原型为 {vk}⊂Sd−1\{\mathbf{v}_k\} \subset \mathbb{S}^{d-1},相似度 sk=⟨f,vk⟩s_k = \langle \mathbf{f}, \mathbf{v}_k \rangle。传统原型方法以 zk=κsk\mathbf{z}_k = \kappa s_k 作为 logits 并配 softmax 交叉熵,由 3.3 节,这仍受平移不变性与 logits 发散两项缺陷的支配。

一个直接的融合方案是把相似度送入证据函数:

ek=g(κ sk),αk=1+g(κ sk),S=K+∑k=1Kg(κ sk)e_k = g(\kappa\, s_k), \qquad \alpha_k = 1 + g(\kappa\, s_k), \qquad S = K + \sum_{k=1}^K g(\kappa\, s_k)

其中 gg 取 3.4 节的非负激活,κ\kappa 沿用 vMF 分布的集中参数语义。该构造把几何与不确定性直接挂钩:特征落在某原型附近时,sks_k 接近 11、证据充分、uu 小。特征落在所有原型之外(其与全部原型的相似度均低或为负)时,各 eke_k 同时趋零、u→1u \to 1。「离原型远」与「证据不足」在此被同一个机制表达。

但这一构造的成立范围必须严格界定。迪利克雷分布定义在类概率单纯形上,原型方法定义在球面特征空间上,二者的「不确定性」不是同一个对象:前者是关于类概率向量的二阶分布,后者是关于特征位置的一阶几何量。x↦α(x)\mathbf{x} \mapsto \boldsymbol{\alpha}(\mathbf{x}) 仍然是一个点估计的映射,因此 4.5 节第 1 点的批评在此完全适用——uu 度量的是「特征到原型的距离」,而不是「模型对该映射的把握」。要真正结合二者,需要构造(特征空间,类概率空间)的联合模型,例如令 α\boldsymbol{\alpha} 自身携带分布(层级模型),或以 vMF 构造特征的生成式模型、以迪利克雷构造其上的分类头,使两个不确定性来源可以在同一层级结构中分别标识。

即便在当前的简化形式下,该方向仍有两个值得推进的具体问题:

  1. 长尾与稀有类。 稀有类的原型天然缺乏证据支撑,uu 更高。这既可以被用作保护机制(在损失中对高 uu 样本降低梯度权重),也可能加剧对稀有类的欠拟合(模型学会用「不确定」来逃避稀有类)。二者孰占主导是一个可以实验判定的问题。
  2. 与开集/分布外任务的重叠。 在代码漏洞检测这类任务中,异常样本(漏洞)与正常样本在特征空间中高度重叠,其本质是开集问题而非单纯的类别不平衡。uu 或 I(y;π)I(y;\boldsymbol{\pi}) 可用作告警与拒识的分数,但必须与 4.5 节第 5 点的前提一并验证:只有当特征提取器确实把漏洞样本映射到低证据区时,这一机制才成立,而这正是需要独立验证的假设。

结语

回顾全文,迪利克雷分布在本文中依次扮演了三个层次的角色:

  • 作为单纯形上的分布,它是「关于概率的概率」这一二阶对象的标准载体,其参数由方向 μ\boldsymbol{\mu} 与精度 α0\alpha_0 两个正交分量构成(命题 2.2)。
  • 作为多项分布的共轭先验,它把贝叶斯更新化简为一次向量加法(命题 2.5),并在聚合性、中立性与 stick-breaking 构造下形成一个结构完整、边界清晰的分布族(命题 2.8、2.9)。
  • 作为神经网络的输出层,经由与主观逻辑的严格双射(命题 3.2),它把分类器的输出从「单纯形上的点」提升为「单纯形上的分布」,从而首次让「我不知道」成为一个可表示、可优化的对象。

证据深度学习的核心洞见可以压缩为一句话:softmax 的平移不变性丢弃了 logits 的绝对水平,因而无法表示无信息状态。证据函数不是平移不变的,它把这一被丢弃的自由度重新赋值为「证据的量级」。 命题 3.4 中 u=K/Su = K/S 的全部行为——证据充分时趋于确定、证据消失时退回均匀——都是这一重新赋值的直接后果。

配合 4.3 节的退火 KL 正则,模型不仅被要求「预测得对」,还被要求「在预测错时承认自己不确定」。

但本文同样花了相当篇幅界定这一范式的边界。EDL 的不确定性是启发式的,不是贝叶斯后验不确定性:它以点估计替换了对网络参数的边缘化,因而度量的是对输出分布的把握而非对模型的把握(4.5 节第 1 点)。uu 丢弃了证据在类别间的分布信息(第 2 点)。其拟合损失带有与证据量级耦合的偏置,不等同于边缘似然(第 3 点)。并且「以损失最小化实现不确定性量化」这一范式本身受到根本性质疑(第 4 点)。这些限制并不取消该方法的实用价值——在单次前向的代价约束下同时给出预测与不确定性,其性价比是突出的——但它们决定了正确的使用姿态:在需要二阶量的场合使用它,在需要后验语义的场合验证它,并在两者都不确定时,回到对参数做边缘化的方法上去。

最后应当记住的是,不确定性量化的可靠程度,与因果推断一样,等于你愿意且能够承担的假设的强度。迪利克雷分布给出的是一个精确而优美的数学结构。把一个精确的结构接到一个近似的映射(神经网络)上,得到的精确性只属于前者。识别出哪一部分是定理、哪一部分是启发式,是使用这套工具时最有价值的一步。