📖 machine-learning 的博文
因果结构模型简论
为什么概率论不足以回答因果问题?本文以 Judea Pearl 的因果推断阶梯为线索,依次展开因果图、结构因果模型与结构方程这三层层层递进的形式化工具,进而讨论因果发现、中介分析、do-演算与前门准则,并对照潜在结果框架与传统结构方程模型,梳理这一体系成立所依赖的假设与适用边界。
高维非凸优化的「鞍点主导」
高维空间中的局部极小值极为罕见——因为一个真正的局部极小值要求所有方向都向上弯曲,也就是 Hessian 矩阵的所有特征值都必须为正。而高维空间里,随机的临界点几乎总有某个方向可以向下走,也就是鞍点。这正是为什么神经网络训练更像是「逃离鞍点」的游戏,而不是「跳出局部最优」的游戏。
研究关系的三种视角
研究「关系」有三种互补视角:几何,拓扑和因果。分别关注测量、连通和约束。它们不是并列的学科,而是看待「存在」的三个层层递进的维度。三者共同构成智能系统理解世界的先验地基。
大语言模型中的表征流形
将 LLM 的表征流形形式化:以度量空间定义特征,证明余弦相似度编码了特征之间的测地距离,并在颜色、日期与年份三类数据上实证验证了同胚性与等距性。
涌现是幻象吗?
Schaeffer 等人表明,LLM 的「涌现能力」往往只是不连续的指标掩盖了平滑的能力增长。但 grokking、归纳头以及居里点式的转变都证明,真实的相变确实存在。