条件化
根据当前表示生成后验分布的参数。
我们的核心命题
现代语言模型能力卓越,但其内部计算单元在很大程度上仍是确定性的。JWAYU 从另一个前提出发:既然歧义与不确定性是智能的内在组成部分,计算单元本身就应能够表示它们。
EVE — Elemental Variational Expanse
它是一种局部概率计算单元,显式包含先验、摊销后验和单元级变分正则化。激活不再只是一个数值,而是由学习到的分布产生。
根据当前表示生成后验分布的参数。
表示一组连续且合理的潜在状态。
通过重参数化生成可微的潜在样本,并用于前向传播。
相对于先验约束后验,使内部运行状态可测量、可控制。
开放研究
从变分神经元到 Transformer,再到基于内部不确定性的控制机制。
文章区分概率神经计算的四个维度,给出单元级变分神经元的明确规范准则,并通过受控 EVE 实验加以验证,其中包括新的 50-seed、2,472 参数精确容量匹配比较。
阅读 →神经网络通常传播点值隐藏激活。本文研究一种更细的计算粒度:让神经元本身成为以分布为状态的计算单元。EVE 为每个单元引入输入条件后验、局部先验、重参数化采样、神经元级 KL 正则化和内部诊断。实验首先隔离单个单元的计算行为,再研究其在深层 MLP 中的组合以及在 Transformer 前馈模块中的集成。结果表明,EVE 在保持相近点预测精度的同时改善了多项概率指标。
阅读 →本文提出一种架构观点:神经元可以被视为一个分布,而不只是一个点值激活。文章将变分神经元描述为局部计算单元,其后验状态、不确定性和采样得到的潜在活动直接参与前向计算。它进一步区分了这种局部概率计算与仅存在于权重、集成模型、输出或全局潜变量中的不确定性,并说明 EVE 首先改变的是计算单元的粒度,而不是简单等同于贝叶斯神经网络。
阅读 →本文把神经元视为局部潜在状态,并将后验学习与后验读出分开研究。EVE 训练完成后,学习到的后验保持冻结,只改变从同一潜在状态生成预测的读出规则。该实验用于检验局部后验是否在均值之外仍包含可利用的预测信息。在受控的多模态预测任务中,结构化读出无需重新训练后验即可改善概率指标。
阅读 →这篇方法论文提出一种内部概率活动可测量、可控制的局部变分神经元。每个单元包含标量潜变量、标准正态先验、摊销高斯后验、重参数化样本和局部 KL 正则项。方法跟踪局部 KL、后验均值平方、超出活动区间的单元比例以及可选的自回归持续性,并将这些内部诊断与预测误差联系起来。
阅读 →本文提出一种变分分布神经元:将计算单元构造成局部概率基元,并显式携带先验、摊销后验、重参数化样本和局部 ELBO。
阅读 →本文系统研究 EVE 的设计空间,分析潜在维度、局部容量控制和时间持续性如何影响神经元内部可测量的运行状态。
阅读 →本文将 EVE 单元集成到 Transformer 的前馈计算中,同时保留整体主干结构,并从预测质量、校准和内部不确定性信号等方面进行评估。
阅读 →本文研究如何将内部不确定性从被动诊断指标转化为可操作信号,用于调节训练、保留检查点并指导推理阶段的干预。
阅读 →EVE 将部分隐藏激活表示为由输入条件化的后验分布,使模型内部的不确定性能够被观测,并用于可靠性监测和不确定性感知计算。
阅读 →EVE 使语言模型计算过程中的单元级后验活动能够被直接测量。研究将其预测质量、校准表现和尾部风险与确定性模型、MC Dropout 和集成模型进行比较。
阅读 →本文提出一组局部后验活动指标,包括 KL 散度、后验尺度、均值能量和活跃单元比例,并研究这些内部统计量与预测行为、校准和稳健性之间的关系。
阅读 →这项采用五组匹配随机初始化的受控研究评估 EVE,考察其能否在小规模环境中产生并测量内部概率活动,同时分析似然、准确率、校准、尾部风险和后验诊断。
阅读 →