神经网络计算中的概率状态空间枚举
Probabilistic State Space Enumeration in Neural Network Computation
基于摘要分析。本文研究 Transformer MLP 的稠密计算能否精确表示为组合状态空间上的期望,并通过只计算高概率配置获得可控近似;主要贡献是概率状态空间框架及按概率递减枚举完整联合状态的 NORDER-II,而非 EEG/BCI 解码方法。 机制上,框架将 MLP 中间维度划分为通道组,定义依赖输入的二元纳入状态分布,并对掩码输出进行重要性校正,使完整期望精确恢复稠密 MLP 输出。NORDER-II 无需构建或排序指数规模的完整状态空间,即可枚举概率最高的联合配置;截断枚举形成由累计概率质量与状态预算控制的可随时终止近似。与按单个组件显著性筛选的方法相比,其核心区别是利用完整联合状态结构。具体分布、校正公式、通道分组规则及误差保证尚未验证。 作者报告,在 Llama-3.2-1B 和 Gemma-2-2B 上,状态预算 B=2048 时,NORDER-II 的 MLP 输出近似准确度分别为 92.4% 和 93.8%,Channel Top-k 分别为 76.9% 和 79.8%;该指标不是分类 Accuracy,具体定义尚需全文核对。联合近似首个、中间和最后一个 MLP 层时,作者报告 WikiText-2 困惑度相对稠密推理的偏差分别在 0.06% 和 0.54% 以内。相较按期望数量匹配的 Grouped Top-k,作者报告近似准确度相对增益为 82.6–126.4%,额外局部解析 FLOPs 为 0.18–0.19%;这不等同于实测延迟、总 FLOPs 或能耗改善。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG Transformer 的 MLP 通道组分布具有足够的概率集中性,该机制可能用于自适应控制推理计算量;可复用部分是联合状态枚举与重要性校正,需改造和核对的是通道分组、输入相关分布及预算选择。低信噪比、跨被试或跨通道分布变化可能削弱概率集中性,使较小预算产生较大近似误差;小数据下分布估计也可能不稳定。可检验的小实验是在固定 EEG Transformer 与被试划分下,仅替换其 MLP 推理,比较不同预算下的输出误差、任务指标和实测延迟,并与稠密推理及匹配计算预算的 Top-k 对照。该迁移假设不构成已验证的 BCI 效果,已有 EEG 相关工作尚未检索确认。
值得核对其稠密 MLP 输出的期望等价性与 NORDER-II 联合状态枚举机制,但摘要中的局部计算开销和输出近似指标尚不能证明端到端加速或 EEG/BCI 适用性。
来源:OpenReview · State space models · openreview.net