多头注意力中 Token 选择的几何分析
Geometric Analysis of Token Selection in Multi-Head Attention
基于摘要分析。本文研究 LLM 多头注意力中的 token 选择,提出仅保留注意力最高的 top-N token 的机制,并在 value-state 空间分析被选与未被选 token 的几何可分性。主要贡献是为 token 选择建立可测量的几何指标与理论边界,解释注意力头分工、序列长度和 sink token 对选择行为的影响。 技术机制:作者引入几何意义上的 Precision、Recall 和 F-score,以衡量两类 token 的可分性;这些名称不应直接理解为下游任务分类指标。理论推导依赖具有经验动机的范数稳定性、相似度衰减及多阶段注意力分布假设,给出与维度和间隔有关的边界。摘要未提供指标公式、top-N 的设置方式或边界的具体形式,尚不能判断假设的适用范围。 作者报告,在 LLaMA-2-7B、Gemma-7B 和 Mistral-7B 上的评估支持其理论预测:top-N 选择增强 token 可分性,sink token 与 Recall 系统性相关,不同注意力头呈现局部与全局分工。摘要未给出评估数据、序列长度、对照设置或具体数值;实验协议、消融及统计信息尚未验证。这些结果支持作者关于注意力具有结构化几何分类行为的解释,但不能据此推断下游任务性能或计算效率提升。 平台推测(待验证):若 EEG 模型将时间片段或通道表示为 token,并采用多头注意力,该框架可能用于检验稀疏选择是否保留判别信息。可复用的是几何指标与头级分析思路;需改造的是 token 定义、选择规模和对几何假设的验证。低信噪比、跨被试差异、通道变化及小数据条件可能使高注意力 token 对应伪迹而非有效神经信息。一个可证伪的小实验是在固定跨被试划分和同一 EEG 注意力模型下,对照完整注意力与不同 top-N 设置,同时检验几何可分性和原任务指标是否一致变化。已有 EEG 相关工作尚未检索确认。
值得阅读其将 top-N token 选择与 value-state 空间可分性联系起来的理论框架,但几何指标的具体定义、边界假设及其对 EEG 稀疏注意力的适用性尚未验证。
来源:OpenReview · State space models · openreview.net