跳到正文
OpenReview · State space models·· 22 天前精选AI 评分77

隐藏表示作为状态:语言模型计算中隐藏状态几何的离散化

Hidden States as States: Discretizing Hidden-State Geometry in Language Model Computation

AI 导读

基于摘要分析。研究针对 LLM 使用离散 token、内部计算却位于连续高维表示空间的问题,提出无需训练、无需标签的 Hidden States as States(HSS),将隐藏表示按选定粒度离散化为跨层几何状态词表,以分析计算路径并预测失败。 核心机制是在每层内聚类隐藏表示,再对齐相邻层的聚类中心,将一次前向传播转换为按层索引的离散状态序列。“无需标签”指状态构建过程;摘要另提到按行为标签进行条件分析,不能据此认定所有评估环节均不使用标签。聚类算法、粒度选择、对齐准则及表示采样方式尚未验证。 作者报告,所得状态映射对聚类扰动具有稳定性,状态结构在中间层扩张、在后期层收缩,且模式随模型变化。按行为标签分析时,失败对应的状态占用呈现不同模式,并趋于集中到少数从早期层出现的持久汇聚状态(sink states)。在摘要所述的能力与安全基准上,作者报告,基于离散状态序列的简单计数预测器优于闭式连续基线,与经训练的连续探针表现相当,并可在生成过程中提供在线失败预警;具体模型、基准、指标、数据划分及预警提前量尚未验证,不能据此判断提升幅度或泛化范围。 作者还报告,通过重构与激活编辑发现,粗粒度状态仍保留对下游计算有功能意义的结构。这为检验状态是否超越描述性聚类提供了证据方向,但干预设置、效果及统计信息尚未验证。 平台推测(待验证):若 EEG 解码模型的多层隐藏表示也形成可重复的状态路径,HSS 的层内聚类、跨层对齐和计数预测模块可能用于诊断解码失败,而非直接替代 EEG 解码算法。需适配 EEG 的时间维度,并检验低信噪比、通道变化、跨被试差异和小数据是否使聚类主要反映噪声或个体身份。一个可证伪的小实验是在固定 EEG 解码器上,仅用训练集隐藏表示构建状态词表,在独立测试集比较计数预测器与连续探针对解码错误的预测能力。已有 EEG 相关工作尚未检索确认。

阅读价值

HSS 将 LLM 隐藏表示转为跨层离散状态序列,为分析失败状态及构建低成本预警提供了可核对的机制路径,但预测对照、状态稳定性及干预效果仍需全文验证。

来源:OpenReview · State space models · openreview.net