跳到正文
OpenReview · State space models·· 2026-05-26精选AI 评分76

理解状态空间模型从代码中学到了什么

Towards Understanding What State Space Models Learn About Code

AI 导读

基于摘要分析。本文研究 State Space Models(SSMs)代码模型在预训练与任务微调中学习了哪些语法、语义结构,并与 Transformer 进行直接比较。主要贡献是提出频域解释框架 SSM-Interpret,用于分析微调中的依赖变化,并据此指导架构修改。 作者报告,SSMs 在预训练期间比 Transformer 更有效地捕获代码的语法和语义结构,但在部分任务的微调过程中会遗忘某些关系。SSM-Interpret 揭示了微调期间向短程依赖偏移的“spectral shift”。摘要未说明频域分析的具体对象、关系探测方法、架构修改内容或训练目标,因此尚不能判断这种频谱变化如何量化,以及它与关系遗忘之间是否具有因果联系。 作者报告,经架构修改的 SSM 代码模型在 NLCodeSearch 上最多提升“+6 MRR”。摘要未给出 MRR 的数值尺度、具体对照模型、数据划分和训练配置,不宜将该表述换算为百分比或百分点,也不能据此判断跨协议优势。实验协议、消融及统计信息尚未验证;复现需进一步核对模型与训练条件是否可比、微调任务如何选择,以及解释框架与性能改进之间的验证路径。 平台推测(待验证):可迁移的候选是对序列模型依赖范围变化的诊断思路,而非代码语法、语义结论。假设 EEG 的 SSM 微调也会损失任务相关的长程依赖,可尝试改造该分析框架;但模型依赖的频域表示不能直接等同于 EEG 生理频段,低信噪比、通道混合、跨被试差异和小数据均可能干扰解释。一个可证伪的小实验是在固定 EEG 划分和训练预算下,对比微调前后的依赖诊断与受控时间跨度扰动结果,检验是否出现一致的短程偏移;不预设其必然提高解码性能。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读的是 SSM-Interpret 将代码模型微调中的依赖范围变化与架构改进联系起来;其频域解释及性能增益仍需结合全文协议核对,不能直接视为 EEG/BCI 有效性的证据。

来源:OpenReview · State space models · openreview.net