面向高效流式序列处理的 Loihi 2 对角状态空间模型
A Diagonal State Space Model on Loihi 2 for Efficient Streaming Sequence Processing
基于摘要分析。该研究针对状态空间模型(SSM)逐 token 递归推理在 GPU 上难以高效执行的问题,将 S4D 部署到 Intel Loihi 2 神经形态处理器,探索实时流式序列处理的硬件效率,而非提出或验证 EEG/BCI 方法。 机制与对照:SSM 的递归结构在训练时可通过卷积或并行扫描实现,但在线逐 token 处理需要持续更新状态。本文在 Loihi 2 上实现 S4D,并在 sMNIST、psMNIST 和 sCIFAR 上与 Jetson Orin Nano 的递归及卷积实现比较。作者称这是首次在神经形态硬件上实现 SSM;该首次性声明尚未独立核查。具体状态表示、数值精度、硬件映射及训练设置尚未验证。 结果:作者报告,Jetson 在离线、按样本进行批处理的模式下表现更好;在逐 token 处理模式下,相对于 Jetson 上的递归 S4D 实现,Loihi 2 的能耗低 1000 倍、延迟低 75 倍、吞吐高 75 倍。摘要未明确这些倍率对应的具体任务、批大小、序列长度及测量边界,不能将其视为所有任务或部署条件下的普遍收益。任务性能、实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,持续状态更新与逐 token 推理可能适配 EEG 在线解码的低延迟、低功耗需求。可复用的是 S4D 流式状态更新及硬件部署思路;需改造多通道 EEG 的输入编码、时间采样方式和任务输出,并确认硬件数值精度是否影响解码性能。原实验依赖序列化图像任务,监督设置与训练规模尚未验证;EEG 的低信噪比、跨被试变化、通道差异和小数据条件可能削弱收益。一个可检验的小实验是在固定 EEG 数据划分、模型与逐样本输入速率下,对照两种硬件的任务指标、端到端延迟和能耗,明确是否计入预处理与数据传输。相关 EEG 工作尚未检索确认。
值得阅读之处在于区分离线批处理与逐 token 流式推理的硬件收益,并提供 S4D 在 Loihi 2 与 Jetson 上的能耗、延迟和吞吐对照;其对 EEG 实时处理的价值尚未验证。
来源:OpenReview · State space models · openreview.net