跳到正文
arXiv · 在线与高效推理· Aayush Mishra; Arnau Padrés Masdemont; Victor Conchello Vendrell; Jordi Ros Giralt; Arash Behboodi; Fabio Valerio Massoli·· 3 天前精选AI 评分77

在 Looped LMs 中实现动态计算

Enabling Dynamic Computation in Looped LMs

AI 导读

基于摘要分析。研究针对 Looped LMs 虽具参数效率优势、却难以在实际推理中实现动态计算的问题,提出“best-available” KV caching 策略,并调整训练中的早退先验约束,使不同 token 能按所需计算量在不同循环深度退出。 作者指出,现有 Ouro models 的每次循环迭代都需要对应深度的 KV-cache,因此缓存依赖使推理仍需执行全部循环;同时,对所有 token 均等施加早退先验,会使处理趋于统一的较浅深度,而非根据 token 难度分配计算。提出的缓存策略可直接应用于现有模型;摘要未给出其缓存选择、更新及不同深度之间兼容处理的具体规则。作者还报告,让训练过程感知该缓存策略可进一步改善性能与效率,并通过对早退先验约束目标的小幅修正,实现更异质的逐 token 退出深度。 作者报告,在 Ouro models 和从头预训练的较小 Looped LMs 上验证了方法,并在保持完整深度性能的条件下,使 FLOPs 与 KV 内存最多降低 30%。摘要未说明该上限对应的任务、模型配置、深度、数据划分或性能指标,不能据此推断所有设置都有同等收益;实验协议、消融及统计信息尚未验证。复现需核对缓存策略的实现、早退目标修正、性能与计算量测量方式,以及缓存节省是否转化为实际推理延迟收益。 平台推测(待验证):若 EEG 序列模型采用共享参数的循环计算并存在类似缓存依赖,可探索复用缓存策略与动态退出机制,但需改造输入表示和退出判据。低信噪比、被试差异及小数据可能使退出深度反映噪声而非任务难度。可在固定 Cross-subject 划分下,对比完整深度与动态退出版本的任务指标、计算量及各被试退出深度分布,检验节省计算是否损害泛化。相关 EEG 工作尚未检索确认。

阅读价值

值得核对其“best-available” KV caching 如何解除循环深度与缓存依赖的耦合,以及早退目标修正能否在保持性能的同时实现真正的逐 token 动态计算。

来源:arXiv · 在线与高效推理 · arxiv.org