跳到正文
arXiv · 学习目标与优化· Yuqi Li; Xiaoqin Feng; Fan Xu; Weilun Feng; Chuanguang Yang; Yingli Tian; Hao Wu·· 2 天前精选AI 评分72

TAM:用于高效时空预测的任务感知记忆蒸馏

TAM: Task-Aware Memory Distillation for Efficient Spatiotemporal Prediction

AI 导读

基于摘要分析。TAM 针对知识蒸馏中逐样本匹配输出或特征难以充分利用跨样本预测结构的问题,将冻结教师的知识组织为容量受限、可检索的历史记忆,以任务相关的历史监督补充监督预测与常规蒸馏。 核心机制是按任务将潜在特征、预测变化或流量残差存入记忆,并通过任务特定的选择规则检索相关历史参照。学生采用两类目标之一:匹配教师在共享参照上的相似度分布,或回归以观测为条件的残差原型。摘要未给出具体损失形式、记忆容量、更新策略及检索实现。教师、记忆和辅助适配器仅在训练阶段使用,作者称学生推理流程保持不变。 作者在视频预测、天气预报和交通流量预测中评估了多种教师—学生配置。作者报告,在四次配对运行取平均的条件下,相对各自对应的 KD 基线,加入 TAM 后六个视频数据集的 SSIM 均提高,其中五个的 MSE 降低;平均配对 MSE 相对降幅在 KittiCaltech 上达到 1.86%,在使用 gSTA 教师的 WeatherBench 上达到 1.93%,在 TaxiBJ 上达到 1.01%。这些数值来自不同任务与配置,不能直接横向比较。具体数据划分、基线设置、消融、统计不确定性及训练资源开销尚未验证。 平台推测(待验证):假设 EEG 时序预测中存在可复用的跨片段动态结构,任务感知记忆可能补充逐片段蒸馏。可复用部分是历史参照检索与关系蒸馏;需改造的是 EEG 记忆表示、通道对齐和参照选择规则。该路径依赖足够且相关的历史样本以及可靠的教师表示,低信噪比、跨被试差异、通道变化和小数据可能使检索参照失配。一个可证伪的小实验是在固定教师、学生及被试内划分下,仅用训练集构建记忆,对比常规 KD、随机参照和任务相关参照,检验预测误差是否稳定降低并核对推理开销。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 TAM 如何以任务相关历史参照补充逐样本蒸馏,以及其在不增加学生推理开销的条件下相对对应 KD 基线的配对收益;迁移至 EEG 预测的价值尚未验证。

来源:arXiv · 学习目标与优化 · arxiv.org