WASD:用于大语言模型的基于 Wasserstein 的知识蒸馏
WASD: Wasserstein-based Knowledge Distillation for Large Language Models
基于摘要分析。该研究针对自回归大语言模型知识蒸馏主要按词表索引比较概率、未显式利用 token 语义的问题,提出 WASD:以 token embedding 构造代价矩阵,通过基于 Wasserstein 的距离对齐教师与学生的输出分布。 核心机制是将 token 间的语义关系引入分布匹配,而不只比较同一词表位置的概率值。为控制计算成本,作者采用 Sinkhorn divergence,并推导可高效优化的梯度等价目标,无需引入额外网络。摘要未给出代价矩阵的具体定义、embedding 来源、教师与学生词表兼容方式,以及该目标的推导条件和实际计算开销,均需全文核对。 作者报告,在多个 LLM 家族与规模、覆盖 instruction following、mathematical reasoning 和 code generation 的实验中,WASD 持续改善蒸馏表现。但摘要未提供模型名称、数据集、划分、对照基线或具体指标,因此尚不能量化收益或比较不同评估协议。作者提供了公开实现地址;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 分类标签具有可论证的语义或任务距离,WASD 的代价矩阵与分布对齐思路可能用于教师—学生蒸馏,但这是假设,不是已验证的 BCI 效果。可复用的是语义代价与 Sinkhorn 对齐机制;需改造的是类别间距离的定义及监督依据,不能直接照搬 LLM 的 token embedding。低信噪比、跨被试差异和小数据可能使教师错误被传递,或使预设类别距离失效。一个可检验的小实验是在固定 Cross-subject 划分、相同教师与学生下,对比常规概率蒸馏、语义代价蒸馏及打乱代价矩阵的对照,同时记录分类指标与训练开销。已有 EEG 相关工作尚未检索确认。
值得核对其以 token embedding 构造语义运输代价及梯度等价目标的推导,判断语义感知分布对齐能否在可控计算成本下改善蒸馏;具体收益与复现条件尚未验证。
来源:arXiv · 学习目标与优化 · arxiv.org