用于无数据混合专家模型压缩的共享低秩基分解
Shared Low-rank Basis Factorization for Data-free Mixture-of-Experts Compression
基于摘要分析。本文研究 Mixture-of-Experts(MoE)大语言模型因参数量庞大而面临的存储与部署问题,提出无需数据的权重重构方法 Shared Low-rank Basis Factorization(SLBF),通过专家间共享低秩基实现压缩,同时保留专家结构与路由机制。 作者分析专家剪枝、专家合并和权重重构三类压缩方法,并推导结构性误差界。作者指出,剪枝与合并可能产生与路由及专家异质性有关、不会消失的误差;相比之下,权重重构通过保留专家结构与路由,避免上述结构性代价。这并不意味着权重重构没有近似误差,具体界的假设与适用范围仍需正文核对。 SLBF 使用跨专家共享的秩 k 基,作者称其可增强专家间共享、加快收敛并降低重构误差;随后通过事后 gauge fixing,在不损失表示能力的情况下去除冗余参数。摘要未给出具体分解形式、秩分配、优化目标或收敛衡量方式。 作者报告,在五种参数规模覆盖 16B 至 122B 的 MoE 架构上,SLBF 持续优于来自上述三类压缩方法的对照。具体架构、任务、数据划分、压缩率、性能指标、推理资源收益,以及实验协议、消融及统计信息尚未验证,不能据此量化优势或判断部署收益。 平台推测(待验证):若 EEG 模型本身采用具有兼容权重结构的 MoE,共享低秩基可能用于减少专家参数存储;但原文研究对象是大语言模型,并未提供 EEG/BCI 证据。其迁移依赖专家间权重可共享程度,可能削弱承载被试或通道差异的专门化能力,低信噪比与小样本条件下的任务表现仍需验证。已有 EEG 相关工作尚未检索确认。
值得核对其剪枝、合并与权重重构的结构性误差分析,以及共享低秩基在保留专家和路由结构时的压缩收益;摘要未提供具体评估指标,BCI 适用性尚未验证。
来源:arXiv · 架构与算子 · arxiv.org