跳到正文
10月9日周五
  1. arXiv · 泛化与分布偏移77

    SparseDecoding:面向准确高效 LLM 推理的解码感知剪枝

    基于摘要分析。该研究针对 LLM 解码阶段受内存带宽限制,以及固定自然文本剪枝校准与模型自生成序列之间的分布偏移,提出 SparseDecoding:用稠密模型自回归生成时的逐层激活校准剪枝,并结合面向解码的稀疏计算内核,提高剪枝后的生成质量与推理效率。 机制上,作者指出,常见基于 Hessian 的逐层免训练剪枝使用预先收集的自然文本计算校准信息,而实际解码输入包含模型自生成 token;两类序列对应的 Hessian 与激活分布存在差异,可能损害剪枝模型的生成表现。SparseDecoding 从稠密模型自回归生成过程收集逐层激活并构建校准矩阵,明确排除 prefill 阶段,使剪枝目标更贴近解码阶段的激活。具体剪枝目标、Hessian 计算方式、稀疏率与校准样本规模尚未验证。 系统上,该方法针对解码中占主导的稀疏矩阵–向量乘法(SpMV),而非主要优化稀疏矩阵–矩阵乘法(SpMM),设计采用位掩码索引与固定步长遍历的 N:M 稀疏内核。其实际收益需要结合稀疏模式、生成长度、批大小及内核调用开销核对,不能仅由非零参数减少推断。 作者报告,在 Llama-3.1-8B、Llama-3.3-70B、Qwen3-14B / 32B 的长文本生成基准上,该方法持续优于标准固定文本校准,并在 A100 GPU 上获得最高 1.48 倍的端到端实际墙钟解码加速。摘要未给出基准名称、生成质量指标、加速峰值对应模型与配置,以及计时对照的具体设置;实验协议、消融及统计信息尚未验证。 平台推测(待验证):其可借鉴之处是让压缩校准数据匹配部署时的输入与激活分布,但这依赖自回归生成这一数据结构,不等同于已验证的 EEG/BCI 域适应方案。摘要未提供直接的 EEG 迁移机制或验证,已有 EEG 相关工作尚未检索确认。复现需取得校准生成流程、剪枝配置、内核实现及硬件计时协议;代码是否公开尚未验证。

    阅读价值:值得核对其生成阶段校准能否缓解剪枝时的激活分布偏移,以及 N:M 稀疏矩阵–向量内核在何种配置下带来实际解码加速;摘要提供了明确机制,但效果边界尚未验证。

10月8日周四
  1. arXiv · 在线与高效推理74

    通过 Cross-Step Attention 实现实时视频超分辨率的流式感知扩散

    基于摘要分析。该研究针对实时视频超分辨率(VSR)中扩散采样成本高、帧间协调不足的问题,将预训练单图像潜空间扩散模型适配为流式推理框架,通过复用相邻帧与扩散步的中间特征,在延迟约束下改善空间细节与时序一致性。 核心机制包括 Cross-Step Attention:复用相邻帧及扩散步的中间去噪特征,使时序信息在无需显式时序建模的情况下交换;以及 Trajectory-Coupled Diffusion Scheduling:对齐相邻扩散状态,为跨步条件化提供更干净的中间表示。流式管线逐帧增量传播潜状态。作者报告,对于 N 帧、S 个扩散步,有效计算复杂度由 O(N·S) 降至 O(N+S);这一结论的计算口径、适用条件及冷启动成本尚未验证。 作者报告,在 REDS4 和 YouHQ40-Test 上改善了感知质量与时序真实感,同时维持逐帧稳定性;在 512×512 分辨率、冷启动之后达到超过 40 FPS。摘要未提供具体质量指标、对照基线、硬件、扩散步数及端到端延迟,因此不能仅凭吞吐判断实际部署条件下的实时性。实验协议、消融及统计信息尚未验证,复现还需核对特征缓存与潜状态传播的实现、显存开销及序列边界处理。 平台推测(待验证):其跨步缓存机制可能启发采用迭代生成或去噪模型的流式 EEG 重建,但依赖相邻输入状态的连续性,不能直接等同于 BCI 解码收益。可复用的是中间特征缓存与状态调度思路,需改造的是 EEG 编码、通道表示及时间窗口接口;低信噪比、状态突变、跨被试差异和小数据训练可能导致误差持续传播。小规模可检验实验是在固定 EEG 去噪模型与连续窗口协议下,对比独立窗口推理和跨窗口缓存,联合测量重建误差、延迟与误差累积。相关 EEG 工作尚未检索确认。

    阅读价值:值得核对其跨帧、跨扩散步特征复用如何降低流式推理成本,尤其是冷启动后实时吞吐与时序稳定性的评估条件;摘要所述复杂度收益尚需全文验证。

  2. arXiv · 多模态与生成机制74

    无需蒸馏:通过非因果噪声整形实现单次前向实时说话人头像生成

    基于摘要分析。该研究针对音频驱动面部动画中扩散模型多次网络求值与实时流式生成需求之间的矛盾,提出 FaceGAN:通过非因果噪声整形,在保持音频到表情路径因果性的同时,每帧以单次前向计算生成表情与头部姿态。 核心机制是区分观测信号与合成随机信号的时间约束。作者认为,音频条件下的面部运动位于相对低维的流形,单次前向 GAN 的主要障碍不是容量,而是随机结构。作者报告,对于由 i.i.d. 噪声驱动的因果、时不变生成器,压低某一频带的输出频谱会伴随逐步创新量的坍缩;FaceGAN 通过在噪声路径中引入非因果整形规避这一限制。由于噪声是合成的,其未来值可提前采样,因此这一操作不要求访问未来音频。该理论结论的定义、假设与证明范围尚未验证。 作者报告,FaceGAN 在生成质量上达到或超过当前最先进方法,并依靠前馈结构与有界注意力窗口支持无限时长、无漂移生成。摘要未提供数据集、划分、评价指标、对照方法、硬件或延迟数据,因而尚不能量化质量优势或确认实时性能;长期稳定性测试、实验协议、消融及统计信息尚未验证。 平台推测(待验证):分离条件输入因果性与合成噪声时间结构的思路,可能对 EEG 条件下的实时生成具有参考价值,但原任务的低维运动流形假设不一定适用于低信噪比、跨被试变化明显的 EEG,也不能据此推断解码性能提升。已有 EEG 相关工作尚未检索确认。复现仍需核对噪声整形实现、训练目标、注意力窗口及代码与权重可用性。

    阅读价值:值得阅读的是其将音频条件路径的因果性与合成噪声路径的非因果性分离,为单次前向流式生成提供机制解释;生成质量、实时性能及理论适用条件仍需全文核对。

10月5日周一
  1. arXiv · 在线与高效推理78

    AdaSpark:通过在线学习进行树验证与 n-gram 填充的自适应 DSpark

    基于摘要分析。AdaSpark 研究分块推测解码中验证树宽度的在线选择问题:更宽的树可能接受更多 token,却增加目标模型验证耗时。其贡献是在服务过程中同时学习验证耗时与候选接受概率,并将 drafter 候选和请求文本中的 n-gram 延续纳入统一调度,无需预先进行性能剖析、校准或宽度扫描。 机制上,AdaSpark 学习哪些验证宽度值得纳入选择,并按上下文拟合各宽度的验证耗时;利用目标模型的验证结果拟合候选接受概率,将 drafter 的置信度头作为输入之一,而非直接依据其置信度安排验证树。该模型也评估请求自身文本的 n-gram 延续,使两类候选按同一 best-first 顺序竞争验证行数。宽度选择以长期解码速率衡量时间成本。摘要未给出在线更新算法、模型形式或具体目标函数。 作者报告,在六个公开数据集的单轮与多轮对话、三个稠密目标模型及一个 mixture-of-experts 目标模型上,使用相同 drafter 时,AdaSpark 的解码速度为 llama.cpp DSpark 的 1.5–3.1 倍。在 imparo 引擎内,相对采用三 token 链的配置(摘要称其为 llama.cpp 默认设置),速度为 1.17–1.52 倍,作者将该收益归因于调度器。作者还报告,无需宽度扫描,在所评估的稠密目标模型与上下文区间中,其速度至多比最佳固定树宽度慢 0.3%;在 mixture-of-experts 目标上与最佳固定宽度持平,其余所比较的 4–16 行固定宽度配置慢 5–14%。这些结果仅适用于摘要所述评估范围,不能外推至任意硬件或负载。 复现需核对目标模型与 drafter、数据集与上下文划分、硬件及并发设置、计时边界、在线学习开销,以及最佳固定宽度的确定方式;实验协议、消融及统计信息尚未验证。平台推测(待验证):该方法可能用于 BCI 系统中已有的自回归文本生成后端,但不直接解决 EEG 表征或神经信号解码问题,原领域加速不等于 BCI 端到端收益;已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其在线联合估计验证耗时与候选接受概率的调度机制,以及在相同 drafter 下相对固定验证宽度的收益;作者报告了多目标模型结果,但具体计时协议与在线学习开销尚未验证。