跳到正文

算法、任务与模态

LLM 最新动态

LLM 研究索引;按可核对的标签归档,不以热度评价质量。

26 条精选近 30 天 26 条共收录 27 条

更新

精选归档 · 第 2 页

10月3日周六第 21–26 条
  1. arXiv · 多模态与生成机制77

    强助弱:多模态 LLM 中的定向跨模态对齐迁移

    基于摘要分析。该研究针对数据稀缺模态的多模态大语言模型(MLLM)难以依靠额外大规模训练提升能力的问题,提出 Directional Cross-modal Alignment Transfer(DCAT):将对齐较强、数据丰富的源模态模型作为 donor,向较弱的目标模态 recipient 迁移文本对齐能力,无需进一步微调。 核心机制是定向的跨模态模型合并。作者报告,将较强源模态 MLLM 合并到较弱目标模态 MLLM 后,目标模型在自身模态的基准上获得提升,并将这种非对称收益归因于模态特定 token 与文本 token 之间的对齐增强。作者推导了一个互信息下界,称其随对齐相关量单调变化,并与下游 MLLM 性能高度相关;进一步提出,对齐增强目标可利用小规模校准集得到权重空间闭式解。摘要未提供具体对齐量、目标函数、合并参数范围或模型兼容条件。 作者报告 DCAT 优于现有模型合并方法,但摘要没有给出具体模型、数据集、指标、数值及对照协议,尚不能判断收益规模、稳定性与计算成本。全文需核对迁移方向的对照、校准集构成与规模、理论成立条件,以及对齐变化和性能收益之间的证据;实验协议、消融及统计信息尚未验证。摘要提供了含代码的项目页,但代码内容与复现条件尚未核验。 平台推测(待验证):若 EEG—文本模型具备与 donor 兼容的语言骨干和可合并参数空间,可假设复用文本对齐迁移机制,以缓解 EEG 配对数据稀缺;EEG 编码器、token 接口及校准数据则需适配。低信噪比、跨被试差异、通道配置变化和小样本可能使源模态对齐无法转化为 EEG 任务收益。一个可证伪的小实验是在固定 EEG—文本模型及独立被试划分下,仅用训练被试校准,对比未合并、常规模型合并与 DCAT,检验对齐变化是否伴随跨被试任务指标改善。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 DCAT 如何以小规模校准集计算权重空间闭式解,以及跨模态合并收益是否确由文本对齐改善驱动;其对 EEG 的适用性尚未验证。

  2. arXiv · 学习目标与优化77

    用于 LLM 不确定性量化的释义感知评分保形预测

    基于摘要分析。该研究针对 LLM 不确定性量化对语义保持改写不稳定的问题,提出释义感知评分框架:利用 LLM 隐藏状态训练轻量代理模型,并聚合多个释义版本的预测,构造逐标签非一致性分数,以改善保形预测在改写条件下的稳定性。 核心机制是将学习得到的代理评分与释义聚合接入保形校准。作者指出,在分数满足可交换性的条件下,校准保留边际覆盖保证;若仅测试数据被改写,还需要释义生成流程满足额外的分布对齐条件。该保证不能直接解读为任意改写、任意分布偏移下均有效,具体条件及其可检验性尚需全文核对。 作者在七个多项选择 QA 基准及多个模型家族上评估三种设置:normal 不改写校准集和测试集,fully reworded 同时改写两者,semi-reworded 仅改写测试集。作者报告,方法在这些设置下生成较紧凑的预测集,经验覆盖率通常接近名义目标,包括仅测试集改写的设置;摘要未给出具体覆盖率、预测集大小或基准名称。作者报告的消融结果表明,预测集大小的主要缩减来自学习得到的代理模型,而释义增强训练和推理时聚合进一步改善改写稳定性。 复现需核对代理模型的监督来源与训练划分、释义生成流程、聚合规则、校准样本构造及额外分布对齐条件。摘要提供了代码地址,但代码内容、实验协议、消融及统计信息尚未验证。 平台推测(待验证):其可借鉴之处是通过任务含义保持的变换聚合评分,再进行保形校准;但自然语言释义不等同于 EEG 信号增强。若迁移至 EEG 分类,需要先验证增强是否保持类别语义,并改造特征代理与聚合模块;低信噪比、通道变化及跨被试差异可能破坏分数可交换性。可在固定被试内划分上,比较无增强、校准与测试均增强、仅测试增强三种条件下的经验覆盖率和预测集大小。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其对测试集单独改写时覆盖保证的分布对齐条件,以及代理模型与释义聚合对预测集大小和稳定性的不同贡献。

  3. arXiv · 多模态与生成机制78

    ALoDLM:自适应循环扩散语言模型

    基于摘要分析。该研究针对扩散语言模型(DLMs)并行生成速度快、但生成质量落后于规模相近自回归(AR)模型的问题,提出 ALoDLM,以 token 自适应潜在递归替代统一计算深度。作者将质量差距归因于计算量与预测难度不匹配:部分未知 token 容易预测,另一些则需要更多计算,而既有 DLMs 在每个去噪步骤中对未知位置采用统一深度。 在每个去噪步骤,ALoDLM 迭代细化潜在表示,并按 token 难度分配计算。已可确定的 token 作为离散上下文反馈,尚未确定的 token 则保留潜在状态,继续通过递归计算细化。为联合学习 token 预测与计算分配,作者将逐 token 的计算调度建模为潜变量,并推导条件负证据下界(NELBO)。具体难度判定、提交规则、递归终止条件及损失实现尚未验证。 作者报告,在 1.7B 与 8B 参数规模、涵盖十一项基准的评估中,ALoDLM 在两种规模下的平均基准分数均超过所有受评估 DLMs 及对应 AR 基线;在优化推理引擎下保留快速并行解码,并在受评估模型中取得较好的质量—效率权衡。摘要未提供基准名称、具体分数、数据划分、推理预算或速度测量条件,不能据此量化提升或外推到其他任务。实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设 EEG 掩码建模中不同时间片或通道的重建难度存在稳定差异,按位置分配递归计算可能减少对容易位置的重复计算。原方法依赖部分可观测的离散 token 序列与迭代去噪;迁移时可考虑复用潜在递归与计算调度,但需改造连续信号预测目标、位置表示及离散提交机制。低信噪比可能使噪声被误判为高难度,被试和通道差异也可能破坏调度泛化,小数据条件下联合学习调度存在不稳定风险。可在固定 EEG 数据划分、相同骨干与总计算预算下,对比统一递归和自适应递归的掩码重建误差及下游解码表现,检验额外计算是否真正改善有效信号恢复。已有相关 EEG 工作尚未检索确认。

    阅读价值:值得关注其以 token 级潜在递归联合学习预测与计算分配的机制,以及作者报告的质量—效率权衡;具体收益仍需结合基准协议、计算预算与消融核对。

  4. arXiv · 架构与算子75

    基于混合梯度的语言模型原则性 Top-k 选择方法

    基于摘要分析。该研究针对语言模型系统从 m 个候选项中选择最佳 k 项时,选择模块梯度信号较弱、探索与利用难以平衡的问题,提出一个具有明确建模目标的训练方法,其梯度同时包含监督梯度与策略梯度成分。 核心机制是通过所提出的选择目标获得混合形式的训练信号,而非仅依赖选择启发式。作者报告,选择问题随候选数量 m 增大而变得更困难,算法的收敛速率为 O(1/√T),并可通过平衡偏差与方差达到所分析的最优上界。摘要未说明 T 的具体定义、目标与梯度估计公式,以及收敛结论所需假设,理论适用范围尚需全文核对。 作者在合成回归、Retrieval-Augmented Generation(RAG)文档选择和 Mixture-of-Experts(MoE)专家路由任务中评估该方法,报告其相较基线改善了 next-token prediction 的困惑度与 QA Accuracy。摘要未给出数据集、划分、基线名称或具体数值,不能据此判断提升幅度或不同任务间的可比性;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 模型需要从候选通道、时间片段或专家模块中进行离散 top-k 选择,该混合梯度思路可能提供可复用的选择器训练框架。其迁移依赖可定义的候选集合、下游任务监督及可估计的选择收益;具体监督梯度项与策略梯度项如何适配 EEG,需依据全文公式确定。低信噪比、通道差异及小样本可能造成收益估计不稳定或选择器过拟合。一个可检验的小实验是在固定 EEG 解码骨干、候选通道集合与 k 的条件下,对比该方法与原有选择器,并分别报告被试内和跨被试 Accuracy 及多随机种子波动。上述迁移尚未验证,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其 top-k 选择目标如何结合监督梯度与策略梯度,以及偏差—方差平衡的理论条件;摘要报告了 RAG 和 MoE 任务收益,但具体对照与复现条件尚未验证。

  5. arXiv · 架构与算子75

    ExpertMuon-Compass:用于混合专家训练的对齐引导步长

    基于摘要分析。该研究针对混合专家(MoE)语言模型中各专家接收的数据不同且随训练变化、共享学习率难以反映专家更新质量的问题,提出 ExpertMuon-Compass(Compass):保留 Muon 的更新方向与动量缓冲,通过两个对齐因子调整每个专家的更新步长。 核心机制是将专家的 Muon 步乘以两个因子:family factor 比较该专家正交化更新与当前梯度的余弦相似度和同层其他专家的对应相似度;scalar radius 将更新与梯度对应行之间的对齐信息聚合为一个步长乘数。方法主要改变更新幅度,而非更新方向。作者还报告证明了两个因子的扰动界,但具体假设、界的形式及适用范围尚未验证。 作者报告,在 FineWeb-Edu 预训练中,对所有矩阵使用 Nesterov 动量的 Compass 表现不逊于或优于 Muon、NorMuon 及其他优化器;较长训练运行中的权重衰减与 NorMuon 匹配。将这些因子加入 NorMuon 后,作者报告损失相同或更低。摘要未提供模型规模、训练预算、具体损失数值与数据划分,不能据此量化收益。作者报告,当专家所见数据在训练过程中变化时效果最明显,例如多语言语料按语言分块到达的设置;同时专家负载保持均衡,路由器的 token 分配更为明确。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 模型采用 MoE,且不同专家因被试、会话或任务路由而接收非平稳数据,对齐引导步长可能对应专家间更新可靠性不一致的瓶颈。可复用步长缩放机制,但需适配专家矩阵及路由方式;该机制依赖可计算的专家梯度、正交化更新及同层专家比较,不能直接推广到没有专家结构的模型。低信噪比、小数据和稀疏路由可能使对齐估计不稳定,通道差异也可能改变专家分工。一个可检验的小实验是在固定 EEG MoE、Cross-subject 划分与训练预算下,对照 Muon 和 Compass,比较预先指定的任务指标、专家负载与对齐因子稳定性,并分别移除两个因子。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其基于更新—梯度对齐调整专家步长的机制,以及与 Muon、NorMuon 在权重衰减匹配条件下的比较;摘要报告的收益尚需结合完整训练协议与消融验证。

  6. arXiv · 时序与音频基础模型75

    SEER:面向时间序列预测的自演进事件推理与检索

    基于摘要分析。该研究针对外生事件与结构变化驱动的时间序列预测,提出 SEER(Self-Evolving Event Reasoning and Retrieval)闭环框架,通过预测误差持续优化外部事件条件信息,试图弥补仅依赖历史数值观测及常规检索增强方法的不足。 核心机制是将预测误差转化为两种解耦反馈:一是反思式检索记忆,用于改进后续搜索查询并过滤无关噪声;二是持久化因果知识库,用于提炼可迁移的领域动态规律。摘要将高噪声、信号缺失及事件影响的因果推理能力不足列为常规检索增强方法的难点,但尚未给出 SEER 的具体知识表示、更新规则、训练目标或预测器接口。因果知识库的命名也不等同于已完成因果识别验证。 作者报告,在六个高波动时间序列基准上,SEER 持续优于所比较的先进时间序列基础模型及语言模型基线。摘要未提供基准名称、划分、预测跨度、指标、数值或基线配置,因此尚不能判断优势幅度及不同协议下的适用范围。作者称事件检索与反思均遵守严格时间边界,以防止前视偏差和数据泄漏;具体实施方式、实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 预测任务具有带可靠时间戳的外部事件或上下文记录,可假设检索记忆与领域知识积累有助于应对状态变化;这不构成已验证的 EEG/BCI 效果。可复用的是反馈分离思路,需改造事件表示、检索源及反馈更新时机。低信噪比、被试差异、通道变化和小数据可能使误差反馈误归因并积累错误知识。一个可检验的小实验是在固定 EEG 预测任务与按时间划分的协议下,对比数值预测器、静态事件检索与闭环反馈,并分别关闭两类反馈,检查收益是否稳定。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对的是 SEER 如何将预测误差分别用于检索记忆更新与因果知识积累,以及检索和反思的时间边界如何落实;其性能优势目前仅有摘要中的作者报告。