跳到正文

算法、任务与模态

LLM 最新动态

LLM 研究索引;按可核对的标签归档,不以热度评价质量。

166 条精选近 30 天 90 条共收录 195 条

更新

精选归档 · 第 9 页

1月1日周一第 161–166 条
  1. OpenReview · State space models86

    Transformers 是 SSMs:通过结构化状态空间对偶构建广义模型与高效算法

    基于摘要分析。本文主要研究语言建模中的架构与计算效率问题,通过结构化半可分矩阵的不同分解,建立 SSM 与注意力变体之间的理论联系,提出状态空间对偶(SSD)框架,并据此设计 Mamba-2。 核心机制是以结构化半可分矩阵作为连接不同序列计算形式的数学桥梁,而非仅比较两类模型的预测性能。摘要明确将理论联系限定于 SSM 与注意力变体,因此不宜仅凭标题推断所有 Transformer 组件都与 SSM 完全等价。Mamba-2 的核心层是对 Mamba 选择性 SSM 的改进;具体参数化、训练目标、矩阵分解与计算实现尚未验证。 作者报告,Mamba-2 的核心层相较于 Mamba 的选择性 SSM 快 2–8 倍,同时在语言建模上保持与 Transformers 的竞争力。该倍数描述的是核心层速度,不能直接视为端到端训练或推理加速。摘要未提供对应硬件、序列长度、精度、模型规模、数据集及性能指标;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 任务依赖较长时间序列中的信息整合,SSD 支持的序列计算机制可能提供计算效率方面的候选方案,但语言建模结果不等于 BCI 有效性。可复用候选是 Mamba-2 的序列处理核心;输入表征、通道间关系建模及任务输出需针对 EEG 改造。低信噪比、跨被试差异、通道配置变化和小数据可能削弱收益。一个可检验的小实验是在固定 EEG 数据划分、预处理和训练预算下,与 Mamba 及注意力基线比较任务指标、运行时间和显存占用,并分别报告被试内与跨被试结果。已有 EEG 相关工作尚未检索确认。

    阅读价值:SSD 为理解 SSM 与注意力变体的联系及设计高效序列模型提供了可核对的理论路径,但 Mamba-2 的速度收益需结合具体实现与测量协议验证,EEG/BCI 适用性尚未验证。

  2. OpenReview · State space models74

    Bi-Mamba:面向高精度的 1-bit 状态空间模型

    基于摘要分析。该研究面向大语言模型的训练与部署成本,提出 1-bit Mamba 架构 Bi-Mamba,探索在低比特表示下保留选择性状态空间模型(SSM)的语言建模能力。其主要对象是语言模型,而非 EEG 或 BCI。 机制与训练:Mamba 使用选择性 SSM,旨在缓解 Transformer 随序列长度增长的二次计算复杂度及推理时 key-value cache 的内存开销。Bi-Mamba 进一步引入 1-bit 表示,提供 780M、1.3B 和 2.7B 三种模型规模,并使用自回归蒸馏损失从头训练;摘要称训练数据量与常规 LLM 预训练相当。具体二值化对象、保留高精度的模块、蒸馏教师及损失形式尚未验证,不能将“1-bit”理解为所有计算与状态均采用二值表示。 结果与对照:在摘要所述语言建模实验中,作者报告 Bi-Mamba 的性能可与 FP16 或 BF16 全精度对应模型相当,并优于训练后二值化(PTB)Mamba 基线;作者还报告相较原始 Mamba 显著降低内存占用与能耗。摘要未提供数据集、具体指标及收益数值,实验协议、消融及统计信息尚未验证,硬件支持与端到端效率亦需查阅正文。 平台推测(待验证):可检验的迁移假设是,将低比特训练与蒸馏用于 Mamba 类 EEG 序列模型,以缓解长时间窗建模及端侧存储压力。可复用的是低比特训练思路;输入编码、任务输出及教师监督需适配多通道连续信号,语言预训练的数据规模优势也不能直接迁移。低信噪比、跨被试差异、通道配置变化与小数据训练可能放大量化误差。一个小实验是在固定 EEG 任务和严格跨被试划分下,对照全精度、PTB 与从头低比特蒸馏训练,使用相同骨干和数据预算,同时测量任务指标、内存及同一硬件上的延迟或能耗。已有 EEG 相关工作尚未检索确认,该实验仅用于验证迁移假设。

    阅读价值:值得核对 Bi-Mamba 从头训练与自回归蒸馏如何缓解 Mamba 二值化后的性能损失,但摘要中的效率收益尚需结合量化范围、硬件及测量协议验证,不能直接视为 EEG 部署收益。

11月8日周三
  1. OpenReview · State space models72

    LASER:用于网页导航的状态空间探索 LLM 智能体

    基于摘要分析。本文研究 LLM 智能体在交互式网页导航中如何从错误操作中恢复,提出 LLM Agent with State-Space ExploRation(LASER),将任务建模为预定义状态集合上的探索,通过动作驱动状态转移并支持灵活回溯。 核心机制:作者指出,先前方法通过上下文中的理想轨迹示例教授交互推理,隐含采用仅向前执行的模式,因而难以处理示例未覆盖的错误情境。LASER 的方法重点是允许智能体回到先前状态,恢复错误并继续完成任务。这里的“状态空间”指交互任务中的状态与动作组织方式;摘要并未描述用于序列建模的 State Space Models 架构,不能仅因来源分类而将其视为此类模型。 评估与证据:作者在 WebShop 任务上评估 LASER,并报告其显著优于先前方法、缩小了网页导航任务中与人类表现的差距。摘要未提供具体指标、数值、基线名称、数据划分或人类对照设置,因此无法量化提升幅度或核对显著性的统计依据。状态定义、回溯触发与执行方式、LLM 配置、交互预算、实验协议、消融及统计信息尚未验证。 适用边界:本文主要研究对象是网页导航智能体,而非 EEG 解码或 BCI。摘要中的状态探索和错误恢复机制依赖可定义的任务状态及可执行动作,目前材料未建立其与神经信号处理的具体对应关系,因此不据此推导 EEG/BCI 性能收益或提出迁移复现实验;相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其将交互式网页导航建模为可回溯状态空间探索的机制,但摘要尚不足以核对性能提升的幅度,也不能将这里的状态空间等同于神经序列建模中的 State Space Models。

9月22日周五
  1. OpenReview · EEG75

    DeWave:用于 EEG 到文本翻译的 EEG 波形离散编码

    基于摘要分析。DeWave 研究开放词汇 EEG 到文本翻译,针对现有方法依赖眼动注视或事件标记进行词级分割的问题,提出通过离散 EEG 编码与预训练语言模型对齐的框架,并探索不依赖词级顺序标记的整段信号翻译。 核心机制是使用量化变分编码器生成离散 codex 表征,再将编码序列与预训练语言模型对齐。作者认为,文本–EEG 对比对齐训练能够缓解眼动注视顺序与词语顺序不一致的问题,而具有不变性的离散 codex 可减少个体 EEG 差异带来的干扰。摘要未提供量化实现、损失函数、训练阶段或语言模型名称,上述机制的具体实现及各模块贡献尚未验证。 作者报告,在 ZuCo Dataset 上,DeWave 达到 41.35 BLEU-1 和 33.71 Rouge-F,对应此前基线分别为 40.1 和 31.7。摘要未交代这一比较的被试内或跨被试协议、数据划分与基线名称,因此不能据此判断跨被试泛化能力。另在不使用词级顺序标记的整段 EEG 翻译条件下,作者报告 20.5 BLEU-1 和 29.5 Rouge-1。两组结果的输入条件不同,且 Rouge-F 与 Rouge-1 的指标表述不同,不宜直接作等价比较。 阅读全文时需核对离散表征的不变性如何约束与评估、训练和推理各自依赖哪些文本或事件信息,以及整段信号的切分与对齐方式。被试数量、实验划分、消融、统计信息和复现资源尚未验证。摘要中的结果不能直接证明系统已具备自由表达场景下的实时 BCI 能力;作者关于整段翻译的“首次”主张也尚未独立核验。

    阅读价值:值得阅读的具体原因是 DeWave 将离散 EEG 编码与预训练语言模型对齐,并报告了不依赖词级顺序标记的整段 EEG 到文本翻译结果;其对跨被试差异的缓解程度及推理条件仍需全文核验。

9月20日周三
  1. OpenReview · EEG72

    BELT-2:面向多任务脑解码的 EEG—语言表征自举对齐

    BELT-2 研究如何将 EEG 表征与语言表征对齐,并连接大语言模型(LLMs)以支持多任务脑解码;核心方法结合 BPE 级对齐、多任务 EEG 编码器与 prefix-tuning。基于摘要分析,未取得论文全文。 技术机制方面,作者采用 byte pair encoding(BPE)级 EEG—语言对齐,并在 EEG 领域联合进行多任务训练与解码;随后利用 EEG 编码器的中间输出,通过 prefix-tuning 连接 LLMs。该设计将 EEG 表征学习与语言生成接口结合,但摘要未说明 EEG 与 BPE 单元的对应构造、对齐损失、多任务的具体组成、LLM 型号,以及训练时哪些模块冻结或更新,相关细节尚未验证。 结果方面,作者报告在 ZuCo 数据集上获得 BLEU-1 为 52.2% 的解码结果,但摘要未提供数据划分、被试内或跨被试协议及对照基线,因此不能据此判断跨被试泛化能力。作者还报告在其他翻译基准上提升 31%–162%,但未明确基准名称、指标、对照方法及提升的计算口径,不能将其解释为准确率或百分点提升。作者声称该方法能够从非侵入式脑信号解码连贯、可读的句子,并声称相关设计具有首次性;这些主张尚需正文与既有工作核对。 复现时需核对 EEG 预处理、EEG—文本配对方式、训练与测试划分、多任务监督来源,以及文本生成阶段是否使用额外文本条件。尤其应区分 EEG 提供的信息与 LLM 语言先验对生成质量的贡献;摘要不足以确定这一贡献分解。实验协议、消融及统计信息尚未验证。摘要称代码可通过匿名链接获取,但当前材料未给出该链接,代码可访问性与复现条件尚未验证。

    阅读价值:值得阅读的具体原因是 BELT-2 将 BPE 级 EEG—语言表征对齐、多任务训练与 LLM prefix-tuning 结合,可用于考察语言先验与 EEG 表征对文本解码的各自贡献,但其评估协议与提升幅度仍需全文核对。

1月1日周日
  1. OpenReview · Representation learning76

    面向信息检索的多变量表征学习

    基于摘要分析。本文研究信息检索中的稠密检索问题,提出将查询与文档分别表示为多变量分布,而非单一向量,并以负多变量 KL 散度计算相似度。主要贡献是将分布表征引入检索框架,并提供理论基础及高效检索的兼容性论述。 核心机制:常见稠密检索使用双编码器生成查询与文档向量,再以点积计算相似度。本文为简化计算并提高效率,假设表征服从多变量正态分布,训练大型语言模型输出均值与方差向量。由此,匹配依据从向量点积转为分布间差异。摘要未说明 KL 散度的方向、具体训练损失、方差约束及近似最近邻算法的适配细节,这些均需核对全文;不能直接将预测方差解释为经过校准的不确定性。 结果与证据边界:作者报告在多个数据集上开展广泛实验,相较有竞争力的稠密检索模型取得显著改进,并称该框架可无缝整合到现有近似最近邻算法中。摘要未提供数据集名称、划分、指标、具体基线、提升幅度或统计检验,因此无法判断收益大小及适用范围。实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设分布表征能够描述 EEG 片段在嵌入空间中的变异,则可探索以分布匹配替代点积,用于 EEG 片段检索;这不是原论文验证的任务。可复用的是均值、方差输出及分布相似度计算,需改造的是文本编码器、EEG 输入处理和训练配对方式,原文监督方式与所需规模尚未验证。低信噪比、跨被试及通道差异可能使方差主要反映噪声,小数据下也可能估计不稳定。一个可检验的小实验是在固定被试内数据划分、编码器和训练预算下,对比向量点积与分布匹配的同类 EEG 片段检索性能,并检验方差输出是否带来稳定收益。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其以分布表征和负多变量 KL 散度替代向量点积的检索机制,以及与近似最近邻检索兼容的理论依据;其对 EEG 表征的价值尚未验证。