跳到正文

算法、任务与模态

LLM 最新动态

LLM 研究索引;按可核对的标签归档,不以热度评价质量。

147 条精选近 30 天 87 条共收录 175 条

更新

精选归档 · 第 8 页

1月1日周一第 141–147 条
  1. OpenReview · State space models75

    “总有另一个计数器”:检测恶意与良性代码概率性交错执行场景中的微架构攻击

    基于摘要分析。本文研究攻击者将恶意代码以极低频率交错插入良性代码后,基于 Hardware Performance Counters(HPCs,硬件性能计数器)的防御是否仍能识别微架构攻击。作者提出统计建模与 LLM 检测方法,主张概率性交错并不必然使攻击不可检测。 理论部分使用 Gaussian Mixture Models 与 Dip Test for Unimodality 建模交错攻击;作者声称,在适当选择 HPC 的条件下可证明攻击具有可检测性,并讨论同时交错多种攻击的更强威胁模型。摘要未给出证明假设、计数器选择规则或统计检验的具体实施条件,这些尚需全文核对。 实现部分以 LLM 作为检测工具。作者给出的理由是,LLM 能结合较多 HPC 的上下文,并可通过提示切换统计分析方法;这属于作者的方法动机,摘要不足以确认其相对传统机器学习的性能、成本或稳定性优势。具体 LLM、输入表示、提示、采样与决策流程尚未验证。 作者报告,在摘要列举的 Spectre v1/v2/v3、Meltdown 及采用改进 gadgets 的 Spectre v2 等推测执行攻击实验中,即使交错频率低至 10⁻⁶,仍达到 100% 攻击检测率,并将方法定位于攻击特征可能事先未知的 non-profiled 场景。该结果不能直接外推到任意硬件或负载;实验规模、良性负载构成、数据划分、误报率、检测延迟、基线、消融及统计信息尚未验证。 平台推测(待验证):其潜在跨领域价值在于从多变量背景噪声中发现稀疏异常成分,而非已验证的 EEG/BCI 解码效果。若探索 EEG 应用,可复用统计分布检验思路,但需重构信号特征、时间窗口与异常定义;低信噪比、非平稳性、跨被试及通道差异可能使混合成分难以辨识,统计多峰性也不等同于目标神经事件。一个可证伪的小实验是在固定被试内划分下,对具有已知事件时间的 EEG 逐步降低目标事件比例,比较该统计思路与简单异常检测基线,并同时记录检出率和误报率。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其“选择适当 HPC 后,低频恶意执行仍可被统计识别”的理论条件及 LLM 检测实现,但摘要报告的 100% 检测率尚需结合误报率、采样窗口和评估协议验证。

  2. OpenReview · EEG72

    通过预训练对比式 EEG–文本掩码自编码器的可迁移表征增强 EEG-to-Text 解码

    基于摘要分析。本文研究从非侵入式 EEG 重建自然语言,提出 Contrastive EEG-Text Masked Autoencoder(CET-MAE),结合跨模态自监督学习与模态内自重建;进一步构建 E2T-PTR(EEG-to-Text decoding using Pretrained Transferable Representations),将预训练 EEG 表征与 BART 对接以生成文本。 机制上,CET-MAE 通过专用多流编码器组织 EEG 与文本之间的跨模态学习,以及 EEG 特征或文本序列的模态内重建。E2T-PTR 利用预训练模块及 CET-MAE 的 EEG 流,将表征迁移至 EEG-to-Text 解码。摘要未提供具体掩码策略、对比目标、损失权重、模块冻结或微调方式,因此这些实现条件尚未验证。其主要研究价值在于联合表征学习与语言生成,而非仅依赖单一 EEG 编码任务。 作者报告,在文本诱发 EEG 数据库 ZuCo 上,E2T-PTR 相较文中所称的最先进方法,ROUGE-1 F1 与 BLEU-4 分别提高 8.34% 和 32.21%。摘要未说明这些百分比的计算口径、具体对照方法或绝对分数,不能将其解读为百分点提升;也未明确被试内、跨被试或其他划分协议,因而暂不能据此判断泛化能力。 复现与评估需核对 EEG–文本配对和预处理方式、预训练与下游数据的划分、BART 的训练及推理条件,以及各预训练组件的消融贡献。ZuCo 中的文本诱发 EEG 解码结果不等同于自由意图表达或在线 BCI 的有效性;还需区分 EEG 信息贡献与语言模型先验贡献。实验协议、消融及统计信息尚未验证。

    阅读价值:值得阅读的具体原因是 CET-MAE 将 EEG–文本跨模态对比学习与模态内掩码重建结合,并通过 E2T-PTR 对接 BART,可用于考察预训练表征对 EEG-to-Text 解码的贡献,但性能增益的评估协议与归因尚未验证。

  3. OpenReview · State space models74

    Bi-Mamba:面向高精度的 1-bit 状态空间模型

    基于摘要分析。该研究面向大语言模型的训练与部署成本,提出 1-bit Mamba 架构 Bi-Mamba,探索在低比特表示下保留选择性状态空间模型(SSM)的语言建模能力。其主要对象是语言模型,而非 EEG 或 BCI。 机制与训练:Mamba 使用选择性 SSM,旨在缓解 Transformer 随序列长度增长的二次计算复杂度及推理时 key-value cache 的内存开销。Bi-Mamba 进一步引入 1-bit 表示,提供 780M、1.3B 和 2.7B 三种模型规模,并使用自回归蒸馏损失从头训练;摘要称训练数据量与常规 LLM 预训练相当。具体二值化对象、保留高精度的模块、蒸馏教师及损失形式尚未验证,不能将“1-bit”理解为所有计算与状态均采用二值表示。 结果与对照:在摘要所述语言建模实验中,作者报告 Bi-Mamba 的性能可与 FP16 或 BF16 全精度对应模型相当,并优于训练后二值化(PTB)Mamba 基线;作者还报告相较原始 Mamba 显著降低内存占用与能耗。摘要未提供数据集、具体指标及收益数值,实验协议、消融及统计信息尚未验证,硬件支持与端到端效率亦需查阅正文。 平台推测(待验证):可检验的迁移假设是,将低比特训练与蒸馏用于 Mamba 类 EEG 序列模型,以缓解长时间窗建模及端侧存储压力。可复用的是低比特训练思路;输入编码、任务输出及教师监督需适配多通道连续信号,语言预训练的数据规模优势也不能直接迁移。低信噪比、跨被试差异、通道配置变化与小数据训练可能放大量化误差。一个小实验是在固定 EEG 任务和严格跨被试划分下,对照全精度、PTB 与从头低比特蒸馏训练,使用相同骨干和数据预算,同时测量任务指标、内存及同一硬件上的延迟或能耗。已有 EEG 相关工作尚未检索确认,该实验仅用于验证迁移假设。

    阅读价值:值得核对 Bi-Mamba 从头训练与自回归蒸馏如何缓解 Mamba 二值化后的性能损失,但摘要中的效率收益尚需结合量化范围、硬件及测量协议验证,不能直接视为 EEG 部署收益。

11月8日周三
  1. OpenReview · State space models72

    LASER:用于网页导航的状态空间探索 LLM 智能体

    基于摘要分析。本文研究 LLM 智能体在交互式网页导航中如何从错误操作中恢复,提出 LLM Agent with State-Space ExploRation(LASER),将任务建模为预定义状态集合上的探索,通过动作驱动状态转移并支持灵活回溯。 核心机制:作者指出,先前方法通过上下文中的理想轨迹示例教授交互推理,隐含采用仅向前执行的模式,因而难以处理示例未覆盖的错误情境。LASER 的方法重点是允许智能体回到先前状态,恢复错误并继续完成任务。这里的“状态空间”指交互任务中的状态与动作组织方式;摘要并未描述用于序列建模的 State Space Models 架构,不能仅因来源分类而将其视为此类模型。 评估与证据:作者在 WebShop 任务上评估 LASER,并报告其显著优于先前方法、缩小了网页导航任务中与人类表现的差距。摘要未提供具体指标、数值、基线名称、数据划分或人类对照设置,因此无法量化提升幅度或核对显著性的统计依据。状态定义、回溯触发与执行方式、LLM 配置、交互预算、实验协议、消融及统计信息尚未验证。 适用边界:本文主要研究对象是网页导航智能体,而非 EEG 解码或 BCI。摘要中的状态探索和错误恢复机制依赖可定义的任务状态及可执行动作,目前材料未建立其与神经信号处理的具体对应关系,因此不据此推导 EEG/BCI 性能收益或提出迁移复现实验;相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其将交互式网页导航建模为可回溯状态空间探索的机制,但摘要尚不足以核对性能提升的幅度,也不能将这里的状态空间等同于神经序列建模中的 State Space Models。

9月22日周五
  1. OpenReview · EEG75

    DeWave:用于 EEG 到文本翻译的 EEG 波形离散编码

    基于摘要分析。DeWave 研究开放词汇 EEG 到文本翻译,针对现有方法依赖眼动注视或事件标记进行词级分割的问题,提出通过离散 EEG 编码与预训练语言模型对齐的框架,并探索不依赖词级顺序标记的整段信号翻译。 核心机制是使用量化变分编码器生成离散 codex 表征,再将编码序列与预训练语言模型对齐。作者认为,文本–EEG 对比对齐训练能够缓解眼动注视顺序与词语顺序不一致的问题,而具有不变性的离散 codex 可减少个体 EEG 差异带来的干扰。摘要未提供量化实现、损失函数、训练阶段或语言模型名称,上述机制的具体实现及各模块贡献尚未验证。 作者报告,在 ZuCo Dataset 上,DeWave 达到 41.35 BLEU-1 和 33.71 Rouge-F,对应此前基线分别为 40.1 和 31.7。摘要未交代这一比较的被试内或跨被试协议、数据划分与基线名称,因此不能据此判断跨被试泛化能力。另在不使用词级顺序标记的整段 EEG 翻译条件下,作者报告 20.5 BLEU-1 和 29.5 Rouge-1。两组结果的输入条件不同,且 Rouge-F 与 Rouge-1 的指标表述不同,不宜直接作等价比较。 阅读全文时需核对离散表征的不变性如何约束与评估、训练和推理各自依赖哪些文本或事件信息,以及整段信号的切分与对齐方式。被试数量、实验划分、消融、统计信息和复现资源尚未验证。摘要中的结果不能直接证明系统已具备自由表达场景下的实时 BCI 能力;作者关于整段翻译的“首次”主张也尚未独立核验。

    阅读价值:值得阅读的具体原因是 DeWave 将离散 EEG 编码与预训练语言模型对齐,并报告了不依赖词级顺序标记的整段 EEG 到文本翻译结果;其对跨被试差异的缓解程度及推理条件仍需全文核验。

9月20日周三
  1. OpenReview · EEG72

    BELT-2:面向多任务脑解码的 EEG—语言表征自举对齐

    BELT-2 研究如何将 EEG 表征与语言表征对齐,并连接大语言模型(LLMs)以支持多任务脑解码;核心方法结合 BPE 级对齐、多任务 EEG 编码器与 prefix-tuning。基于摘要分析,未取得论文全文。 技术机制方面,作者采用 byte pair encoding(BPE)级 EEG—语言对齐,并在 EEG 领域联合进行多任务训练与解码;随后利用 EEG 编码器的中间输出,通过 prefix-tuning 连接 LLMs。该设计将 EEG 表征学习与语言生成接口结合,但摘要未说明 EEG 与 BPE 单元的对应构造、对齐损失、多任务的具体组成、LLM 型号,以及训练时哪些模块冻结或更新,相关细节尚未验证。 结果方面,作者报告在 ZuCo 数据集上获得 BLEU-1 为 52.2% 的解码结果,但摘要未提供数据划分、被试内或跨被试协议及对照基线,因此不能据此判断跨被试泛化能力。作者还报告在其他翻译基准上提升 31%–162%,但未明确基准名称、指标、对照方法及提升的计算口径,不能将其解释为准确率或百分点提升。作者声称该方法能够从非侵入式脑信号解码连贯、可读的句子,并声称相关设计具有首次性;这些主张尚需正文与既有工作核对。 复现时需核对 EEG 预处理、EEG—文本配对方式、训练与测试划分、多任务监督来源,以及文本生成阶段是否使用额外文本条件。尤其应区分 EEG 提供的信息与 LLM 语言先验对生成质量的贡献;摘要不足以确定这一贡献分解。实验协议、消融及统计信息尚未验证。摘要称代码可通过匿名链接获取,但当前材料未给出该链接,代码可访问性与复现条件尚未验证。

    阅读价值:值得阅读的具体原因是 BELT-2 将 BPE 级 EEG—语言表征对齐、多任务训练与 LLM prefix-tuning 结合,可用于考察语言先验与 EEG 表征对文本解码的各自贡献,但其评估协议与提升幅度仍需全文核对。

1月1日周日
  1. OpenReview · Representation learning76

    面向信息检索的多变量表征学习

    基于摘要分析。本文研究信息检索中的稠密检索问题,提出将查询与文档分别表示为多变量分布,而非单一向量,并以负多变量 KL 散度计算相似度。主要贡献是将分布表征引入检索框架,并提供理论基础及高效检索的兼容性论述。 核心机制:常见稠密检索使用双编码器生成查询与文档向量,再以点积计算相似度。本文为简化计算并提高效率,假设表征服从多变量正态分布,训练大型语言模型输出均值与方差向量。由此,匹配依据从向量点积转为分布间差异。摘要未说明 KL 散度的方向、具体训练损失、方差约束及近似最近邻算法的适配细节,这些均需核对全文;不能直接将预测方差解释为经过校准的不确定性。 结果与证据边界:作者报告在多个数据集上开展广泛实验,相较有竞争力的稠密检索模型取得显著改进,并称该框架可无缝整合到现有近似最近邻算法中。摘要未提供数据集名称、划分、指标、具体基线、提升幅度或统计检验,因此无法判断收益大小及适用范围。实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设分布表征能够描述 EEG 片段在嵌入空间中的变异,则可探索以分布匹配替代点积,用于 EEG 片段检索;这不是原论文验证的任务。可复用的是均值、方差输出及分布相似度计算,需改造的是文本编码器、EEG 输入处理和训练配对方式,原文监督方式与所需规模尚未验证。低信噪比、跨被试及通道差异可能使方差主要反映噪声,小数据下也可能估计不稳定。一个可检验的小实验是在固定被试内数据划分、编码器和训练预算下,对比向量点积与分布匹配的同类 EEG 片段检索性能,并检验方差输出是否带来稳定收益。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其以分布表征和负多变量 KL 散度替代向量点积的检索机制,以及与近似最近邻检索兼容的理论依据;其对 EEG 表征的价值尚未验证。