跳到正文
10月6日周二
  1. arXiv · 泛化与分布偏移81

    有害 SFT 在 LLM 检查点更新中留下连续痕迹

    基于摘要分析。该研究考察监督微调(SFT)优化的目标行为能否直接从 LLM 检查点更新中读取,而不必运行模型进行行为测试。作者提出 TRACE,通过未知检查点更新相对于有害与非有害参考原型的位置,输出连续的有害目标分数,无需查询待审计模型或访问其未知 SFT 数据。 核心机制是以纯有害服从、安全目标和良性效用 SFT 定义参考几何,分析检查点更新空间中的目标相关排序。作者报告,在四个 7–8B 主干模型的受控有害目标组成实验中,检查点级坐标 s_H 与目标组成的 Spearman 相关系数为 0.986–0.992,并报告该排序在更大模型规模上仍然存在;摘要未提供这些更大模型的具体规模及对应数值。 对照方面,作者报告,匹配的服从与拒绝训练对照支持该痕迹反映 SFT 目标,而非仅反映接触有害输入;其他对照用于排除有害样本数量或一般训练强度的简单解释。作者还报告,在分布偏移、未见数据、不同 SFT 配置、部分检查点访问以及 LoRA/全参数微调条件下,该痕迹保持稳定,并与独立测得的攻击成功率正相关;低有害目标比例下也仍具有信息量。各条件的具体划分、对照基线、分数及不确定性尚未验证,不能据此量化部署可靠性。 阅读与复现需重点核对参考原型的构建和冻结方式、未知更新与参考更新的兼容条件、部分权重访问的采样范围,以及审计分数与行为风险之间的校准关系。摘要提供代码地址,但代码内容与可运行性尚未验证;实验协议、消融及统计信息尚未验证。该工作研究的是 LLM 权重审计,并非 EEG/BCI 方法;其结果不构成已验证的 BCI 迁移证据。

    阅读价值:值得核对其目标匹配对照与参考几何构建:作者报告仅凭 checkpoint 更新即可识别有害服从 SFT 的目标组成,为行为评估不可用或覆盖不足时提供互补审计信号,但参考原型依赖及跨设置可靠性尚需全文验证。

12月31日周三
  1. OpenReview · State space models75

    基于状态空间的语言模型的可控性分析

    基于摘要分析。该研究针对 Mamba 等状态空间模型(SSMs)内部动态难以解释的问题,提出基于可控性的 Influence Score,用于衡量位置 k 的 token 对后续状态和输出的影响,并通过不同 Mamba 变体的诊断实验考察其表现。 机制上,Influence Score 由 Mamba 的离散状态空间参数导出,通过类似系统可观测性分析的反向递推计算。它提供的是内部影响强度的诊断视角,而非摘要中已证明的任务性能或因果贡献指标;具体定义、计算代价及状态影响与输出影响的关系尚需全文核对。 作者在 mamba-130m、mamba-2.8b 和 mamba-2.8b-slimpj 上开展六类实验,分别考察温度、提示复杂度、token 类型、层深、token 位置和输入扰动。作者报告:在这些模型与实验条件下,Influence Score 随模型规模和训练数据增加而提高;模型呈现近因偏置,影响集中于中后层;在所比较变体中,mamba-2.8b-slimpj 特有地更重视内容词,并在噪声存在时降低内部影响。摘要未提供定量分数、样本构成及统计不确定性,规模与训练数据效应是否被独立区分,以及实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 序列模型采用可访问离散状态空间参数的 Mamba,该递推诊断机制或可用于分析不同时间片对后续状态与任务输出的影响。可复用部分是参数驱动的影响计算;需改造部分包括 EEG 时间片或通道的 token 化方式、输出定义及跨被试比较中的尺度校准。低信噪比可能使内部影响反映伪迹而非有效神经信息,被试差异、通道配置和小数据训练也可能削弱解释稳定性。一个可证伪的小实验是在固定被试内划分的 EEG Mamba 模型上,比较高、低 Influence Score 时间片受等强度扰动后的输出变化,检验分数能否预测扰动敏感性;这不等同于验证生理因果性。已有 EEG 相关工作尚未检索确认。复现语言模型结果仍需核对分数公式、层间汇总方式、提示与扰动设置及实现材料。

    阅读价值:值得阅读的具体原因是作者提出了可从 Mamba 离散状态空间参数计算的 token 影响诊断指标,可用于核查位置与层深相关的内部动态,但其解释效度及向 EEG 的迁移价值尚未验证。

11月1日周四
  1. OpenReview · Representation learning68

    统计流形上的潜在主题文本表征学习

    基于摘要分析。该研究针对文本表征中词语语义相似性与主题多样性难以兼顾的问题,提出 Latent Topic Text Representation Learning,将文本表示为潜在主题的混合,并利用统计流形度量文本距离以支持分类。 核心机制是:假设同一主题下的词语服从高斯分布,将文本建模为多个主题组成的 Gaussian mixture model。相比摘要讨论的词向量平均表示,该方法试图保留文本内部的主题多样性,而不只用单一平均向量概括文本。统计流形用于比较这种分布型表征,但摘要未说明具体距离、主题估计方式、混合成分选择或训练与推理流程,不能据此确定所用算法。 作者报告,文本表征、分类及 topic coherence 实验支持该方法的有效性。摘要未提供数据集、数据划分、对照基线、指标数值或运行时间,因此尚不能量化效果提升,也不能确认其效率优势。实验协议、消融及统计信息尚未验证。 平台推测(待验证):其可迁移思路是将复杂样本表示为多个潜在状态的分布混合,再比较分布而非仅比较均值。原方法依赖可用于高斯建模的词语数值表征与主题混合结构;若 EEG 特征窗口存在可分辨的潜在状态,该机制或可用于保留非平稳活动的多状态信息。可复用的是混合分布表征与统计流形距离,需改造的是 EEG 特征提取、时间窗口、成分估计及通道对齐。低信噪比、小样本、跨被试差异和通道变化可能使混合成分不稳定,且高斯假设未必适用。一个可检验的小实验是在固定 EEG 特征与被试内划分下,对比均值表征和混合分布表征,检查分类表现及成分稳定性;这只是迁移假设,不是本文已验证结果。相关 EEG 工作尚未检索确认。