跳到正文
OpenReview · State space models·· 23 天前精选AI 评分77

Jᴿ-Space:语言模型行为引导的递归细化与解释

Jᴿ-Space: Recursive Refinement and Interpretation of Language Model Steering

AI 导读

基于摘要分析。该研究针对语言模型的激活引导:加性干预会改变模型内部状态,因此原有固定引导向量可能仍有改进空间。作者提出 Jᴿ-Space,在当前干预状态下递归更新引导向量,并利用词表索引的 Jacobian 字典分析可进一步改变模型行为的修正方向。 核心机制是在每轮校准中重新计算行为梯度,将其投影到与此前使用方向相离的空间,再从词表索引的 Jacobian 字典构造稀疏、带符号的修正。它区别于一次性构造固定向量的思路,在于根据干预后的状态重新估计修正方向,同时利用历史方向约束更新。校准完成后的向量在部署时保持固定,不需要测试时梯度;摘要未提供梯度目标、字典构建方式、稀疏化规则或具体更新公式。 作者报告,在两个模型家族、50 项行为任务及完整答案形式的 TruthfulQA 评估中,该框架能够改善多种起始引导方法。摘要提及对梯度重计算、更新分阶段处理和历史方向投影的消融,但未给出具体模型、基线、数据划分、增益数值或统计结果,因而尚不能判断改善幅度及不同条件下的稳定性。 解释分析使用同一字典,按 token 方向与修正梯度的对齐程度进行问题级排序。作者报告,在七项行为任务中观察到与任务相关的词汇结构,个别案例中梯度匹配的符号与相对目标的语义含义一致。这支持一种基于词表的方向诊断视角,但尚不足以将方向对齐视为普遍成立的因果解释。 复现需核对校准数据与评估数据的关系、干预位置及强度、递归轮数、字典计算成本和诊断稳定性;实验协议、消融及统计信息尚未验证。原论文主要研究对象是语言模型行为引导,并非 EEG 或 BCI;摘要没有提供直接迁移证据,已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读的具体原因是,该方法将固定激活引导向量的递归校准与词表方向诊断结合,且部署时无需测试时梯度;其增益幅度与解释可靠性仍需全文核对。

来源:OpenReview · State space models · openreview.net