Persona Cartography:在权重空间中绘制语言模型人格特质
Persona Cartography: Charting Language Model Personality Traits in Weight Space
基于摘要分析。本文研究大语言模型反复表现出的行为模式(persona)如何被分解、测量和控制,提出以 OCEAN 人格特质描述模型行为,并通过训练低秩适配器,在权重空间中增强、抑制和组合不同特质。研究对象是语言模型的行为控制与安全,而非脑信号解码或 BCI。 核心机制是为 Openness(开放性)、Conscientiousness(尽责性)、Extraversion(外向性)、Agreeableness(宜人性)和 Neuroticism(神经质)建立可调节的特质方向。评估包括经独立众包人类评分者校准的 LLM-judge、特质专用多项选择基准,以及标准能力评估。摘要未披露适配器训练数据、监督构造、具体损失、缩放范围及基准名称,相关实现细节尚未验证。 作者报告,在来自三个模型家族、规模为 4B–32B 的六个模型上,单个适配器随缩放幅度变化,使目标特质大体单调移动;多个适配器的效果近似可加,可用于构建混合 persona;在适度缩放下,模型保持能力基准表现。摘要未提供具体分数、对照基线或统计区间,因此尚不能量化控制精度与能力代价。 作者报告,这些特质方向还影响下游安全相关行为:沿神经质方向调整会改变模型在不可能完成的任务上的受挫表现,组合适配器则改变有害请求顺从与过度拒绝之间的权衡。这支持进一步核对人格测量与实际行为之间的联系,但不等于证明安全性全面改善。 此外,作者探索使用无监督心理测量流程,从合成模型交互轨迹中提取 tone、initiative、didacticism 和 epistemic caution 四个候选行为因子,其中三个在控制对话场景后仍然成立;摘要未说明是哪三个。复现需核对训练与评估划分、人类评分校准流程、场景控制方法、适配器组合协议及权重可用性,实验协议、消融及统计信息尚未验证。材料未建立这些人格方向与 EEG 瓶颈的具体对应关系,不据此提出 BCI 迁移效果或复现实验建议;已有 EEG 相关工作尚未检索确认。
值得关注的是作者将 LLM persona 控制转化为可缩放、可组合的权重空间操作,并用人类评分校准的评估检验行为与安全影响;其与 EEG/BCI 的具体方法对应关系尚未建立。
来源:OpenReview · State space models · openreview.net