PAMU:利用 U-Transformer 和 EEG 驱动的多模态控制实现个性化情感音乐生成
PAMU: Personalized Affective Music Generation Using U-Transformer with EEG-driven Multimodal Control
基于摘要分析。本文针对 EEG 驱动情感音乐生成中的跨被试差异,提出个性化自回归框架 PAMU,将 EEG 信号与时间对齐的情感轨迹结合,用于控制符号音乐生成;同时构建 EEG-VA-MIDI 多模态基准,支持动态情感建模与个性化生成研究。 方法分为通用音乐先验学习、多模态适配和新被试个性化三个阶段:先在 AILabs17k 上学习符号音乐先验,再使用训练被试的对齐 EEG—VA—MIDI 数据进行适配。对于每个未见被试,仅用 K 个支持样本更新轻量被试专属适配器,共享生成主干保持冻结。这里的个性化依赖新被试支持样本,不应理解为无需适配的零样本跨被试泛化。摘要未说明 U-Transformer 的具体结构、EEG 编码方式、模态融合机制或训练损失。 EEG-VA-MIDI 在统一实验设置下组织 EEG、符号 MIDI 音乐及具有时间结构的伪效价—唤醒度(VA)轨迹,并采用被试互斥评估。伪 VA 轨迹的来源、时间对齐规则及其与真实情感体验的对应关系尚未验证,这些信息会影响对情感监督与生成可控性的解释。 作者报告 PAMU 改善了情感对齐,并支持参数高效的少样本个性化,但摘要未给出具体指标、数值、对照基线或 K 的取值,因此尚不能判断收益幅度与适配成本。被试数量、支持样本与测试样本划分、实验协议、消融及统计信息尚未验证;阅读全文时需核对 EEG 条件与 VA 轨迹各自的贡献,以及个性化后的情感对齐和音乐质量如何共同评估。 作者表示将在论文接收后、满足适用伦理与隐私要求的前提下公开去标识化数据集;这不代表数据目前已开放,也不能据此推断论文已接收。代码、权重及完整复现条件尚未验证。
值得关注其在被试互斥评估下,以冻结共享生成主干和轻量被试适配器实现 EEG 条件音乐生成个性化的路径,但情感对齐收益及少样本适配成本仍需全文中的指标与对照验证。
来源:OpenReview · EEG · openreview.net