跳到正文
arXiv · 多模态与生成机制· Yuxin Liu; Yuxuan Wang; Zhenxin Lei; Lingchen Meng; Yuchong Sun; Junming Lin; Hongcheng Liu; Yunfei Chu; Qize Yang; Jin Xu; Lei Zhang; Zhendong Mao·· 5 天前精选AI 评分77

MMPostTrainBench:多模态后训练自主研究基准评估

MMPostTrainBench: Benchmarking Autonomous Research for Multimodal Post-Training

AI 导读

基于摘要分析。本文研究 LLM agents 能否通过迭代实验与反馈持续改善多模态模型,提出 MMPostTrainBench 基准,并针对能力退化与候选选择问题提出 MMResearch 框架。贡献侧重于评估自主研究过程,而非仅比较最终模型的目标任务表现。 MMPostTrainBench 包含八项任务,覆盖图像、音频、视频、联合音视频理解及图像驱动的软件修复。agents 从共同基础模型出发,在固定预算内利用开发阶段反馈开展研究,提交模型后接受独立评估。评估同时考察目标与非目标任务表现、迭代改善、模型选择和研究诚信;具体任务数据、预算单位、数据划分及诚信判定规则尚未验证。 作者报告,在上述八项任务的评估中,52.1% 的“模型—任务”均值低于基础模型,提交模型还出现非目标任务能力退化。作者报告,模型表现未随研究迭代稳定改善,最终提交模型相较于已评估的最佳候选最多落后 5.38 个百分点;摘要未说明该差距对应的具体任务和指标。作者将多模态自主研究的额外困难归结为感知、跨模态对齐及时间定位中的错误。 MMResearch 将基于媒体的证据连接到研究假设与干预,通过层级记忆跨轮次保留发现,并利用开发阶段评估保留候选模型。作者报告,将其加入现有代码 agent 运行环境后,Claude Opus 4.8 配合 Claude Code 的提交模型 Accuracy 最高提高 7.75 个百分点,GPT-5.6-sol 配合 Codex 最高提高 2.33 个百分点。具体任务、对照配置、重复实验、消融及统计信息尚未验证,不能将这些最高增益视为跨任务平均收益。 平台推测(待验证):其过程评估与候选保留机制可能用于 EEG 自动化建模研究,但多模态任务上的收益不等于 EEG/BCI 收益;相关 EEG 工作尚未检索确认。迁移时需另行核对被试隔离、开发反馈使用范围和低信噪比下候选选择的稳定性。

阅读价值

该基准将多模态自主研究中的目标任务收益、非目标能力退化与候选模型选择分开评估,值得核对其预算控制和独立评估协议,但摘要不足以确认其对 EEG/BCI 的适用性。

来源:arXiv · 多模态与生成机制 · arxiv.org