跳到正文
OpenReview · State space models· Fei Gao; Yuhao Lin; Jiaqi Shi; Maoying Qiao; Nannan Wang·· 2024-07-21精选AI 评分71

AesMamba:基于状态空间模型的通用图像美学评价

AesMamba: Universal Image Aesthetic Assessment with State Space Models

AI 导读

基于摘要分析。本文研究如何用统一框架覆盖图像美学评价(Image Aesthetic Assessment,IAA)中的不同输入、评价目标与个性化需求,提出模块化框架 AesMamba。其主要研究对象是图像美学评价,而非 EEG 解码或 BCI。 核心机制包括四部分:使用 Visual State Space Model(VMamba)替代 CNN 或 ViT,学习美学相关属性表征,作者将这一选择归因于其能够高效获得全局与局部有效感受野;利用模态自适应模块,根据输入类型整合表征;在预测模块中引入 Multitask Balanced Adaptation(MBA),增强任务特定特征并关注尾部实例;将用户的匿名个体特征转化为文本提示,把个性化 IAA 建模为多模态学习问题,借助特征语义推断个人偏好。各模块可灵活组合以适配不同 IAA 任务,但摘要未给出具体损失、训练流程或模块实现。 作者报告,在多个数据集和各类 IAA 任务上,AesMamba 相比此前 SOTA 方法取得更优或有竞争力的表现。摘要未列出数据集名称、划分协议、指标或具体数值,不能据此判断各任务的提升幅度,也不能比较不同协议下的结果。作者提供了代码仓库链接,但代码完整性、实验协议、消融及统计信息尚未验证。 平台推测(待验证):可供 EEG 方法研究参考的是状态空间表征与任务、模态适配的模块化组合,而非图像美学预测结果本身。迁移假设是,局部与全局依赖建模可能对应 EEG 的短时波形及较长时间依赖;但原方法依赖视觉或多模态输入及美学评价目标,迁移时需改造 EEG 输入编码、时空扫描方式和预测头,不能直接把用户特征提示视为有效的被试适配机制。低信噪比、通道差异、跨被试分布变化和小数据规模都可能削弱效果。一个可检验的小实验是在固定 EEG 数据划分与训练预算下,比较状态空间编码器与匹配基线,并单独检验任务适配模块是否带来稳定增益。相关 EEG 工作尚未检索确认。

阅读价值

值得阅读的是 AesMamba 如何通过模态自适应、任务平衡适配和用户特征提示统一不同图像美学评价任务;作者报告的性能优势及这些模块对 EEG 的适用性仍需分别验证。

来源:OpenReview · State space models · openreview.net