AesMamba:基于状态空间模型的通用图像美学评估
AesMamba: Universal Image Aesthetic Assessment with State Space Models
基于摘要分析。本文研究 Image Aesthetic Assessment(IAA,图像美学评估):如何用统一框架,从视觉或多模态输入预测通用或个性化的美学评价及细粒度属性。作者提出模块化框架 AesMamba,通过灵活组合表征学习、模态自适应和任务预测模块,覆盖不同 IAA 任务,而非针对每类输入输出单独设计方法。 核心机制方面,AesMamba 使用 Visual State Space Model(VMamba)替代 CNNs 或 ViTs,学习美学相关属性表征;作者给出的理由是 VMamba 能高效获得全局与局部有效感受野。随后,模态自适应模块根据输入类型生成融合表征。预测阶段引入 Multitask Balanced Adaptation(MBA),增强任务特定特征,并强调尾部实例。摘要未说明尾部实例的具体定义、平衡策略或损失形式,这些实现细节尚未验证。 对于个性化 IAA,作者将用户匿名化的个体特征转换为文本提示,把偏好预测表述为多模态学习问题,利用可灵活选择的特征语义推断个体偏好。这里的用户特征并非 EEG 或其他神经信号,不能据此理解为 BCI 个性化方法。 结果方面,作者报告,在多个数据集、覆盖各类 IAA 任务的实验中,AesMamba 相比此前 SOTA 方法取得更优或具有竞争力的表现;摘要未提供数据集名称、划分、指标、具体数值及对照配置,因此无法判断优势幅度或比较不同任务的结果。实验协议、消融及统计信息尚未验证。摘要提供了已发布代码的声明,但代码完整性、训练配置与复现条件尚未核验。 本文的主要研究对象是图像美学及用户偏好。虽然状态空间表征和模块化多任务设计具有一般方法价值,但当前材料未建立其与 EEG 时序结构、跨被试差异或低信噪比问题的具体对应关系,因此不提出 EEG/BCI 迁移效果或复现实验建议;已有 EEG 相关工作尚未检索确认。
值得阅读的是 AesMamba 如何以模块化设计统一不同输入与输出的图像美学评估任务,尤其是模态自适应融合与面向尾部实例的 MBA;其性能优势仍需结合全文实验协议核对,摘要不构成 EEG/BCI 有效性的证据。
来源:OpenReview · State space models · openreview.net