VEDIT:用于流程视频表征学习的潜在预测架构
VEDIT: Latent Prediction Architecture For Procedural Video Representation Learning
基于摘要分析。VEDIT 研究流程视频中的未来动作预测与流程规划,核心贡献是在现成的冻结预训练视觉编码器之上训练预测模型,直接利用片段级潜在表征,而不依赖预测模型预训练或额外的语言、ASR 监督。这里“不预训练预测模型”不等于无需训练,也不等于视觉编码器未使用预训练。 机制上,模型以已观察步骤的冻结片段级嵌入为条件,预测未观察步骤的动作,并借助 diffusion transformers 的迭代去噪学习预测表征,而非从像素空间学习。摘要未给出编码器名称、预测目标的具体表示、损失形式或去噪调度,这些实现细节尚未验证。 作者报告,在 NIV、CrossTask、COIN 和 Ego4D-v2 四个数据集、共五项流程学习任务上,模型达到或提升现有最佳表现:长时程动作预判的 Verb ED@20 与 Noun ED@20 分别报告 +2.6% 和 +3.1%;步骤预测与任务分类分别报告 +5.0% 和 +3.8%;流程规划的 success rate、mAcc、mIoU 最多分别提升 +2.28%、+3.39% 和 +0.90%。这些均保留摘要原始增幅写法;其对应数据集、具体基线、数据划分、指标方向,以及百分比是否指百分点,尚未验证,不能据此跨任务直接比较。实验协议、消融及统计信息尚未验证。 平台推测(待验证):可迁移的假设是,用冻结 EEG 编码器的片段表征替代视觉嵌入,以迭代去噪预测未来神经状态,探索减少预测模块预训练需求。原方法依赖有步骤结构的视频序列及可用的预训练表征;EEG 未必具有同样清晰的步骤边界。可复用的是潜在空间条件预测思路,需改造的是编码器、时间分段和预测目标;低信噪比、跨被试差异、通道变化及小数据可能使冻结表征丢失有效信息或导致去噪模型过拟合。一个可检验的小实验是在固定 EEG 编码器和相同被试内划分下,对比迭代去噪预测器与直接回归预测器的未来片段表征误差,再独立评估跨被试表现;结果不能直接视为 BCI 解码收益。相关 EEG 工作尚未检索确认。
值得核对其冻结视觉编码器与潜在空间迭代去噪预测的组合,是否能在不预训练预测模型、不增加语言或 ASR 监督的条件下支持多种流程预测任务;其 EEG 迁移价值尚未验证。
来源:OpenReview · Representation learning · openreview.net