其他车辆轨迹也不可或缺:在视频潜空间中统一自车与其他车辆轨迹的驾驶世界模型
Other Vehicle Trajectories Are Also Needed: A Driving World Model Unifies Ego-Other Vehicle Trajectories in Video Latent Space
基于摘要分析。本文研究自动驾驶仿真中的多车辆轨迹控制问题,提出 EOT-WM,将自车与其他车辆轨迹统一到视频潜空间,以生成受多车辆轨迹共同引导的驾驶视频。其主要贡献是尝试突破既有世界模型侧重自车轨迹、其他车辆不可控的限制,使仿真能够表达自车与周围车辆的交互。 核心机制:模型先将鸟瞰视角(BEV)空间中的自车及其他车辆轨迹投影到图像坐标,通过像素位置匹配车辆与轨迹;随后使用 Spatial-Temporal Variational Auto Encoder 编码轨迹视频,使其在统一视觉空间中与驾驶视频潜变量进行时空对齐;最后通过注入轨迹信息的 diffusion Transformer 对含噪视频潜变量去噪,生成轨迹引导的视频。摘要未说明具体注入方式、训练损失或推理配置,这些内容尚未验证。 评估与结果:作者在 nuScenes 数据集上开展实验,并提出基于控制潜变量相似度的指标,用于评估轨迹可控性。作者报告,相对其所比较的最先进方法,FID 和 FVD 分别改善 30% 和 55%;摘要未提供基线名称、绝对指标值、数据划分及评估设置,因此不能与其他协议下的结果直接比较。作者还报告模型可利用自行产生的轨迹预测未见驾驶场景,但“未见”的具体划分与轨迹生成方式尚未验证。 阅读与复现重点是核对车辆—轨迹匹配在遮挡及投影误差下的可靠性、潜空间对齐与轨迹注入各自的贡献,以及控制潜变量相似度是否反映实际车辆运动的遵循程度。完整实验协议、消融及统计信息尚未验证,代码与复现条件也未由所给材料确认。本文的主要研究对象是自动驾驶视频生成,并非 EEG 或 BCI;其依赖 BEV 轨迹、图像坐标及驾驶视频之间的几何对应,当前材料不足以建立具体的 EEG 迁移路径,不提出 BCI 复现实验建议。已有 EEG 相关工作尚未检索确认。
值得阅读其多车辆轨迹与视频潜变量的时空对齐机制,以及轨迹可控性评估方法;摘要报告的生成质量提升仍需结合完整评估协议核对,不能据此推断 BCI 有效性。
来源:OpenReview · State space models · openreview.net