跳到正文
OpenReview · State space models·· 2026-08-21精选AI 评分82

看我所需,梦我所想:基于自构建表征空间的导航基础模型

See What I Need, Dream What I Want: A Navigation Foundation Model on a Self-Constructed Representation Space

AI 导读

基于摘要分析。研究针对视觉导航策略受视觉基础模型预训练表征限制的问题,提出 RepresentNav:由导航策略自身目标塑造表征空间,并在每次动作前预测下一时刻场景的潜在表征。主要研究对象是视觉导航与机器人控制,而非 EEG/BCI。 核心机制:Representation Residuals 是一个紧凑的三层 transformer,对多个互补视觉基础模型全深度的特征进行注意力聚合,使策略学习各层特征的任务相关权重。在这一空间中,latent chain-of-thought 生成未来场景表征;预测模块与策略按 joint-embedding predictive architecture(JEPA)端到端联合训练,使用下一表征预测损失及针对预测目标的正则项。具体损失形式、目标构造和训练配置尚未验证。 作者报告,RepresentNav 在 VLNVerse、VLN-CE R2R、EVT-Bench 及两个点目标导航基准上取得优于此前方法的结果,并将收益扩展到杂乱环境和有行人移动的实体机器人场景。在 VLNVerse 细粒度基准上,作者报告成功率为 83.80%,较此前最佳方法提高 20.05 个百分点;在 EVT-Bench distracted tracking 任务的单摄像头条件下,作者报告结果为 85.5%,但摘要未明确该数值的指标名称。 作者报告,在使用相同编码器的对照中,自构建表征优于直接拼接编码器输出,且学习到不均匀的层权重;加入潜在预测后,碰撞减少四分之一,具体评估协议尚未验证。作者还报告,单个预测潜变量可解码出未来场景的深度、语义与 3D 占据信息,尽管占据信息未被监督,其预测仍优于对真实未来帧应用预训练编码器的结果;潜在 rollout 可跟踪机器人随后一秒的运动。这些结论仍需核对解码器训练、比较协议、消融及统计信息。 平台推测(待验证):任务驱动的多编码器跨层聚合和潜在时序预测可能对应 EEG 表征与下游任务不匹配的问题,但需改造视觉输入、时序目标及通道处理,且低信噪比、跨被试漂移和小数据可能使预测偏向无关变化。可先固定 EEG 编码器,比较输出拼接与跨层聚合在相同跨被试划分下的效果,再单独检验潜在预测的增益;这不是已证实的 BCI 效果,已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对任务目标驱动的跨层视觉表征与 JEPA 潜在预测如何共同改善导航,摘要提供了同编码器表征对照及碰撞分析,但其 EEG/BCI 适用性尚未验证。

来源:OpenReview · State space models · openreview.net