跳到正文
arXiv · 架构与算子· Qinghua Xu; Guancheng Wang; Boxi Yu; Liting Lin; Lionel Briand·· 6 天前精选AI 评分78

DreamTest:用于深度强化学习智能体基于搜索的测试的世界模型代理

DreamTest: World-Model Surrogates for Search-Based Testing of Deep Reinforcement Learning Agents

AI 导读

基于摘要分析。DreamTest 研究如何降低信息物理系统中深度强化学习(DRL)智能体的部署前测试成本,提出用世界模型预测测试过程,再从想象回合中估计失败风险,以引导搜索而不必执行每个候选测试。 机制上,既有代理模型将系统视为黑箱,直接预测测试配置的成功或失败;DreamTest 则改造 recurrent state-space model,从智能体训练日志中学习智能体行为与环境动力学。给定候选配置,模型生成想象轨迹并计算失败分数,供搜索选择待验证测试。摘要未说明状态表示、训练目标、轨迹长度及失败分数计算方式,尚不能判断模型如何处理长期误差累积。 作者报告,在 Parking、Humanoid 和 DonkeyCar 上评估失败预测、测试生成与失败多样性时,平均 AUPRC 相对最强基线分别提高 97%、12% 和 39%;在五个分布外测试集上的增益分别达到 145%、29% 和 44%。这些是相对增幅,而非百分点差值,基线绝对分数及分布外划分尚未验证。在相同模拟器验证预算下,最佳“DreamTest + search”组合平均发现的新颖失败分别增加 29%、22% 和 79%;在聚类数 k = 2–40 的分析中,DreamTest 生成的失败在几乎所有 k 下覆盖最多行为簇。具体搜索算法、预算、失败新颖性定义、聚类表示、消融及统计信息尚未验证。 平台推测(待验证):该机制可能用于具有明确动作—反馈回路的闭环 BCI 强化学习控制器压力测试,而非直接改善 EEG 解码。迁移依赖包含观测、动作和反馈的交互日志,以及可验证的失败判据;可复用想象轨迹与搜索框架,但需改造观测模型以处理 EEG 噪声、被试差异和通道变化。小数据及非平稳性可能使模型遗漏真实失败或生成虚假高风险轨迹。可先在固定闭环仿真任务中,以相同验证预算比较世界模型代理与直接成败预测代理的失败发现能力,并核对跨被试条件下的预测可靠性。相关 EEG 工作尚未检索确认。

阅读价值

值得核对其以想象轨迹替代直接成败预测的机制,以及在相同模拟器验证预算下发现更多新颖失败的结果;世界模型误差对搜索可靠性的影响仍需全文验证。

来源:arXiv · 架构与算子 · arxiv.org