PlaySuite:交互式视觉智能的大规模基准
PlaySuite: A Large-Scale Benchmark for Interactive Visual Intelligence
基于摘要分析。PlaySuite 针对静态感知与推理基准难以衡量模型在动态环境中长期行动能力的问题,提出以开源视频游戏为载体的交互式视觉智能评估基准,贡献包括跨游戏闭环交互框架与标准化游戏进度评判协议。 基准收录来自 PyWeek 和 itch.io 的超过 5K 款开源游戏,涵盖不同类型及 Pygame、HTML5、Godot、Unity 等引擎。作者认为,这些独立游戏对当前模型大多属于分布外内容,可降低依赖记忆中的攻略或网络训练材料取得成功的可能性;这一判断不等于已经排除训练数据重叠,具体核查方式尚未验证。 技术上,作者构建了面向 HPC 集群优化的统一闭环交互框架,以支持异构游戏的规模化评估,并采用 Video-LLM-as-a-judge 协议,将可观察的游戏里程碑映射为标准化进度等级。该设计将评估重点从单次视觉问答转向持续行动与目标推进。摘要未提供动作接口、观察频率、交互预算、等级定义或评判模型与人工标注的一致性,这些条件需结合全文核对。 在该游戏评估框架下,作者报告对十四个近期开放模型进行了测试,覆盖视觉语言模型、计算机使用智能体和视觉语言动作模型;结果显示,模型虽具备较强推理能力,仍难以持续推进游戏,并反复出现空间定位、动作执行和自我纠正失败。摘要未给出具体进度分数、模型间差异及统计信息,因此不能据此比较模型优劣。实验协议、消融及统计信息尚未验证。 该研究的主要对象是动态视觉环境中的通用模型,而非 EEG 解码或 BCI。平台推测(待验证):其闭环进度评估思路可能为交互式 BCI 的任务完成度评价提供参考,但这不构成神经信号建模方法或 BCI 有效性的证据,已有 EEG 相关工作尚未检索确认。复现需核对游戏版本与运行依赖、模型配置、动作预算、里程碑规则及评判模型配置;摘要不足以确认这些资源的具体开放情况。
值得阅读其跨游戏闭环评估与进度判定设计,以核对静态推理能力与持续交互表现之间的差距,但评判协议的可靠性及其对 BCI 的适用性尚未验证。
来源:arXiv · 多模态与生成机制 · arxiv.org