跳到正文
10月8日周四
  1. arXiv · 在线与高效推理80

    告诉机器人不要做什么:否定理解视角

    基于摘要分析。研究关注 vision-language-action models(VLAs)如何在完成机器人操作目标的同时,遵守自然语言指令中的明确排除约束。作者提出参数高效、即插即用的 NegaAlign,通过图像—语言监督扩展预训练 VLA 的否定指令理解能力,并提出用于评估此类操作的仿真基准 NegaBench。 机制方面,NegaAlign 在视觉—语言骨干的选定层插入 Negation Transformation Layers,以重塑中间指令表征;同时使用教师引导的对齐机制,对齐与指令相关的视觉 tokens,从满足否定约束的指令中迁移动作相关的 grounding。训练监督由现有示范构建,仅更新插入层,所有预训练参数均冻结,包括动作生成器。摘要未提供教师构建方式、具体损失、插入位置及监督样本生成细节,这些内容尚未验证。 作者报告,NegaBench 覆盖五个领域的 10 个仿真场景,在 GR00T、π_0 和 π_{0.5} 上均观察到否定指令执行改善。其中,具有 11.6M 可训练参数的 NegaAlign 将 π_{0.5} 在 NegaBench 上的否定指令成功率从 2.60% 提升至 88.45%,在真实世界任务中从 12.4% 提升至 88.8%,并保留肯定指令上的性能。两组成功率对应不同评估环境,不宜直接横向比较;数据划分、真实任务数量、成功判据、对照配置、消融及统计信息尚未验证。 平台推测(待验证):该方法可为带自然语言约束的 BCI 辅助机器人控制提供参考,但其监督依赖图像、语言与机器人示范,并非直接面向 EEG 解码。若引入 BCI 系统,可考察冻结动作模型的约束适配模块,但需改造脑信号到指令或控制意图的接口;低信噪比、跨被试差异及小数据可能使意图误差传递为约束执行错误。一个可检验的小实验是在固定机器人任务中比较正确指令与含受控解码错误的指令,分别测量任务成功率和约束违反率。相关 EEG/BCI 工作尚未检索确认。

    阅读价值:值得阅读的是 NegaAlign 如何仅用图像—语言监督、冻结动作生成器来改善否定指令执行;作者报告的较大成功率提升仍需结合 NegaBench 的划分、对照与真实机器人评估协议核对。

10月5日周一
  1. arXiv · 架构与算子76

    GNN-CB:用于人类与 LLM 评估的图神经网络竞赛基准

    基于摘要分析。该研究关注 LLM 能否在真实竞赛约束下自主完成端到端 Graph Neural Network(GNN)编程任务,提出面向人类与 LLM 的竞赛基准 GNN-CB。其贡献是将多种图学习任务纳入统一自动评估流程,并提供可复现执行管线;作者将其称为首个此类竞赛基准,该优先性尚未独立核验。 任务与协议:GNN-CB 包含 18 个经过整理的竞赛,覆盖节点级、边级和图级预测,以及不同图类别、领域和难度层级。提交通过隐藏测试集与标准化评分进行评估。人类参与者在受控竞赛约束下完成任务;LLM 使用固定的零样本提示协议,采用 plan-then-code 范式,并允许次数受限的 execute-and-repair 循环。同一协议还支持非智能体与自主智能体评估,但摘要未说明其工具权限、执行预算及具体差异。 结果:作者报告,在所评估协议下,LLM 很少达到 Human Top 表现,且跨竞赛表现较不稳定;没有单一模型在所有任务上占优,LLM 在少数竞赛中获胜,而人类在多数任务上保持最高分。摘要未提供模型名单、各任务指标、分数或重复运行统计,因此不能量化差距,也不能将这些结论推广到其他提示与资源预算。具体数据集、训练与测试划分、人类参与者构成、消融及统计信息尚未验证。 复现与适用范围:作者表示已公开基准及评估框架,并提供自动评估基础设施、动态排行榜和可复现执行管线;环境依赖与版本固定方式仍需核对。该材料评估的是图学习编程能力,而非 EEG/BCI 任务效果。平台推测(待验证):其隐藏测试与受限执行协议可作为未来 EEG 图学习编程评估的设计参考,但需另行定义被试划分、图构建规则和工具预算,不能据此推断 LLM 具备跨被试建模能力;已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其隐藏测试集、统一评分及受限执行修复协议如何支持人类与 LLM 的 GNN 编程能力比较,但具体公平性与可复现性仍需核对全文。