ReCast:LLM智能体故障根因定位
先了解这件事
基于摘要分析。ReCast研究LLM智能体中早期错误经交互传播后的根因定位,目标是找出最早导致失败的步骤。作者将冻结LLM的隐藏状态转为归因表征:选择相关层,构建pattern与deviation特征,再以对比和排序目标训练上下文化步骤编码器,并提出ReCast-2K训练数据集。 作者报告四个基准上的Hit@1均最高;在Who&When Algorithm和Handcrafted上,较最强基线分别提升5.65、9.19个百分点。绝对分数、基线身份、被试或样本构成、数据划分及统计不确定性尚未验证。 本次新增材料为arXiv摘要,未提供可核对的版本变化。虽列出代码地址,其内容与可运行性尚未验证;特征定义、标注规则及训练评估关系仍待核对。平台分析:上述证据仅支持智能体故障归因,不能外推为一般推理或EEG/BCI性能提升。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv · 表征与预训练精选ReCast:面向 LLM 智能体系统故障归因的步骤表征学习
基于摘要分析。本文研究 LLM 智能体系统中的故障归因:早期步骤的错误可能经后续交互传播,目标是定位最早导致失败的步骤。作者提出 ReCast,将冻结 LLM 的隐藏状态转换为面向归因的步骤表征,并引入故障归因训练数据集 ReCast-2K。 机制上,作者先通过实证分析考察隐藏状态能否区分根因步骤与其他步骤,报告其可分性有限。ReCast 随后选择与归因相关的层,构建互补的 pattern 与 deviation 特征,再使用以对比目标和排序目标训练的编码器学习上下文化步骤表征。其关注点是让表征适配根因定位,而非直接将原始隐藏状态作为步骤表征;具体层选择准则、两类特征的定义、监督构造与损失形式尚未验证。 结果方面,作者报告 ReCast 在四个基准上取得最高 Hit@1;其中,在 Who&When Algorithm 和 Handcrafted 上,相对最强基线分别提升 5.65 和 9.19 个百分点。这些结果对应智能体故障归因任务,不能解读为一般推理能力或 EEG/BCI 性能提升。摘要未提供绝对分数、基线身份、数据划分及统计不确定性,实验协议、消融及统计信息尚未验证。 复现需核对 ReCast-2K 的样本构成与根因标注规则、训练与评估数据的关系、冻结 LLM 的配置,以及各基准的步骤定义和 Hit@1 计算方式。摘要提供了代码地址,但代码内容及可运行性尚未验证。该方法依赖 LLM 隐藏状态、交互步骤结构及归因训练数据;目前材料不足以建立向 EEG/BCI 迁移的明确机制路径,已有 EEG 相关工作尚未检索确认。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。