跳到正文
热点事件观察中

ReSI:递归安全改进与能力保留

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

基于摘要分析。ReSI研究模型更新、攻击演化下如何修复已知漏洞并应对未见风险。每轮以多种红队方法发现漏洞、开发训练配方,再从通过能力保留Pareto门控的候选中选择安全收益最大的更新。 作者报告,在四个涵盖稠密与混合专家架构的模型上,分布内外安全表现达到或超过受评估前沿模型,且大体保留通用能力;平均X-Teaming攻击成功率由86.01%降至31.45%,对照GPT-5.6-Luna为56.69%。作者将其解释为对训练未见攻击的韧性增强。 本次新增材料提供上述框架与摘要结果,未提供可核对的版本差异。平台分析:攻击成功率不能替代整体安全或能力指标;模型身份、攻击预算、训练评估隔离、门控阈值、消融及统计信息尚未验证,代码资源未确认。摘要无EEG/BCI实验证据。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv · 架构与算子精选
    ReSI:面向具有已知威胁抵抗力与未知风险韧性的 AI 的递归安全改进

    基于摘要分析。研究针对模型持续更新及红队攻击不断演化时,安全对齐如何适应新检查点、修复已知漏洞并泛化至尚未暴露风险的问题,提出通过自动化研究运行的递归安全改进框架 ReSI。其核心贡献是将漏洞发现、训练配方开发和更新筛选组织为多轮循环,而非仅进行一次性安全对齐。 机制上,每轮 ReSI 使用多种红队方法识别当前目标模型的漏洞,开发训练配方,并在通过能力保留 Pareto 门控的候选更新中,选择安全收益最大的更新作为下一轮目标模型。摘要沿用 R²AI 的概念,将对已知威胁的抵抗能力称为 resistance,将对未预见风险的应对能力称为 resilience。具体训练目标、配方搜索方式、门控阈值与迭代停止条件尚未验证。 作者报告,在四个稠密模型与 mixture-of-experts 模型组成的评估范围内,ReSI 在分布内和分布外安全基准上达到或超过受评估的前沿模型,在几乎全部安全评估上优于对齐基线,同时大体保留通用能力。作者报告,四个模型的平均 X-Teaming 攻击成功率从 86.01% 降至 31.45%,低于摘要所列 GPT-5.6-Luna 的 56.69%;作者将该结果解释为对训练期间未见攻击具有更强韧性。这里的指标是攻击成功率,不能替代通用能力或其他安全指标;模型身份、攻击预算、训练与评估攻击的隔离方式、平均值计算及对照条件仍需正文核对。 复现重点是红队方法及其覆盖范围、候选配方生成过程、每轮训练与评估成本,以及 Pareto 门控如何防止以能力退化换取安全收益。实验协议、消融及统计信息尚未验证,代码与复现资源亦未由所给材料确认。该研究直接面向 AI 安全对齐,摘要未提供 EEG/BCI 任务证据,不应将其结果解释为神经信号建模性能改进。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。