跳到正文
arXiv · 架构与算子· Nur A Zarin Nishat; Jens Lehmann; Andrei Aioanei; Sahar Vahdati·· 3 天前精选AI 评分75

小语言模型在抽象推理任务上的系统研究

A Systematic Study of Small Language Models on Abstract Reasoning Tasks

AI 导读

基于摘要分析。该研究考察小语言模型在抽象推理基准上的准确率究竟反映了可迁移规则学习,还是对特定分布规律的拟合。研究使用 ARC-TGI 的可控网格变换任务族,在监督微调条件下比较 decoder-only、encoder–decoder 和 mixture-of-experts 模型,并结合分布外评估与逐层注意力诊断分析能力获取及泛化边界。 评估设计:ARC-TGI 支持重采样、空间偏移和跨基准迁移。作者报告开展了超过 1,000 次运行,考察技能获取的效率与稳定性、模型家族及任务表述的影响,以及训练集深度和广度、额外上下文示例与响应格式的作用。具体模型、训练规模、划分方式、对照基线和指标数值尚未验证。 主要结果:作者报告,在所研究的监督微调与分布内评估条件下,模型可以取得较高准确率,但学习过程对优化设置敏感,不同任务族的能力获取并不均衡。分布外表现明显下降,包括规则保持不变但网格尺度改变的情形;增加训练集深度和广度带来的收益不均,额外上下文示例的效果也随模型家族变化。作者还报告,可执行规则归纳能够得到直接网格生成中未观察到的正确解,提示响应格式会影响对推理能力的判断,但摘要不足以量化其优势。 解释边界:在选定任务上,注意力诊断呈现不同的集中程度与上下文依赖模式;作者明确指出,这些观察不能建立一般性因果机制。阅读全文时应核对任务重采样、尺度变化和跨基准迁移的具体协议,以及优化稳定性、消融和统计信息;这些内容目前尚未验证。研究并未提供 EEG/BCI 证据,不宜将其抽象推理结果直接解释为神经信号建模能力。

阅读价值

值得阅读的是其通过重采样、空间偏移和跨基准迁移,检验抽象推理准确率能否代表可迁移规则学习,并比较直接网格生成与可执行规则归纳的行为差异。

来源:arXiv · 架构与算子 · arxiv.org