面向 Tiny Transformers 算术推理的算法式草稿与课程分阶段训练
Algorithmic Scratchpads and Curriculum Staging for Arithmetic Reasoning in Tiny Transformers
基于摘要分析。该研究探讨小型自回归 Transformer 如何学习确定性的多步算术,以合成数据训练加、减、乘、除四类运算的逐步 scratchpad,并分析训练基础、计算步骤表达和课程安排对性能的影响。作者报告模型约有 10.6M 非嵌入参数、49.3M 总参数;主要贡献是展示算术步骤分解与训练组织的重要性,同时揭示泛化及持续训练的失败边界。 训练方面,作者报告其 dataloader 序列填充设置产生了 83% 的“梯度饥饿”伪影,使准确率从 40% 降至 1%,连续序列打包可缓解该问题;摘要未明确这些数值对应的运算及评估划分。作者还报告,在其设置中,没有语言预训练时准确率不超过 2.0%;RoPE、RMSNorm、SwiGLU 及 Sparse Mixture of Experts(MoE)相较基线 GPT-2 改善了加法推理,但摘要未给出各组件的独立贡献。 步骤表达方面,作者将确定性的 Digit-by-Digit Long Division scratchpad 与四阶段 Hierarchical Developmental Curriculum 结合,在包含 4,000 道题的留出基准上,将单数字除法 Accuracy 从 4.0% 提升至 86.7%。该提升对应组合设置,尚不能从摘要判断 scratchpad 与课程安排各自的贡献。多位数乘法仍较困难:作者的错误分析指出,模型能正确计算单数字子乘积和位值补零,但 FOIL scratchpad 要求一步同时求和最多九个多位数项,缺少成对的中间累加,被作者认为是失败原因。 作者报告,面对训练中未见的四位数操作数时,性能降至 0.00%;无缓冲训练则出现灾难性遗忘,使除法 Accuracy 从 86.7% 降至 0.00%。这些结果限制了将留出集表现解释为一般算法泛化能力。全文未取得,数据生成规则、位数划分、准确率判定、缓冲机制、实验协议、消融及统计信息尚未验证。该工作研究的是符号算术,不能据此推断 EEG/BCI 效果;已有 EEG 相关工作尚未检索确认。
值得核对与复现的是作者将算术失败分别关联到序列填充、scratchpad 分解方式和课程训练,并报告未见位数泛化及灾难性遗忘的边界,而非仅展示准确率提升。
来源:arXiv · 架构与算子 · arxiv.org