Delta Attention Residuals(增量注意力残差)
2026 年 arXiv 预印本 · 共同第一作者 · PDF · 代码
路由各层新增的信息。 累积隐藏状态共享大量内容,跨深度注意力因此难以区分路由来源。Delta Attention Residuals 改用注意力和 MLP 子层引入的变化作为来源,将加权结果加回当前残差流。逐子层版本保留每次计算的独立贡献;Delta Block 将这些变化分组,减少来源数量和训练开销。
在论文报告的 FineWeb-Edu 上 10,000 步预训练实验中,delta 路由在 220M 至 7.57B 的各个测试架构上改善验证困惑度。7.57B 的 Delta Block 达到 16.00,标准残差为 17.43,论文复现的 Attention Residuals 为 18.58,相对标准残差降低 8.2%。该配置增加 589.8K 个路由参数,训练吞吐比基线低 35%,GPU 峰值显存增加 3%。在 Qwen3-0.6B 的路由诊断中,最大注意力权重的平均值从 0.35 提升到 0.62,表明跨层路由更有选择性。
