Delta Attention Residuals(增量注意力残差)

← 全部研究

高效架构

2026 年 arXiv 预印本 · 共同第一作者 · PDF · 代码

路由各层新增的信息。 累积隐藏状态共享大量内容,跨深度注意力因此难以区分路由来源。Delta Attention Residuals 改用注意力和 MLP 子层引入的变化作为来源,将加权结果加回当前残差流。逐子层版本保留每次计算的独立贡献;Delta Block 将这些变化分组,减少来源数量和训练开销。

标准加法残差、累积状态上的注意力,以及对子层 delta 的加法路由。
论文图 2:Delta Attention Residuals 对子层引入的变化进行路由,并将结果加回残差流。 点击图片可放大。

在论文报告的 FineWeb-Edu 上 10,000 步预训练实验中,delta 路由在 220M 至 7.57B 的各个测试架构上改善验证困惑度。7.57B 的 Delta Block 达到 16.00,标准残差为 17.43,论文复现的 Attention Residuals 为 18.58,相对标准残差降低 8.2%。该配置增加 589.8K 个路由参数,训练吞吐比基线低 35%,GPU 峰值显存增加 3%。在 Qwen3-0.6B 的路由诊断中,最大注意力权重的平均值从 0.35 提升到 0.62,表明跨层路由更有选择性。