Test-Time Generation(测试时生成)

← 全部研究

测试时训练

COLM 2026 ER Workshop (Spotlight) · PDF

通过生成来读取记忆。 紧凑记忆中,同一个查询可能对应多个合理的值。用平方损失训练的确定性读出,可能将它们平均成一个结果。Test-Time Generation(TTG)用加入噪声的键值样本学习记忆,再依据查询和已存储的快权重,从新的噪声出发生成每次读出的结果。读出期间记忆状态保持不变,在新上下文到来时更新。

固定大小快权重记忆的读出示意:确定性的条件均值与随机生成读出。
论文概念示意图:确定性的条件均值可能落在多个合理值之间,生成式读出则尝试表达不同备选值。曲线用于说明概念模型。点击图片可放大。

在论文报告的 124M、760M 和 3B 模型系列中,TTG 在所比较的固定大小记忆模型里取得最高的 RULER 平均检索准确率。在完整 GSO 物体与 DL3DV 场景测试集上,平均重建 PSNR 从 LaCT 的 23.99 / 16.14 dB 提升到 24.93 / 16.59 dB;使用持续增长 KV 缓存的 Transformer 在这些重建基准上仍更强。

另一项受控测试为每个键存入两个值。在低和中等负载下,多次随机读出能够恢复两者,说明已存储的状态可以支持不同输出。最高测试负载下所有方法都失败;对于按单步读出训练的语言模型,增加读出步数没有改善结果。

论文精选瓢虫与仙人掌重建案例:多视角下的真实图像、确定性参考与 TTG 结果。
论文精选案例:全部 24 个视角写入记忆,评测包含已观测视角。图中增益仅属于这两个案例,完整测试集的平均结果见上文。点击图片可放大。