Test-Time Training with Next-Token Prediction(利用下一词元预测进行测试时训练)

← 全部研究

测试时训练

Findings of EMNLP 2026 · 共同第一作者 · PDF · 代码

用输入中已有的下一词信号写入记忆。 TTT-NTP 将选定 MLP 的下投影矩阵直接作为快权重,把当前位置的 MLP 激活与同一层观察下一个 token 后的上下文状态配对,再通过轻量投影写入。记忆的目标因此来自模型自身的预测计算。训练采用分块并行更新,后续块读取此前的写入,同时保持因果性。

TTT-NTP 流程:训练时进行因果的下一位置写入,推理时根据 prompt 求解快权重更新。
论文图 1:下一位置的上下文状态监督快权重写入;推理时先拟合 prompt 对应的岭回归更新,再生成回答。 点击图片可放大。

该方法需要先进行持续预训练。推理时,先用一次 prompt 前向收集激活,再通过岭回归求解更新下投影矩阵,随后生成回答。原有 prompt KV 缓存继续使用,每个样本完成后恢复权重。

在 Llama-3.1-8B、Mistral-7B-v0.3、Qwen3-4B 和 Qwen3-0.6B 上,4K–32K 上下文的 RULER Full-13 平均准确率分别比发布的骨干模型提高 3.90、3.03、4.06 和 2.88 个百分点。在 LongBench-v2 的 215 道中等长度问题上,所有方法使用统一的 32K token 预算及首尾截断;Llama 的准确率从 25.6 提升到 31.2,Mistral 从 26.5 提升到 30.2。常识与知识测试的综合表现保持相近。