个人简介
我是威斯康星大学麦迪逊分校(University of Wisconsin–Madison)计算机科学博士生,导师是 Junjie Hu。我的中文名是蔡泽凡。
我的研究关注长上下文模型应该如何记住读过的内容。注意力保留一切,也为此付出代价;循环模型和快权重模型则在压缩的同时遗忘。我的工作几乎都围绕这一取舍展开:记忆是什么,如何写入,又如何读出。我认为,长上下文是大语言模型中最重要的开放问题。
我的研究分为三个方向:
- 测试时训练——将记忆视为前向传播过程中在线优化的快权重。谁拥有这些权重,用什么信号监督它们,以及读取它们是否一定要是确定性的。
- 高效架构——去除记忆中的冗余维度:KV 缓存中的网络深度,以及层间路由中的累积重叠。
- KV 缓存压缩与长上下文推理——在固定预算下决定如何分配:在层之间、注意力头之间,以及模型自身的思维链之中。
每个项目的研究假设、具体方法、评测设置和实验结果,都在研究页面中详细介绍。
教育经历
- 博士,威斯康星大学麦迪逊分校 · 2024 年 9 月—2028 年 6 月(预计)
- 导师:Junjie Hu
- 硕士,北京大学 · 2022 年 9 月—2024 年 6 月
- 导师:Baobao Chang
- 学士,北京交通大学 · 2018 年 9 月—2022 年 6 月
工作经历
- Adobe Research——美国加利福尼亚州圣何塞 · 2025 年 5 月—2026 年 7 月
- 导师:Hao Tan
- 三个长上下文记忆项目:LastKV、Universal Test-Time Training 和 Test-Time Generation。
- Microsoft Azure
- 导师:Wen Xiao
奖项
- COLM 2025 Spotlight(24 / 418)——PyramidKV
最新动态
- 2026 年 7 月 MENTOR 被 Findings of ACL 2026 接收!
- 2025 年 10 月 在蒙特利尔举行的 COLM 2025 上介绍了 PyramidKV!
- 2025 年 9 月 R-KV 被 NeurIPS 2025 接收!
- 2025 年 9 月 COMMA 被 TMLR 接收!
- 2025 年 9 月 PyramidKV 入选 COLM 2025 Spotlight(24 / 418)!
- 2025 年 7 月 PyramidKV 被 COLM 2025 接收!
- 2025 年 6 月 我以研究实习生身份加入 Adobe Research!
- 2025 年 5 月 AdaptiveStep 被 ICML 2025 接收!
- 2025 年 5 月 Math-Minos 被 ACL 2025 接收!
- 2025 年 1 月 四篇论文(DnD-Transformer、HeadKV、Omni-MATH、GDPO)被 ICLR 2025 接收!
- 2024 年 8 月 VeCAF 被 ACM Multimedia 2024 接收!
- 2024 年 5 月 四篇论文(PCA-Bench、ZeroED、CENSOR、FairEval)被 ACL 2024 接收!
- 2024 年 3 月 两篇论文(DialogVCS、ALSACE)被 NAACL 2024 接收!
- 2024 年 1 月 MMICL 被 ICLR 2024 接收!
- 2023 年 5 月 SANTA 被 ACL 2023 接收!
- 2023 年 1 月 CTR 被 ICLR 2023 接收!
代表性工作
测试时训练
Universal Test-Time Training(通用测试时训练) Adobe Research · 投稿中
在整个网络深度上共享快权重,而不是让每层拥有私有状态。沿着路由与权重归属的设计阶梯,RULER 检索分数在 124M 规模上从 8.5 提升至 15.5,在 760M 规模上从 23.2 提升至 27.8;其中,控制变量后的共享步骤分别贡献了 +2.6 和 +2.1 分。
详情
Test-Time Generation(测试时生成) Adobe Research · 投稿中
将记忆读出建模为以键为条件、从噪声出发的传输过程,代替确定性回归,避免具有多峰分布的绑定坍缩到均值。场景级渲染从 16.27 提升至 17.46 dB。
详情
Test-Time Training with Next-Token Prediction(以下一 token 预测监督测试时训练) 2026 年预印本
Xuan Ouyang*、Zefan Cai*、Junjie Hu
用模型自身的下一 token 预测信号监督快权重写入,代替学习到的局部代理目标。这是唯一在全部四个受测骨干模型上均提升了 RULER 检索表现的方法。
PDF · 详情
高效架构
LastKV: Last Layer Key-Value Cache is All You Need(只需最后一层的键值缓存) Adobe Research · 投稿中
只在每个分块边界提交最后一层的 KV,并让后续所有层读取它。将一个 8B Transformer 转换为在 32 层中只保留一层 KV,12 项基准的平均分下降 0.6。
详情
Delta Attention Residuals(增量注意力残差) 2026 年预印本
Cheng Luo*、Zefan Cai*、Junjie Hu
层间路由的来源是累积且高度相似的状态,这使路由发生坍缩。改为在各子层的增量上路由后,7.57B 模型的困惑度改善 8.2%;在这一规模,原方法反而不如不做修改。
PDF · 详情
KV 缓存压缩
PyramidKV COLM 2025 Spotlight(24 / 418)
Zefan Cai、Yichi Zhang、Bofei Gao、Yuliang Liu、Yucheng Li、Tianyu Liu、Keming Lu、Wayne Xiong、Yue Dong、Junjie Hu、Wen Xiao
注意力随网络深度逐渐汇聚,缓存预算也应如此。只保留 12% 的 KV 缓存即可达到完整缓存的质量。
PDF · 项目主页 · 代码 · 详情
R-KV NeurIPS 2025
Zefan Cai、Wen Xiao、Hanshi Sun、Cheng Luo、Yikai Zhang、Ke Wan、Yucheng Li、Yeyang Zhou、Li-Wen Chang、Jiuxiang Gu、Zhen Dong、Anima Anandkumar、Abedelkadir Asi、Junjie Hu
推理轨迹具有大量自我重复,因此淘汰缓存时应同时考虑冗余度与重要性。在 10% 的预算下保留约 100% 的完整缓存准确率,吞吐量提升至 6.6 倍。
PDF · 项目主页 · 代码 · 详情
