个人简介

我是威斯康星大学麦迪逊分校(University of Wisconsin–Madison)计算机科学博士生,导师是 Junjie Hu。我的中文名是蔡泽凡。

我的研究关注长上下文模型应该如何记住读过的内容。注意力保留一切,也为此付出代价;循环模型和快权重模型则在压缩的同时遗忘。我的工作几乎都围绕这一取舍展开:记忆是什么,如何写入,又如何读出。我认为,长上下文是大语言模型中最重要的开放问题。

我的研究分为三个方向:

  • 测试时训练——将记忆视为前向传播过程中在线优化的快权重。谁拥有这些权重,用什么信号监督它们,以及读取它们是否一定要是确定性的。
  • 高效架构——去除记忆中的冗余维度:KV 缓存中的网络深度,以及层间路由中的累积重叠。
  • KV 缓存压缩与长上下文推理——在固定预算下决定如何分配:在层之间、注意力头之间,以及模型自身的思维链之中。

每个项目的研究假设、具体方法、评测设置和实验结果,都在研究页面中详细介绍。

教育经历

  • 博士,威斯康星大学麦迪逊分校  ·  2024 年 9 月—2028 年 6 月(预计)
  • 硕士,北京大学  ·  2022 年 9 月—2024 年 6 月
  • 学士,北京交通大学  ·  2018 年 9 月—2022 年 6 月

工作经历

奖项

  • COLM 2025 Spotlight(24 / 418)——PyramidKV

最新动态

  • 2026 年 7 月   MENTOR 被 Findings of ACL 2026 接收!
  • 2025 年 10 月   在蒙特利尔举行的 COLM 2025 上介绍了 PyramidKV!
  • 2025 年 9 月   R-KV 被 NeurIPS 2025 接收!
  • 2025 年 9 月   COMMA 被 TMLR 接收!
  • 2025 年 9 月   PyramidKV 入选 COLM 2025 Spotlight(24 / 418)!
  • 2025 年 7 月   PyramidKV 被 COLM 2025 接收!
  • 2025 年 6 月   我以研究实习生身份加入 Adobe Research!
  • 2025 年 5 月   AdaptiveStep 被 ICML 2025 接收!
  • 2025 年 5 月   Math-Minos 被 ACL 2025 接收!
  • 2025 年 1 月   四篇论文(DnD-Transformer、HeadKV、Omni-MATH、GDPO)被 ICLR 2025 接收!
  • 2024 年 8 月   VeCAF 被 ACM Multimedia 2024 接收!
  • 2024 年 5 月   四篇论文(PCA-Bench、ZeroED、CENSOR、FairEval)被 ACL 2024 接收!
  • 2024 年 3 月   两篇论文(DialogVCS、ALSACE)被 NAACL 2024 接收!
  • 2024 年 1 月   MMICL 被 ICLR 2024 接收!
  • 2023 年 5 月   SANTA 被 ACL 2023 接收!
  • 2023 年 1 月   CTR 被 ICLR 2023 接收!

代表性工作

完整介绍见研究页面;全部论文见论文页面。

测试时训练

Universal Test-Time Training(通用测试时训练)  Adobe Research · 投稿中
在整个网络深度上共享快权重,而不是让每层拥有私有状态。沿着路由与权重归属的设计阶梯,RULER 检索分数在 124M 规模上从 8.5 提升至 15.5,在 760M 规模上从 23.2 提升至 27.8;其中,控制变量后的共享步骤分别贡献了 +2.6 和 +2.1 分。
详情

Test-Time Generation(测试时生成)  Adobe Research · 投稿中
将记忆读出建模为以键为条件、从噪声出发的传输过程,代替确定性回归,避免具有多峰分布的绑定坍缩到均值。场景级渲染从 16.27 提升至 17.46 dB。
详情

Test-Time Training with Next-Token Prediction(以下一 token 预测监督测试时训练)  2026 年预印本
Xuan Ouyang*、Zefan Cai*、Junjie Hu
用模型自身的下一 token 预测信号监督快权重写入,代替学习到的局部代理目标。这是唯一在全部四个受测骨干模型上均提升了 RULER 检索表现的方法。
PDF · 详情

高效架构

LastKV: Last Layer Key-Value Cache is All You Need(只需最后一层的键值缓存)  Adobe Research · 投稿中
只在每个分块边界提交最后一层的 KV,并让后续所有层读取它。将一个 8B Transformer 转换为在 32 层中只保留一层 KV,12 项基准的平均分下降 0.6。
详情

Delta Attention Residuals(增量注意力残差)  2026 年预印本
Cheng Luo*、Zefan Cai*、Junjie Hu
层间路由的来源是累积且高度相似的状态,这使路由发生坍缩。改为在各子层的增量上路由后,7.57B 模型的困惑度改善 8.2%;在这一规模,原方法反而不如不做修改。
PDF · 详情

KV 缓存压缩

PyramidKV  COLM 2025 Spotlight(24 / 418)
Zefan Cai、Yichi Zhang、Bofei Gao、Yuliang Liu、Yucheng Li、Tianyu Liu、Keming Lu、Wayne Xiong、Yue Dong、Junjie Hu、Wen Xiao
注意力随网络深度逐渐汇聚,缓存预算也应如此。只保留 12% 的 KV 缓存即可达到完整缓存的质量。
PDF · 项目主页 · 代码 · 详情

R-KV  NeurIPS 2025
Zefan Cai、Wen Xiao、Hanshi Sun、Cheng Luo、Yikai Zhang、Ke Wan、Yucheng Li、Yeyang Zhou、Li-Wen Chang、Jiuxiang Gu、Zhen Dong、Anima Anandkumar、Abedelkadir Asi、Junjie Hu
推理轨迹具有大量自我重复,因此淘汰缓存时应同时考虑冗余度与重要性。在 10% 的预算下保留约 100% 的完整缓存准确率,吞吐量提升至 6.6 倍。
PDF · 项目主页 · 代码 · 详情