模型为什么越走越偏:从 LLM 强化学习到自回归视频的 Drift
发布于:
从 Score Centering、BPO、MaxRL 到 Self Forcing、视频偏好优化与 KV 量化校正:用分布、反馈循环和干预位置,理解不同 domain 的 drift。
关于模型、记忆与生成过程的研究笔记。把不同领域的方法放在同一张图里,也把它们不能互相替代的地方说清楚。
发布于:
从 Score Centering、BPO、MaxRL 到 Self Forcing、视频偏好优化与 KV 量化校正:用分布、反馈循环和干预位置,理解不同 domain 的 drift。