MENTOR:具有均衡多模态控制能力的高效自回归图像生成

← 全部研究

多模态学习与生成

Findings of ACL 2026 · PDF · 项目主页 · 代码

既保留参考图像的主体,也遵循文字要求的变化。 MENTOR 将视觉与文字输入映射到共享表示,再通过自回归解码器生成图像词元,目标是在有限训练资源下实现可控生成。

训练分为两个阶段:多模态对齐阶段结合图像重建、目标分割和文生图任务,学习像素细节与语义对应;多模态指令微调阶段再加入互补任务,让模型同时利用视觉细节并遵循指令。

MENTOR 架构及多模态对齐、指令微调两个训练阶段。
图 3:MENTOR 的统一多模态编码器、自回归图像生成器与两阶段训练。点击放大。

论文报告的 2.31B 参数模型使用 300 万训练样本,在无需测试时微调的方法对比中,DreamBench++ 的主体保留度与提示遵循度乘积为 0.47。实验还分析图像重建、分割和多图像条件生成;结果体现了该评测任务与模型设置下两种输入模态之间的平衡。

资源

数据集: Stage 1 · Stage 2

模型检查点: Checkpoints