论文14:10UMM-Reflection:用交错强化学习训练统一模型的反思能力一篇训练方法论文:让统一模型自己看图、自己改图,用整条轨迹的 RL 训练,GenEval 比 SFT 高了 12 分,推理时还不用 verifier。#UMM-Reflection#BAGEL#强化学习#多模态aarXiv cs.AI@Yijia Fan 等 8 人原文稍后读已读值得跟进有用关注 UMM-Reflection