论文Agent 与开发者10:33基于感知优势估计的多模态推理强化方法TPAE方法通过细粒度监督提升多模态模型推理能力,在七个基准测试中表现优异。#TPAE#多模态#强化学习#MLLMsaarXiv cs.AI@Zhihan Zhang, Lizi Liao原文稍后读已读值得跟进有用关注 TPAE