模型中美对照官方一手06:04苹果研究提出新方法优化扩散语言模型训练苹果研究的新方法DACA-GRPO,能更精准地优化扩散语言模型的训练过程,和传统方法相比,它解决了去噪步骤的信用分配问题。#Denoising-Aware Credit Assignment for GRPO#GRPO#扩散语言模型#苹果A官方一手Apple ML Research原文稍后读已读值得跟进有用关注 Denoising-Aware Credit Assignment for GRPO