论文Agent 与开发者10:11重要性修正GRPO的采样温度研究论文提出解耦冷却采样器的方法,解决了RL训练中采样器与学习器不同步导致的性能退化问题。#GRPO#Qwen2.5-Math#采样温度#强化学习aarXiv cs.LG@Taiheng Pan原文稍后读已读值得跟进有用关注 GRPO