markdown
GRPO
concept · 首次出现 2026-05-22 · 最近出现 2026-09-05 · 累计提及 188
综述
相关报道
10 条在档- DRACO:动态评分细粒度信用分配arXiv cs.LG
- Cliff:从首次错误中学习过程奖励arXiv cs.LG
- TASPO解决智能体政策优化中的监督-信用差距arXiv cs.AI
- DiffPDE:掩码扩散模型作为偏微分方程求解器arXiv cs.AI
- PAC:LLM多任务强化学习的新课程方法arXiv cs.LG
- 工具集成数学推理的强化学习研究arXiv cs.AI
- VERA-8B:基于证据的审计风险推理模型arXiv cs.AI
- 进化策略提升LLM推理覆盖范围arXiv cs.LG
- 并行分布式推理语言模型性能基础arXiv: DeepSeek
- StepGuard:学习级联防护与安全-效用平衡arXiv cs.AI