论文Agent 与开发者13:58Strategy-Diverse RL 训练开源 LLM 做工业级优化元求解器用强化学习把开源模型训练成会挑求解策略的优化器,成绩还能压过 GPT-5.5,做运筹优化的可以看看。#SDRL#DeepSeek-V4-Pro#GPT-5.5#强化学习aarXiv: DeepSeek@Shihao Zhang 等 7 人原文稍后读已读值得跟进有用关注 SDRL