智谱 GLM-5.5 或将发布,GLM-5.3 仅靠后训练提升
智谱要出 GLM-5.5 了,帖子里还解释了 GLM-5.3 全靠强化学习涨分的来龙去脉,想了解各家 RL 训练策略的可以看看。
博主 kimmonismus 在 X 上爆料 GLM-5.5 新模型即将推出。帖子里提到 GLM-5.3 与 GLM-5.2 使用同一个预训练基座,全部提升来自后训练阶段,尤其是强化学习的扩展。GLM-5.3 Flash 则采用了新预训练的基座模型。仅靠 RL 就带来了明显的能力提升。
It’s about time to finally get some new GLM model, GLM-5.5.
Quick reminder: GLM-5.3 uses the exact same base model as GLM-5.2. All improvements came from post-training, particularly scaling reinforcement learning.
GLM-5.3 Flash, however, uses a newly pretrained base model.
The gains from RL alone are remarkable.