论文Agent 与开发者13:27研究:特定起始 token 提示可让 base 模型接近 RL 训练后的推理表现不用 RL 训练,只在开头加个 "Okay" 就能让 Olmo-3-7B 数学成绩翻近一倍,这篇论文把原因挖得很透,做模型训练的值得看看。#Olmo-3-7B#Qwen3-14B#MATH-500#推理模型aarXiv cs.AI@Sophie L. Wang 等 6 人原文稍后读已读值得跟进有用关注 Olmo-3-7B