论文Agent 与开发者14:07ROFT:只用自我复盘微调,Qwen3.5-4B 不靠强化学习也能提升智能体表现Qwen3.5-4B 只靠写复盘解释做微调,不用奖励模型就在 SWE-bench 上跑赢 GRPO,做智能体训练的可以看看这套 ROFT 流程。#Qwen3.5-4B#SWE-bench#GRPO#ROFTaarXiv cs.AI@Jonathan Light 等 10 人原文稍后读已读值得跟进有用关注 Qwen3.5-4B