论文10:28Euston:微调DeepSeek-R1-8B,让模型拒绝错误的数学命题有人把 DeepSeek-R1-8B 调教成会挑刺的审稿人:假定理不再硬证,AIME 分数基本没掉。#Euston#DeepSeek-R1#GRPO#微调aarXiv: DeepSeek@Zehua Cheng 等 3 人原文稍后读已读值得跟进有用关注 Euston