10:10官方一手arXiv: DeepSeek@Ken Ding精选数学推理的RLVR存在盲区:当一组采样全部失败时,GRPO的优势函数为零,导致模型在能力边界提示上无梯度。LSPO在每个RL步检测这类悬崖提示,用其标准答案快速拟合一个小型LoRA适配器,然后重新采样并将成功补全拼回批次。在DeepMath-103K上用DeepSeek-R1-Distill-Qwen-1.5B、n=5配对种子、1000步评估,LSPO在16个(基准,pass@k)组合中15胜1平,AIME24/pass@4提升+10.7点,MATH500/pass@1提升+2.4点,平均提升+3.8点。论文DeepSeek-R1-Distill-Qwen-1.5BGRPOLoRA推荐理由:DeepSeek-R1-Distill-Qwen-1.5B上,LSPO用LoRA支架捡回GRPO在零奖励提示上的梯度,比DAPO平均高3.8个点。原文稍后读已读值得跟进有用关注 DeepSeek-R1-Distill-Qwen-1.5B
12:12官方一手arXiv: DeepSeek@Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov, Zifeng Ding, Volker Tresp, Yunpu Ma精选MADA-RL是一个针对参数≤4B紧凑模型的后训练框架,通过LoRA微调少量参数,将模型分为生成器和评论家角色。其核心是反事实评论家优势:动态基线使评论家优化方向为改进生成器共识而非简单复现正确答案。在五个数学推理基准上,DeepSeek-R1-Distill-Qwen-1.5B模型准确率从39.9%提升至41.9%(+2.0点,p<0.001),可训练参数仅为全微调基线的1/16。该方法接近但未超越使用更大数据集的DeepScaleR和STILL-3,分析表明训练后的评论家更擅长纠正生成器错误。论文MADA-RLDeepSeek-R1-Distill-Qwen-1.5BLoRA推荐理由:小模型也能提升推理?MADA-RL用LoRA微调1/16参数,让1.5B模型准确率涨2个点,评论家专挑生成器错误来纠正。原文稍后读已读值得跟进有用关注 MADA-RL
11:21官方一手arXiv: DeepSeek@El Hassane Ettifouri, Ayoub Belfatmi, Mahaman Sanoussi Yahaya Alassan, Walid Dahhane论文指出低比特量化使得小推理模型如DeepSeek-R1-Distill-Qwen-1.5B成本降低但可能削弱推理链,传统使用token对数概率增量作为解码监控指标是无效的,因其在模型自身采样下是均值为零的鞅,无法反映轨迹健康度。作者提出一种训练无关的解码控制器,结合退化感知报警分数和校准的e-process时序检测器。在GSM8K上测试FP16和INT4版本,原始监控触发93-95%生成,校准后变成选择性检测失败轨迹(φ≈0.3,精度约0.6,基准0.38)。INT4准确率从63%提升至69%(配对McNemar p=0.18,n=100),代价为28% token预算。论文DeepSeek-R1-Distill-Qwen-1.5BGSM8K量化推理模型推荐理由:这篇论文告诉你为什么监控量化的DeepSeek小模型不能用token概率,还给出了一个更靠谱的校准方法,真正提升了准确率。原文稍后读已读值得跟进有用关注 DeepSeek-R1-Distill-Qwen-1.5B