10:18官方一手arXiv: DeepSeek@Yongmin Kim, Shota Takashiro, Yusuke Iwasawa, Takeshi Kojima, Yutaka MatsuoarXiv 论文提出一种面向大批量推理场景的训练免剪枝方法,针对现有自适应剪枝在批处理时阈值漂移、推理准确率崩塌的问题。方法用周期性 top-k 选择取代逐 token 阈值剪枝,并引入激活记忆累积重要神经元。在 DeepSeek-R1-Distill-Qwen-7B 上,批大小 4、50% 目标稀疏度下,平均准确率比此前最优自适应剪枝高 39.7 个百分点。实际稀疏度 50% 时相比稠密推理获得 1.40 倍加速。论文DeepSeek-R1-Distill-Qwen-7B自适应剪枝推理模型推荐理由:DeepSeek-R1-Distill-Qwen-7B实测:批大小4准确率比旧剪枝高39.7个点,还有1.40倍加速。原文稍后读已读值得跟进有用关注 DeepSeek-R1-Distill-Qwen-7B
09:24官方一手arXiv: DeepSeek@Renuka Oladri, Niveda Jawahar, Abdirisak MohamedDeepSeek-R1-Distill-Qwen-7B等思维链模型在推理时呈现双峰收敛模式:在令牌预算内结束(收敛)或耗尽预算无结论(非收敛)。实验显示,收敛的推理在AIME 1983-2024上准确率达90.3%,非收敛仅6.6%,总体收敛率62.0%。通过训练线性探针在隐藏状态激活(token 50-300)上,层20在token 150处达到AUC 0.608(±0.080,五折交叉验证)。激活探针优于基于令牌熵和重复统计的行为基线。扫描级置换检验p=0.063(100,000次置换),表明样本量不足以在常规阈值下确认信号,但收敛命运在生成结束前部分编码于中间表征。论文DeepSeek-R1-Distill-Qwen-7B推理模型早期检测推荐理由:这篇论文发现DeepSeek-R1推理非收敛在早期就能从内部表征检测到,未来可做自适应计算分配,研究推理效率的朋友可以看看。原文稍后读已读值得跟进有用关注 DeepSeek-R1-Distill-Qwen-7B