论文Agent 与开发者精选10:41多令牌预测头后训练方法研究DeepSeek团队发现,只需少量后训练就能让Qwen3-8B达到与MiMo-7B相当的推理速度,比原方法节省千倍训练资源。#Qwen3#MiMo-7B#DeepSeek#多令牌预测aarXiv: DeepSeek@Prachi Badarayani 等 11 人原文稍后读已读值得跟进有用关注 Qwen3