9月3日
09:12
09:12官方账号arXiv cs.LG@Xixiang He, Xingming Li, Baiqi Wu, Qiyao Sun, Xuanyu Ji, Ao Cheng, Qingyong Hu
精选73°
研究人员提出MT-SDPO方法,通过自我锚点、答案验证资格和特权蒸馏三个组件整合多个冻结教师模型。该方法在Qwen3-8B模型上测试,将最弱领域性能提升14.79点,领域差距缩小74.7%。代码已在GitHub开源,地址为https://github.com/hexixiang/MT-SDPO。
推荐理由:MT-SDPO方法让每个样本选择最可靠的教师,而非按领域匹配,大幅提升多领域大模型性能。
9月2日
8月27日
10:26
10:26官方账号arXiv cs.AI@Yutong Chen, Guangfu Guo, Zhichao Xu, Kunpeng Liu
DualOPSD是一种不对称交替框架,自适应学生模型和教师模型。在Qwen3-8B上,DualOPSD在AIME 2024、AIME 2025和HMMT 2025上分别比OPSD提升了23.61、13.89和10.00个avg@12点。模型规模越大,准确率提升越明显。所有规模下,DualOPSD都减少了截断,4B规模下的诊断结果还显示教师和学生之间的KL散度更低。
推荐理由:DualOPSD在模型规模和性能上都有显著提升,是自蒸馏领域的一个新突破。与OPSD相比,DualOPSD在多个基准测试中取得了更好的成绩,值得关注。
8月20日
10:18
10:18官方账号arXiv cs.AI@Zhu Zhang, Jixun Wang, Xiaoang Xu, Xiaorong Wang, Zihan Zhou, Zhiyuan Wang, Shuo Wang, Chaojun Xiao, Yuezhi Zhou
长语境推理任务中,传统策略蒸馏存在教师支持偏差导致效果下降问题。该研究提出GC-OPD组校准策略,对Qwen3-4B等模型优化后,在五个长语境基准测试中表现提升。应用该策略后,Qwen3-8B模型的平均得分从35.12提升至44.65,验证了方法有效性。
推荐理由:SolereZhang团队推出的GC-OPD方法,用于优化Qwen系列大模型完成长语境任务,比传统方法效果更好,值得尝试一下。
7月14日
09:59
09:59官方账号arXiv cs.AI@Qijia Shen, Zhiqi Huang, Vamsidhar Kamanuru, Aznaur Aliev, Jay Rainton, Ahmed Awelkair, Zhichen Zeng, Jiajun Li, Shi Dong, Yueming Yuan, Boyuan Ma, Qizheng Zhang, Jiwei Fu, Yuzhen Mao, Wendong Fan, Ping Nie, Philip Torr, Bernard Ghanem, Changran Hu, Jonathan Lingjie Li, Urmish Thakker, Guohao Li
SETA是一个可扩展框架,用于生成可验证的终端环境以支持强化学习。其构建的SETA-Env数据集包含超过4500个环境,是当前最大的开源可验证终端RL数据集。使用Qwen3-8B在SETA-Env上训练,在Terminal-Bench 2.0上达到12% pass rate,为8B规模RL训练模型的最佳结果。在DeepSeek-V4-Flash上,同一终端代理基准的pass@1从40%提升至43%,pass@5从54%提升至58%。SETA-Env为终端代理研究提供了高质量的训练环境。
推荐理由:终端代理训练数据难找,SETA开源了4500+环境的RL数据集,Qwen3-8B训后Terminal-Bench拿到12%,顺带还让DeepSeek-V4涨了分,搞终端AI的别错过。
6月29日
15:19
15:19Geek@geekbb
推文作者分享了使用 Qwen3-8B 模型与 DSpark 工具进行本地部署的体验。该推文获得 737 次查看,反映了用户对消费级显卡运行大模型的渴望。当前消费级显卡显存普遍不足,难以直接运行 8B 参数模型。

推荐理由:有人实测了 Qwen3-8B 配合 DSpark 本地跑,说能流畅运行但显存不够,感觉消费级显卡该升级了。
6月26日
10:46
10:46官方账号arXiv cs.LG@Yingyu Lin, Qiyue Gao, Nikki Lijing Kuang, Xunpeng Huang, Kun Zhou, Tongtong Liang, Zhewei Yao, Yi-An Ma, Yuxiong He
论文提出Ranking-induced VERifiable framework (RiVER),无需真实答案即可通过基于分数的执行反馈训练LLM。在12个AtCoder Heuristic Contest任务上训练后,Qwen3-8B在Algorithm Engineering Benchmark (ALE-Bench)上的rating rank提升8.9%,GLM-Z1-9B-0414提升9.4%。同时,RiVER在LiveCodeBench和USACO等精确求解基准上分别带来2.4%和3.5%的绝对平均提升。对比基线表明,仅用原始执行分数训练可提升ALE rating但无法泛化到精确求解任务。
推荐理由:论文介绍RiVER,用强化学习训练模型解决无标准答案的得分优化问题,还能顺带提升常规编程基准,实用思路值得一看。
6月24日
15:30
15:30官方一手marktechpost@Asif Razzaq
76°
UC San Diego推出DFlash,用轻量级块扩散模型替代自回归起草器,实现投机解码。该方法通过单次前向传播生成整块token,并利用KV注入条件于目标隐藏特征。在Qwen3-8B上达到6.08倍无损加速,NVIDIA报告在Blackwell上固定交互性下吞吐量提升15倍。DFlash已发布20个检查点,支持SGLang、vLLM和TensorRT-LLM。
事件专题

推荐理由:UC San Diego搞了个新方法DFlash,用扩散模型直接生成整段token,比自回归快几倍,Qwen3-8B上6倍加速,Blackwell上15倍,还开源了检查点,搞推理加速的可以看看。