8月28日
19:26
19:26官方账号arXiv cs.LG@Kairong Luo, Jiarui Cui, Yaorui Yin, Shengqi Chen, Yiming Yang, Linxiang Gao, Yanmohan Wang, Mingzhe Zhang, Kaiyue Wen, Kaifeng Lyu, Wenguang Chen
精选73°
Poor Lab团队使用RTX 5090显卡训练了Puro-2B模型,总计算成本低于6900美元。该模型在1.4万亿token数据集上以FP8精度进行训练,性能接近Qwen2.5-1.5B。团队还提出了Puro成本缩放定律,显示约4420美元即可达到Qwen2-1.5B性能。完整训练食谱已在Apache 2.0许可下开源。
推荐理由:Poor Lab用5090显卡训练出接近Qwen2-1.5B的模型,成本不到7千,开源食谱让普通人也能训练大模型。
8月15日
00:26
00:26官方账号阿里通义 Qwen@Alibaba_Qwen
76°
阿里开源Qwen3.8-27B,SGLang团队当天完成适配。在单张RTX 5090上,借助NVFP4和DSpark优化,解码速度达到206.1 tok/s。在DGX Spark上解码速度为38.28 tok/s。该模型在智能体规划和长时任务上表现突出。
事件专题

推荐理由:Qwen3.8-27B开源了,SGLang当天就能跑,单张5090能到206 tok/s,小模型之王回来了,试试吧。
8月4日
12:33
8月3日
7月28日
20:18