技巧

开源项目 Strata 让 12GB 显存跑千亿参数 Qwen3.8-Flash-Next

精选理由

12GB 显存就能跑千亿参数模型,Strata 靠 MoE 冷热分离把专家塞进内存,5070 上实测 94 token/s,家用显卡玩家可以折腾了

开源项目 Strata 通过量化运行 Qwen3.8-Flash-Next,作者在 RTX 5070(12GB 显存)+ 64GB 内存的配置下,Q2_0 量化版达到约 94 token/s,IQ3_S 版约 53 token/s。原理是利用 MoE 模型每次只激活部分专家的特点,常用专家放显存,其余交给内存和 CPU 处理,SSD 存查询表负责调度。另有用户用 Strata 加代码优化,在单张 5070 Ti 上实现约 2200 token/s 输入处理和 67 token/s 生成。

图片来源 · Lxfater
原文 · Lxfater

12GB 显存 + 64GB 内存,也能跑千亿模型了!!

这个开源项目叫 Strata,跑的是 Qwen3.8-Flash-Next 的量化版

作者的测试配置是 RTX 5070(12GB 显存)+ Ryzen 5 7600 + 64GB 内存,短聊天生成速度: Q2_0 版约 94 token/s IQ3_S 版约 53 token/s

但 94 token/s 对应的是压缩更狠的 Q2_0,换量化版本、拉长上下文,速度都会变,实际效果也要按自己的任务试

但还有更离谱:

@ivanalog_com 用 Strata 加自己的代码优化,单张 5070 Ti 跑到约 2200 token/s 输入处理、67 token/s 生成

所以,问题是家用显卡如何塞得下千亿参数的模型?

实际上,这个项目利用 MoE 模型每次只调用一部分“专家”的特点,常用的放显存,其余由内存和 CPU 配合处理,SSD 还负责一张查询表,负责调度

我已经打算想在自己电脑上折腾大模型这个了

项目地址可以看看这个👇 https://t.co/9fpdDZJain