开源项目 Strata 让 12GB 显存跑千亿参数 Qwen3.8-Flash-Next
12GB 显存就能跑千亿参数模型,Strata 靠 MoE 冷热分离把专家塞进内存,5070 上实测 94 token/s,家用显卡玩家可以折腾了
开源项目 Strata 通过量化运行 Qwen3.8-Flash-Next,作者在 RTX 5070(12GB 显存)+ 64GB 内存的配置下,Q2_0 量化版达到约 94 token/s,IQ3_S 版约 53 token/s。原理是利用 MoE 模型每次只激活部分专家的特点,常用专家放显存,其余交给内存和 CPU 处理,SSD 存查询表负责调度。另有用户用 Strata 加代码优化,在单张 5070 Ti 上实现约 2200 token/s 输入处理和 67 token/s 生成。
12GB 显存 + 64GB 内存,也能跑千亿模型了!!
这个开源项目叫 Strata,跑的是 Qwen3.8-Flash-Next 的量化版
作者的测试配置是 RTX 5070(12GB 显存)+ Ryzen 5 7600 + 64GB 内存,短聊天生成速度: Q2_0 版约 94 token/s IQ3_S 版约 53 token/s
但 94 token/s 对应的是压缩更狠的 Q2_0,换量化版本、拉长上下文,速度都会变,实际效果也要按自己的任务试
但还有更离谱:
@ivanalog_com 用 Strata 加自己的代码优化,单张 5070 Ti 跑到约 2200 token/s 输入处理、67 token/s 生成
所以,问题是家用显卡如何塞得下千亿参数的模型?
实际上,这个项目利用 MoE 模型每次只调用一部分“专家”的特点,常用的放显存,其余由内存和 CPU 配合处理,SSD 还负责一张查询表,负责调度
我已经打算想在自己电脑上折腾大模型这个了
项目地址可以看看这个👇 https://t.co/9fpdDZJain
- Gorden Sun10-04 11:31原文