Strata:12G显存本地跑Qwen3.8-Flash-Next 125B模型
12G显存的电脑也能跑125B的Qwen3.8-Flash-Next了,Strata把常用专家放显卡、全量放内存,项目已在Github开源。
Strata 让 12GB 显存的电脑能本地运行 125B 参数的 Qwen3.8-Flash-Next。它的做法是把最常用的专家模型常驻显卡,全量模型放在内存,由显卡、内存和固态硬盘协同完成推理与投机采样。配置 12G 显存加 64G 内存可跑全版本,32G 内存也能跑 Coder 版本。作者评价 Qwen3.8-Flash-Next 完成重复性日常任务没有问题。
Strata:12G显存就能跑千亿参数的模型
在12GB显存的普通电脑上,本地运行125B参数的Qwen3.8-Flash-Next模型。Strata把最常用的专家模型常驻在显卡,全量模型放在内存,由显卡、内存和固态硬盘协同完成推理与投机采样。
这个项目堪称超神,12G显存+64G内存可以跑Qwen3.8-Flash-Next全版本的模型,即使32G内存也能跑Coder版本的模型。Qwen3.8-Flash-Next能力不差,重复性日常任务都能完成。
Github:https://t.co/AMNGQgUGSm