Qwen Flash 本地部署速度提升近十倍:单卡达到 2200 prefill / 67 decode
一个玩家用单张消费卡跑出比多数 API 还快的推理速度,靠的是 Qwen Flash 的模型设计和 Strata 流水线架构,文章讲清了原理,本地部署党别错过。
作者在一张消费级显卡上跑 Qwen Flash,速度从一周前的 200 prefill / 10 decode 提升到 2200 prefill / 67 decode,读写提速近十倍。这一提升来自两个组合:DeepSeek 和 Qwen Flash 这类模型把智力拆分为注意力、专家和查表三部分,以及 Strata 架构把处理流水线化,让不同部分存储在不同速度的设备中按需抵达。目前大多数 API 的速度都达不到 2200/67,而这个水平一周前只有 5090、DGX Spark、M3 Ultra 这类机器能做到。连带效应是 32G B70 英特尔显卡等消费级硬件涨价断货。
所以,我们的 token 价格能下降10倍吗? seekinganythingbutalpha @ivanalog_com 过去一周多,可能以后被证明是AI推理部署史上天翻地覆的一周。 上个周末,我的本地机双5070ti试跑Qwen Flash,只能做到200 prefill,10decode。 今天,在Strata和我自制的PR的支持下,目前可以跑到2200/67,而且只需要一张卡。 即读写速度都提高了近十倍。 更好的消费卡比如4090/5090,当然也有幅度相当大的升级(目前5090在流式处理的支持下,速度已经开始逼近RTX6000,当然显存还是不足)。 这当然带来了消费级硬件的新一轮大涨价。如今,就连曾经无人问津的 32G B70英特尔显卡都卖断货涨价了。 2200/67的速度是什么意思? 今天除了deepseek,muse等少数模型,大部分API达不到这个速度。 而一个普通的家用游戏电脑就可以达到这个水平。 而这个水平,一周以前,只有5090,DGX spark,M3U这样的机器可以达到。 也就是说,在过去的一周多,全球的普通家用电脑带来了十倍于上周的AI产量。 这个增量,得益于deepseek- Qwen flash这种特殊设计,把智力分成了注意力,专家,和查表, 也得益于Strata这样优秀的架构,把整个处理流水线化,让不同的智力,存储在不同速度的存储设备中,在需要用时刚好抵达。 这对所有愿意拥有本地智力的人,当然是极大的利好。 也许模型层的设计,正在快速收敛到一个目前硬件条件下的最优解? 然而这对依赖出卖模型算力的生意,尤其是平庸的智力的商业来说,也可能是催命符。 🔗 View Quoted Tweet 💬 5 🔄 0 ❤️ 10 👀 8497 📊 4 ⚡