开发者自研推理引擎 tqllm,单卡 RTX 3090 跑 Qwen 27B 达每秒 273 token
一张 RTX 3090 把 27B 模型跑到每秒 273 token,作者自己写的引擎,速度直接把普通部署方案甩开了。
开发者 @coffeecup2020 自制推理引擎 tqllm,在单张 RTX 3090 上以 TQ3_4S-v2 量化格式运行 Qwen3.8-27B,实测达到每秒 273 token。对比参考:30 token/s 已能流畅边读边看,60-70 token/s 时文字生成明显快于阅读速度。官方称 Qwen 27B 的能力与 Claude Opus 4.6 Max 相当。项目尚未公开,作者表示等待引擎放出。
有人自己写了个推理引擎,用 RTX 3090,把千问 27B 跑到了每秒 273 token!
这位开发者叫 @coffeecup2020,引擎叫 tqllm,跑的是 Qwen3.8-27B 的 TQ3_4S-v2 量化版。
273 token/s 是什么概念?
用人的阅读速度比喻: - 30 token/s:输出已经很流畅,可以边看边读,不用一直等下一个字。 - 60–70 token/s:文字明显跑在阅读前面,一段还没读完,后面的内容已经出来了。 - 273 token/s:更像一块块文字迅速铺出来,你还在看开头,后面已经生成了一大截。
那千问 27B 有多聪明?
官方说的是和Claude Opus 4.6 Max相当
所以现在等着大佬把这个推理引擎放出来了,这下面这个项目的那个 160 多少 GB 的那个
近这几天推理部署已经变天了