fractalyze_io 优化 Qwen3-Omni,单卡 RTX 5090 首音频延迟降至 23ms
有人在单张 RTX 5090 上跑 Qwen3-Omni,用 AWQ-4bit 把首音频延迟从 213ms 压到 23ms,本地语音对话流畅度差了近十倍。
fractalyze_io 在 vLLM-Omni 上对 Qwen3-Omni 做了优化,可在单张 RTX 5090 上运行。他们采用 AWQ-4bit 量化,在 batch-1 文本提示测试中,把首个音频的响应时间从原版 vLLM-Omni 的 213ms 降到 23ms。vLLM 团队呼吁将这些优化贡献回上游 vLLM-Omni。
Great work from @fractalyze_io optimizing Qwen3-Omni on vLLM-Omni for a single RTX 5090. Their AWQ-4bit, batch-1 text-prompt tests cut time to first audio from 213ms to 23ms vs. stock vLLM-Omni. We’d love to see these optimizations contributed upstream to vLLM-Omni so more users can benefit!😄
- @atomic_chat_hq10-05 22:59原文