vLLM 分享 DeepSeek-V4.1-Flash 的 SWA bounded replay 优化
37FlowAI 拆解了 DeepSeek-V4.1-Flash 在 vLLM 上跑 agent 的优化细节,SWA bounded replay 能明显降低 TTFT,搞部署的可以看看。
vLLM 官方转发了 37FlowAI 对 DeepSeek-V4.1-Flash 在 agent 场景下的拆解。核心机制是 SWA bounded replay:前缀缓存命中时只重算滑动窗口末尾的 token,不需要常驻存储整个窗口的 KV cache。这一做法压缩了 Prefill 开销并降低 TTFT,有助于提升 agent workload 高并发下的吞吐表现。
感谢 @37FlowAI 对 DeepSeek-V4.1-Flash 在 vLLM 上 agent 场景的细致拆解。
SWA bounded replay 通过在前缀命中时仅重算窗口末尾 token,避免常驻存储窗口 KV,从而大幅压缩 Prefill 开销并降低 TTFT,有效释放 agent workload 的高并发吞吐。
https://t.co/tTksljNGMK