事件专题 ·单一信源

vLLM v0.31.0 发布

vLLM v0.31.0 版本发布,包含 717 次提交和 307 位贡献者。新版本支持 DeepSeek-V4.1-Flash 模型的 FlashMLA mega 注意力机制,以及 NVFP4 KV 缓存技术。引入了快速重启功能,可在重启时保持权重在 GPU 内存中,并支持数据并行和 MTP 草稿功能。

当前结论

vLLM 团队发布了新版本,优化了多种模型支持和服务性能,特别适合需要大规模部署 AI 应用的开发者。

2 个信源83° AI 热度最后更新 2026/10/8 09:31:03

证据链

2 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。