主要来源arXiv: DeepSeek
查看原文事件专题 ·官方一手
SPLASH:大模型服务中切换注意力并行布局
SPLASH系统可在请求运行时切换注意力并行布局,支持张量并行、数据并行、上下文并行和新型解耦所有权并行(DOP)。在B200 GPU上服务GLM-5.3时,SPLASH比固定布局部署提升1.3-1.73倍端到端吞吐量。DOP比数据并行注意力提供27-60%更多KV容量,且不复制数据。该系统在DeepSeek-V3.2(H200)和GLM-5.3-Flash(DCU)上也展现出相同布局优势。
当前结论
SPLASH让大模型服务能动态切换并行策略,在GLM和DeepSeek模型上显著提升吞吐,解决固定布局的局限性。
7 个信源67° AI 热度最后更新 2026/9/29 14:02:29
证据链
7 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。