17:39官方一手arXiv: DeepSeek@Yan Shi, Xiaochao Wang, Jingchun Gao, Jintao Luo, Xinyi Zhou, Feng Liu, Kui Luo, Xushi Li, Xinjie Guo, Liangjun Feng精选73°VPP是一种新的虚拟流水线并行技术,用于优化长上下文LLM推理中的分块预填充。该方法保持块大小固定,通过虚拟流水线布局减少流水线气泡。在vLLM-Ascend中实现后,VPP在16块Ascend 910C NPU上测试了三种MoE模型,序列长度达100万token。相比DCPP,VPP在长序列上吞吐量提升13.1%,在混合工作负载上提升6.7%,在512K token的DeepSeek-V3.1预填充任务中,流水线气泡比例从6.4%降至0.1%。论文VPPLLM推理流水线并行推荐理由:VPP解决了长上下文LLM推理中流水线气泡问题,在保持短序列性能的同时显著提升长序列吞吐。原文稍后读已读值得跟进有用关注 VPP
14:39官方账号arXiv cs.LG@Ruitao Liu, Xinyang Tian, Shuo Chen, Tingrui Zhang, Guang Yang, Alan Zhao, Wei Xu精选论文提出 RRFP(Runtime-Readiness-First Pipeline),一种基于任务就绪状态的流水线并行运行时系统。传统流水线并行依赖静态或自适应生成的调度顺序,当实际任务就绪状态与预设顺序不一致时,会导致阶段错位和空闲气泡。RRFP 将调度视为非绑定的提示顺序,优先执行已就绪的任务,结合消息驱动的异步通信和轻量级张量并行协调。在 128 GPU 上测试,RRFP 在纯语言和多模态任务上分别实现最高 1.77 倍和 2.77 倍加速,并优于现有外部系统。论文流水线并行分布式训练大模型推荐理由:大模型训练中流水线并行的空闲气泡问题一直困扰着分布式训练团队,RRFP 用就绪优先的思路直接提升 GPU 利用率,做大规模训练的工程师值得关注这个新方案。原文稍后读已读值得跟进有用关注 流水线并行