10:43官方一手arXiv: DeepSeek@Issac Zhu, Hscos Zhang, Keith Jiang, Jack Li, Hugh Yin, Jason Zhao精选FlashBoot是SGLang上的权重加载子系统,针对MoE模型弹性部署中的延迟问题。它通过FabricArena连续内存布局和FlashLoad零拷贝批量传输,将单节点权重加载从20.1秒降至0.4秒,加速50倍。FlashClone利用远程映射替代NCCL初始化,将跨节点复制时间从10-110秒降至约10毫秒。在NVL72上测试DeepSeek-V4-Pro和DeepSeek-V4-Flash,并发机架级加载从87秒降至0.32秒,加速超270倍。论文FlashBootSGLangDeepSeek-V48 个信源在谈事件专题推荐理由:SGLang团队搞的FlashBoot,把大模型权重加载从20秒压到0.4秒,跨节点复制只要10毫秒。跑DeepSeek-V4系列,NVL72上实测数据,做弹性部署的值得看。原文稍后读已读值得跟进有用关注 FlashBoot
04:20Ate-a-Pi@svpino精选Runpod推出针对AI模型的serverless服务,解决大模型加载慢和空闲GPU成本高的问题。他们采用FlashBoot技术,将空闲模型转移到廉价存储,流量恢复时快速调回GPU,冷启动时间低于200ms。部署时弃用Docker,改用Python函数,指定GPU后几秒即可完成。该方案声称比主流云厂商降低成本90%。AI产品RunpodFlashBootServerless推荐理由:Runpod让部署大模型像serverless函数一样快,冷启动200ms,成本降90%,不用再纠结闲置GPU还是等待加载了。原文稍后读已读值得跟进有用关注 Runpod