主要来源arXiv cs.LG
查看原文事件专题 ·多源确认
EAServe 论文提出面向多模态 LLM 的 Encode 感知分离式推理服务
论文针对多模态大模型(MLLM)推理中新增的 Encode 阶段提出 EAServe 系统,将 Encode-Prefill-Decode 三阶段流水线中的 Encode 重新定位为控制点。其运行时层包含负载自适应微批处理、速率控制的 partially offload 和动态 SM 分区,配置层 HAS 通过按阶段容量画像和 TPE 贝叶斯优化搜索 GPU 分配、encode 批大小与 offload 比例。在覆盖图像、视频、音频的三种 MLLM 架构上评测,相同 SLO 约束下 EAServe 的 goodput 分别比 NVIDIA Dynamo 高 4.3 倍、比 vLLM 高 1.7 倍,并显著提升 GPU 利用均衡度。
当前结论
一篇推理系统论文,解决多模态模型 Encode 阶段拖垮 GPU 利用率的问题,goodput 比 vLLM 高 1.7 倍、比 NVIDIA Dynamo 高 4.3 倍,做 MLLM 服务的可以看看。
6 个信源58° AI 热度最后更新 2026/9/25 17:20:22
证据链
6 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。