论文Agent 与开发者73°00:43Google 论文:Serverless CPU 上量化 LLM 冷启动 55-70% 延迟来自模型加载Google 这篇论文拆了 serverless CPU 跑量化小模型的延迟构成,55-70% 耗在加载权重,加内存到 8 GB 就能让推理快近一倍,部署前值得看。#Google#量化#LLM推理#serverlessrohanpaul_ai@rohanpaul_ai原文稍后读已读值得跟进有用关注 Google