AITOPAI热报
今日精选全部动态早读东盟 AIAgent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOPAI热报

KV-Cache

共 2 条相关 AI 资讯
8月4日
04:59
04:59官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA在AI Model Co-Design系列中发文指出,长上下文模型的推理速度在训练前就已被架构选择决定。随着上下文窗口扩大,注意力机制在推理成本中的占比快速上升,逐渐成为主要负担。文章梳理了4个决定性能上限的架构参数:group size、head dimension、KV-cache size和并行策略。这些选择同时影响系统吞吐量和单个用户的响应速度。
技巧NVIDIA长上下文KV-Cache
事件专题

推荐理由:NVIDIA这篇博文把长上下文模型变慢的根源讲透了,训练前选对4个架构参数,服务成本能差很多。
原文
7月24日
09:38
09:38官方账号arXiv cs.AI@Peng Xie
确定性KV-Cache驱逐保留top-k token,论文证明该方法无法估计被丢弃内容导致的注意力输出误差。随机化驱逐通过泊松采样尾部并应用Hájek校正,在softmax中实现,保留集上的方差估计可作为每步误差证书,经验覆盖率达0.97且无精度损失。在真实工作负载上预注册七个主张,其中三个被否定:问题感知驱逐在25-50%预算下近乎免费;输出对数概率比证书更好预测失败;证书门控预算升级无增益。留存结果为:证书可分离缓存引发与固有失败(AUC 0.73-0.75,输出置信度仅0.47-0.54),并比随机或置信度门控更优地安排重计算。
论文KV-Cache驱逐策略误差证书

推荐理由:一篇论文证明了随机化KV-Cache驱逐能提供误差证书,覆盖率达97%。如果你关心推理加速中的精度损失量化,这方法很实用。
原文
精选动态早读东盟登录