主要来源arXiv cs.AI
查看原文事件专题 ·多源确认
Acoustic-to-Text KV压缩:让全双工语音模型长对话内存降64.6%
论文提出 acoustic-to-text KV compression,在全双工语音语言模型的 listening-time slack 区间内,通过转录旁路把语音转成紧凑的文本记忆。推理时 KV 缓存超过预算即淘汰旧声学状态,保留转录与近期声学上下文。旁路用 LoRA 训练,并以知识蒸馏保持原始模型的听说行为。在 MiniCPM-o 4.5 上的实现使十分钟 LongSpeech 会话的峰值流式 KV 缓存降低 64.6%,转录、时序问答和摘要指标同时优于基线,Full-Duplex-Bench 上的停顿、轮次切换和打断表现持平。
当前结论
全双工语音模型聊久了内存会爆,这篇用转录旁路压缩KV,十分钟会话峰值缓存直接砍掉64.6%,性能还不掉。
3 个信源41° AI 热度最后更新 2026/9/25 13:04:09
证据链
3 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。