Compact

general · 首次出现 2026-05-22 · 最近出现 2026-09-26 · 累计提及 84

综述

Compact在AI领域指模型优化技术,通过量化、压缩和缓存等手段降低模型体积和计算成本,同时保持性能稳定。近期Compact技术发展迅速,成为AI应用落地的关键支撑。

Compact 近期进展

  • 25%的成本降幅:Opus 5.5通过优化缓存机制显著降低了运行成本,实测数据显示成本降低约25%。这一突破性进展展示了Compact技术在资源利用效率方面的巨大潜力。Opus 5.5 实际省多少:缓存机制决定账单,实测成本降约 25%
  • 混合精度量化:OpenBMB团队开发的FIT-GGUF技术为MiniCPM5-2B模型带来了可控体积的混合精度量化,实现了模型大小与性能的平衡。FIT-GGUF 为 MiniCPM5-2B 带来可控体积的混合精度量化
  • 12倍性能提升:微软最新发布的1.139版VS Code中,Agent会话首次加载提速约12倍,这得益于Compact技术在上下文管理和资源优化方面的应用。微软发布 1.139 版 VS Code:Agent 会话首次加载提速约 12 倍
  • Token消耗减半:Nvidia团队新论文提出的AI自动优化框架能够节省一半token消耗,这为大规模AI应用提供了更经济的运行方案。Nvidia 团队新论文:AI 自动优化框架节省一半 token
  • 当前焦点与观察点

    Compact技术正成为AI领域的研究热点,各科技巨头纷纷投入资源开发相关解决方案。宝玉分享的工作流显示,Fable 5写方案配合GPT-5.6执行并自动验收的流程,通过Compact技术实现了更高效的AI应用。宝玉分享省钱工作流:Fable 5 写方案,GPT-5.6 执行并自动验收

    上下文管理是Compact技术的另一重要方向。Harrison Chase提出的Deep Agents上下文管理方法,以及shao__meng分享的Claude Code会话价值最大化指南,都从不同角度探索了如何通过Compact技术优化AI系统的资源利用。Deep Agents 上下文管理方法 Claude Code 会话价值最大化指南:从缓存、上下文到 Subagent 成本优化

    成本模型解析显示,Compact技术在不同场景下的表现存在差异。shao__meng对CC成本模型的解析揭示了bug修复过程中token消耗的差异,这为Compact技术的进一步优化提供了方向。CC 成本模型解析:bug 修复 token 消耗差异

    随着AI应用的普及,Compact技术的重要性日益凸显。Fable 5.1缓存价格下降建议表明,市场对Compact技术的需求持续增长,同时也反映出技术成熟度的提升。Fable 5.1 缓存价格下降建议

    小互在Codex中为GPT-5.6 Sol启用1M上下文窗口的实践,展示了Compact技术在处理大规模上下文时的应用潜力,这为未来AI系统的发展提供了新思路。在 Codex 中为 GPT-5.6 Sol 启用 1M 上下文窗口

    相关报道

    10 条在档