02:33官方账号Andrew Ng@AndrewYNgAndrew Ng 联合 RedHat 推出新课程,教你如何高效服务大语言模型,以低延迟和合理成本处理大量并发用户。课程核心包括量化降低模型内存占用(如 70B 模型权重约 140GB)以及使用 vLLM 的智能内存管理(如 KV 缓存)来提升并发处理能力。学员将学会量化模型并权衡精度、用 vLLM 部署并观察并发效果、以及基准测试以在速度、成本和精度间做决策。课程适合想优化 LLM 部署的开发者,可直接在 deeplearning.ai 上学习。AI产品LLM 服务量化vLLM推荐理由:做 LLM 部署的开发者终于有了系统课程——量化降内存 + vLLM 处理并发,直接上手就能优化成本,建议点开学。原文稍后读已读值得跟进有用关注 LLM 服务
12:06官方一手arXiv: DeepSeek@Boao Kong, Weichen Jia, Engao Zhang, Guohong Li, Yonghan Dong, Yao Wang, Yaoyuan Wang, Yunke Peng, Kun Yuan低精度训练在降低大模型训练成本的同时,常因少数算子的数值不稳定导致训练失败。论文提出GNMR(梯度范数与均值比)轻量控制器,通过比较当前梯度范数与历史均值,并结合Δ-GNMR检测短窗口内的突变,在固定预算和锁定间隔内执行恢复操作,无需改变数值格式或底层实现。在激活量化、DeepSeek式训练和LLaMA-2 13B微调等场景中,GNMR以稀疏的恢复动作保持高保真质量。该方法为低精度训练提供了一种后端无关的稳定性控制方案。论文低精度训练训练稳定性GNMR推荐理由:低精度训练是降低大模型成本的关键,但数值不稳定常让训练白费。GNMR用轻量控制解决了这个痛点,做大规模训练或量化训练的团队值得关注,可以直接集成到现有流程中。原文稍后读已读值得跟进有用关注 低精度训练
11:58官方账号arXiv cs.LG@Xinyu Wang, Mingze Li, Sicheng Lyu, Dongxiu Liu, Kaicheng Yang, Ziyu Zhao, Yufei Cui, Xiao-Wen Chang, Peng Lu精选Ω-QVLA是首个无需训练的后训练量化框架,能将视觉-语言-动作模型的语言骨干和扩散动作头统一压缩至W4A4精度,打破此前认为动作头必须混合精度的认知。它通过复合SVD-Hadamard旋转均衡权重能量并分散激活异常值,结合逐步骤的DiT激活缩放量化吸收去噪步间的动态范围漂移。在LIBERO基准上,Pi 0.5和GR00T N1.5经量化后任务成功率分别达98.0%和87.8%,与FP16参考值持平或略优,静态内存占用降低71.3%。真实机器人操作实验也验证了其流畅精准的控制能力。代码已开源。论文量化VLA模型Pi 0.5推荐理由:做机器人或边缘部署VLA模型的团队终于有了统一量化方案——内存省71%且性能不降,Pi 0.5和GR00T N1.5用户可以直接用代码复现。原文稍后读已读值得跟进有用关注 量化
11:45官方账号arXiv cs.AI@Maoyang Xiang, Bo Wang, Tao Luo精选OrpQuant提出了一种名为正交残差投影(ORP)的算法-硬件协同设计框架,用于解决低比特Power-of-Two(PoT)量化中的低角度分辨率问题。该方法通过双基几何投影自适应合成更高分辨率的残差格点,仅使用移位和加法操作,避免了乘法器。在LLaMA-2-7B上,3比特量化(W3/A16)下困惑度达到6.10,与AWQ等MAC密集型方法相当,且全模型校准仅需约15分钟。在28nm工艺下,RTL综合表明ORP有效缓解了密集乘法器树的时序瓶颈。该工作适用于LLM和ViT的边缘部署。论文量化边缘部署LLM推荐理由:OrpQuant解决了低比特量化中特征流形退化的问题,做边缘部署的开发者可以直接用这个15分钟校准的方案替代传统MAC密集型方法,硬件效率显著提升。原文稍后读已读值得跟进有用关注 量化
05:31官方一手marktechpost@Asif Razzaq72°Together AI 开源了 OSCAR,一种面向长上下文 LLM 推理的 INT2 KV 缓存量化方法。与依赖数据无关的 Hadamard 变换不同,OSCAR 通过离线估计注意力感知的协方差结构,为键和值分别推导旋转矩阵。在 Qwen3-4B-Thinking-2507 和 Qwen3-8B 上,OSCAR 以每 KV 元素 2.28 比特的精度,将 BF16 精度差距分别缩小至 3.78 和 1.42 分。该方法可实现约 8 倍的 KV 内存缩减,并在 100K 上下文长度下带来最高 3 倍的解码加速。AI模型量化KV 缓存长上下文推荐理由:长上下文 LLM 推理的内存瓶颈终于有了实用解法——OSCAR 在 2-bit 量化下几乎不损失精度,做长文档/多轮对话推理的团队可以直接集成,显著降低硬件成本。原文稍后读已读值得跟进有用关注 量化
10:45官方一手arXiv: DeepSeek@Mao Zheng, Zheng Li, Tao Chen, Bo Lv, Mingrui Sun, Mingyang Song, Jinlong Song, Hong Huang, Decheng Wu, Hai Wang, Yifan Song, Yanfeng Chen, Guanwei Zhang, Guanghua Yu, Yi Su, Hong Liu, Jinxiang Ou, Keyao Wang, Weile Chen, Haozhao Kuang, Kai Wang, Nuo Chen, Zihao Zheng, Chenhao Wang, Bin Xing, Chengcheng Xu, Tinghao Yu, Binghong Wu, Long Xu, Jiacheng Shi, Yunhao Wang, Baifang Chen, Lei Zhang, Qi Yang, Zhao Wu, Jiacheng Li, Lan Jiang, Lanrui Wang, Kai Zhang, Shuaipeng Li, Zhongzhi Chen, Weixuan Sun, Jiaqi Zhu, An Wang, Wei Li, Jun Xia, Weidong Han, Wutian Yang, Litong Hui, Luoguo Jia, Jiajia Wu, Xinpeng Zhou, Tianxiang Fei精选Hy-MT2 是一系列面向复杂真实场景的快速多语言翻译模型,包含 1.8B、7B 和 30B-A3B(MoE)三个尺寸,支持 33 种语言间的翻译。通过 AngelSlim 1.25-bit 极端量化,1.8B 模型仅需 440MB 存储,推理速度提升 1.5 倍,适合端侧部署。在通用、商业、领域和指令跟随翻译任务中,7B 和 30B 模型在快速思考模式下超越 DeepSeek-V4-Pro 和 Kimi K2.6 等开源模型,1.8B 模型整体也优于微软和豆包等主流商业 API。该工作为多语言翻译提供了高效且强大的新选择。AI模型多语言翻译Hy-MT2端侧部署1 个信源在谈事件专题推荐理由:做多语言翻译或端侧部署的团队终于有了一个又快又准的选择——1.8B 量化后 440MB 就能跑,性能还超过微软豆包 API,值得直接上手试。原文稍后读已读值得跟进有用关注 多语言翻译
01:41AK@_akhaliqMix-Quant 是一种针对智能体大语言模型(LLM)的量化方法,旨在解决预填充阶段(Prefilling)和精确解码(Precise Decoding)的平衡问题。该方法通过量化预填充来加速推理,同时保持解码阶段的精度,特别适用于需要快速响应和准确输出的智能体应用。Mix-Quant 在保持模型性能的同时,显著降低了计算成本和内存占用,为智能体系统的部署提供了更高效的方案。该技术有望推动智能体LLM在实时交互和资源受限场景中的实际应用。AI模型量化智能体推理优化推荐理由:做智能体LLM部署的团队终于有了兼顾速度和精度的量化方案——Mix-Quant 解决了预填充慢、解码不准的痛点,建议做推理优化的开发者点开看看。原文稍后读已读值得跟进有用关注 量化
20:19Hunyuan@TXhunyuan腾讯混元发布 Hy-MT2 开源多语言翻译模型,支持 33 种语言无缝互译。7B 和 30B-A3B 版本在多项翻译任务上超越参数大数十倍的模型,轻量 1.8B 版本甚至优于微软等商业 API。模型采用腾讯 AngelSlim 1.25-bit 极致量化,仅需 440MB 存储,可在主流移动芯片上本地推理,速度比 Hy-MT1.5 快 1.5 倍。项目已在 GitHub、Hugging Face 等平台开源。AI模型开源/仓库翻译模型腾讯混元推荐理由:做多语言翻译的开发者终于有了能本地跑的开源模型——Hy-MT2 的 1.8B 版本比微软 API 还强,且量化后仅 440MB,手机芯片就能推理,建议直接下载试试。原文稍后读已读值得跟进有用关注 开源/仓库
13:07Qdrant@qdrant_engineQdrant 宣布其向量数据库现已集成 TurboQuant 量化技术。相比现有的 SQ(标量量化)和 BQ(二进制量化),TurboQuant 在相同存储预算下提供比 BQ 更好的召回率,同时达到约 2 倍压缩比且召回率与 SQ 相当。这为需要高效向量存储和检索的用户提供了新的选择。Qdrant 将于 5 月 26 日举办线上技术会议,详解 TurboQuant 原理、基准测试和实际应用场景。AI产品向量数据库量化Qdrant推荐理由:做向量检索或使用 Qdrant 的团队,TurboQuant 能帮你用更少存储获得更好召回,值得关注 5 月 26 日的技术分享。原文稍后读已读值得跟进有用关注 向量数据库
11:17官方账号arXiv cs.LG@Saisab Sadhu, Pratinav Seth, Vinay Kumar Sankarapu精选73°现有机器遗忘评估仅在全精度模型上进行,但实际部署的语言模型都会经过量化。研究发现,4-bit量化可以逆转梯度下降法的遗忘效果,而能抵抗量化的方法又几乎不改变模型。MANSU通过因果电路归因定位最小遗忘子图,结合零空间投影和参数幅度下限,首次实现了遗忘效果在量化后不反弹。该方法还提出了电路归因散度(CAD)作为新的验证指标,能区分结构擦除与行为抑制。实验表明,MANSU在多个模型和基准上同时满足遗忘、保留、抗量化和结构擦除四个目标。论文机器遗忘量化因果归因推荐理由:量化会悄悄恢复你辛苦抹掉的知识——MANSU解决了这个部署中的致命漏洞,做模型安全和对齐的团队值得关注这个新方法。原文稍后读已读值得跟进有用关注 机器遗忘
09:53官方账号arXiv cs.AI@Thomas Witt精选73°XFP是一种针对大语言模型推理的动态权重量化器,它颠覆了传统工作流:用户只需指定每通道余弦相似度的重建质量阈值(注意力与共享专家用严格阈值,路由专家MoE用宽松阈值),XFP自动确定码本大小、异常值预算和每层打包方式,无需Hessian矩阵、校准数据或手动位宽选择。每个权重矩阵被分解为稀疏fp16异常值残差和密集的子字节索引张量(指向每组的可学习码本)。在Qwen3.5-122B-A10B模型上,XFP在RTX PRO 6000 Blackwell工作站上实现138 tok/s单流解码,GSM8K准确率94.49%,比Marlin INT4快49%。对于无法装入目标内存的模型,XFP提出H-Process:通过迭代两个余弦阈值找到刚好能装入模型且输出合理的操作点。在Qwen3.5-397B-A17B上,H-Process将全部专家装入2×96 GB内存(约3.4有效比特),实现100.9 tok/s长输出解码,GSM8K准确率66.72%,在内存、吞吐量和准确率上同时超越带路由专家剪枝的INT4。论文量化LLM推理码本量化推荐理由:XFP解决了LLM量化中手动调参和校准数据依赖的痛点,做模型部署和推理优化的团队可以直接用上自动化的高质量量化方案,省去大量调参时间。原文稍后读已读值得跟进有用关注 量化
13:27官方账号arXiv cs.AI@Or Ordentlich, Yury Polyanskiy精选本文是量化矩阵乘法研究的第二部分,探讨在第二因子列协方差矩阵已知时的量化策略,该场景常见于大语言模型的权重量化后训练。作者展示了经典的水填充法(waterfilling)如何改进现有LLM量化算法(如GPTQ),后者目前均匀分配比特率。分析表明,仅使用标量INT量化器的WaterSIC方案在高率下性能与信息论极限相差仅0.25比特/条目,且不受随机旋转影响。而GPTQ在随机旋转下与WaterSIC差距在0.1比特以内,表明其在高率下也接近最优。论文量化LLM水填充法推荐理由:做LLM量化的开发者终于有了理论指导——水填充法比均匀分配更优,GPTQ加随机旋转就能接近极限,建议做权重量化的团队点开看看具体实现。原文稍后读已读值得跟进有用关注 量化
19:12官方账号arXiv cs.LG@Tanmaey Gupta, Hayden Prairie, Xiaoxia Wu, Reyna Abhyankar, Qingyang Wu, Austin Silveria, Pragaash Ponnusamy, Jue Wang, Ben Athiwaratkun, Leon Song, Tri Dao, Daniel Y. Fu, Chris De Sa精选量化是加速生成模型推理的标准技术,但传统块浮点(BFP)格式使用基于块最大幅度的固定缩放因子,可能导致量化误差次优。本文提出ScaleSearch方法,通过细粒度搜索利用微缩放格式的尾数位,最小化量化误差。ScaleSearch可集成于后训练量化(PTQ)和低精度注意力机制,实验显示NVFP4量化误差降低27%,Qwen3-8B在MATH500上PTQ提升15点。此外,ScaleSearchAttention算法在Llama 3.1 70B上实现Wikitext-2困惑度降低0.77点,几乎无性能损失。论文量化块浮点NVFP4推荐理由:做模型量化和推理加速的团队终于有了更优的缩放策略——ScaleSearch直接提升精度且兼容现有方法,建议做低精度部署的开发者试试。原文稍后读已读值得跟进有用关注 量化
03:14官方一手OpenAI Blog(博客/媒体)OpenAI举办的Parameter Golf活动吸引了超过1000名参与者和2000多份提交,旨在探索在严格约束下AI辅助机器学习研究、编码智能体、量化及新型模型设计。活动揭示了AI在极端资源限制下的科研潜力,强调了人与AI协作的创新边界。关键成果包括对量化技术的优化和新型模型架构的涌现,表明AI不仅能加速常规任务,还能激发人类研究者的创意。行业AI辅助研究编码智能体量化推荐理由:该活动为AI辅助研究提供了实证,展示了在严格约束下人类与AI协作所能达到的效果,对理解AI在科研中的角色有参考价值。原文稍后读已读值得跟进有用关注 AI辅助研究