AITOPAI热报
今日精选全部动态早读东盟 AIAgent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOPAI热报

llama.cpp

共 4 条相关 AI 资讯
7月28日
16:20
16:20官方一手marktechpost@Sana Hassan
本教程使用PrismML分支的llama.cpp部署1-bit Bonsai-27B模型。该分支提供了专门CUDA内核,用于解码模型的Q1_0_g128 GGUF量化格式。教程展示了如何设置本地服务器,并通过兼容OpenAI的API接口进行推理调用。整个过程省去了云端依赖,适合低成本本地部署。
技巧Bonsai-27BPrismMLllama.cpp

推荐理由:想本地跑Bonsai-27B?用PrismML的llama.cpp加上1位量化,速度起飞,还能直接用OpenAI API调用。
原文
7月15日
12:45
12:45Hunyuan@TXhunyuan
腾讯混元发布了Hy3的1-bit和4-bit量化版本,该模型拥有295B参数。通过1-bit和4-bit量化,模型可在单张GPU上运行,大幅降低硬件门槛。支持使用llama.cpp进行推理,并启用MTP(多token预测)功能。模型以GGUF格式提供下载,用户可快速体验。
AI模型Hy3TencentHunyuan量化模型

推荐理由:腾讯把295B的模型压到1-bit和4-bit,单卡就能跑,用llama.cpp就能玩,赶快试试。
原文
5月25日
06:49
06:49官方账号Clement Delangue@ClementDelangue
精选
llama.cpp 新增 MTP(Multi-Token Prediction)支持,使本地模型推理速度大幅提升。在 A10G 上测试 Qwen3.6-27B 模型,生成速度从 25 tok/s 提升至 45 tok/s,增幅达 78%。这一优化让本地模型具备了作为日常驱动力的实用性,对本地部署和隐私敏感场景意义重大。开发者可直接在 llama.cpp 中启用 MTP 功能,体验更流畅的本地推理。
AI模型llama.cppMTP/多令牌预测本地推理

推荐理由:本地模型速度翻倍,做本地部署的开发者终于可以告别卡顿,建议直接试试 MTP 支持。
原文
5月19日
20:59
20:59Julien Chaumond@julien_c
llama.cpp 支持 MTP(多 token 预测),这是一种内置于模型中的推测解码,可将 token 生成速度提升约 2 倍。需要升级 llama.cpp 到 build 9200 以上(可使用 brew install --HEAD)。可选 Dense 27B 或 35B A3B MoE 模型,前者在 48-64GB 内存下约 30 tok/s,后者可达约 100 tok/s。运行命令为 llama-server 加上 --spec-type draft-mtp 参数。
技巧llama.cppMTPQwen3.6

推荐理由:教你用 Qwen3.6 跑出 2 倍速推理
原文
精选动态早读东盟登录