AITOPAI热报
今日精选全部动态早读东盟 AIAgent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOPAI热报

Qwen3.6

共 6 条相关 AI 资讯
9月1日
11:24
11:24官方账号arXiv cs.AI@Hamed Babaei Giglou, Sören Auer, Jennifer D'Souza
精选73°
研究评估了13个模型,包括Qwen3.5和Qwen3.6系列以及GPT变体,使用OntoLearner管道。在Qwen3.5密集型模型中,参数量增加主要提高精确率而非召回率,9B到27B参数间提升最大。27B密集型模型在术语分类上显著优于更大的稀疏模型,而更大的MoE模型在分类发现上表现最佳。非分类关系提取在所有模型规模上仍具挑战性,特别是在材料数据科学本体上。
论文Qwen3.5Qwen3.6本体学习

推荐理由:Qwen团队研究了13个模型规模对本体学习的影响,发现参数量并非越大越好,架构和模型血统比参数数量更重要。
原文
7月20日
09:24
09:24官方一手marktechpost@Michal Sutter
文章对比了6款在单张24GB GPU上以Q4_K_M量化运行的开放权重模型,包括Qwen3.6、Gemma 4、Mistral Small、gpt-oss-20b和DeepSeek-R1-Distill。每个模型列出了VRAM占用、许可协议和擅长任务。例如Qwen3.6在代码生成方面表现突出,DeepSeek-R1-Distill推理能力较强。读者可根据需求选择适合的本地模型。
技巧Qwen3.6Gemma 4Mistral Small
事件专题

推荐理由:想用24GB显卡跑本地模型?这篇文章直接对比了6款主流开源LLM,告诉你选哪个干哪种活,省得自己试。
原文
7月15日
08:53
08:53Paul Couvert@itsPaulAi
PrismML今天推出Bonsai 27B,首个能在手机上运行的27B参数多模态模型。基于Qwen3.6 27B,提供两个变体:三元版5.9GB(1.71位/权重)和1-bit版3.9GB(1.125位/权重)。该模型支持多步推理、结构化工具使用和长上下文智能体循环。全部代码和权重已开源(Apache 2.0),此前运行类似模型需要千美元级电脑。
AI模型Bonsai 27BPrismMLQwen3.6

推荐理由:27B模型能塞进手机,3.9GB就跑得动,还完全开源。手机党不用再羡慕桌机了。
原文
04:39
04:39elvis@omarsar0
精选
PrismML 今日发布 Bonsai 27B,这是首个可在手机上本地运行的 27B 参数多模态模型。基于 Qwen3.6 27B,Bonsai 27B 支持多步推理、结构化工具使用、长上下文和智能体循环。Ternary 变体仅 5.9 GB(1.71 有效比特/权重),1-bit 变体仅 3.9 GB(1.125 有效比特/权重),大幅降低本地部署门槛。在 RTX 5090 上,1-bit 版本达到 163 tok/s,Ternary 版本达到 134 tok/s;在 M5 Max 上分别为 87 tok/s 和 58 tok/s。模型以 Apache 2.0 许可证开源。
AI模型Bonsai 27BPrismMLQwen3.6

推荐理由:手机能跑 27B 模型了?PrismML 的 Bonsai 27B 实际做到了——体积最小 3.9GB,速度还不慢,开源免费。想本地用大模型又嫌大的可以看。
原文
5月19日
20:59
20:59Julien Chaumond@julien_c
llama.cpp 支持 MTP(多 token 预测),这是一种内置于模型中的推测解码,可将 token 生成速度提升约 2 倍。需要升级 llama.cpp 到 build 9200 以上(可使用 brew install --HEAD)。可选 Dense 27B 或 35B A3B MoE 模型,前者在 48-64GB 内存下约 30 tok/s,后者可达约 100 tok/s。运行命令为 llama-server 加上 --spec-type draft-mtp 参数。
技巧llama.cppMTPQwen3.6

推荐理由:教你用 Qwen3.6 跑出 2 倍速推理
原文
5月14日
16:33
16:33berryxia@berryxia
UnslothAI 创始人 Daniel Han 发布了 Qwen3.6 的实验性 MTP GGUF 版本,通过投机解码技术大幅提升推理速度。27B 模型在单 GPU 上达到 140 tokens/s,35B-A3B 版本更达 220 tokens/s,比原版 GGUF 快 1.4 倍且精度无损。最佳 draft tokens 设为 2,过高会导致接受率下降。这一突破显著提升了本地大模型的性能上限,让消费级显卡能更高效运行 30B+ 参数模型。
AI模型Qwen3.6GGUF投机解码

推荐理由:本地大模型性能天花板被再次抬高,玩 llama.cpp、跑本地 Agent 或日常 coding 的开发者可以直接用上,体验 30B+ 模型在消费级显卡上的流畅速度。
原文
精选动态早读东盟登录