智谱新出的GLM-5.2 (Max)在前端代码测评里拿了开源第一,总分第2,把Claude Opus 4.7甩开29分。写前端的可以关注下。
全部动态
华为开源 openPangu-2.0-Pro(505B/512K,昇腾训练),但 GPQA 87.9 不如 Kimi K3。
DeepSeek 把 V4-Flash 转正了,Agent 跑分超过 GLM-5.2,还适配了 Codex,想用 API 的可以试试。
深度优先实验室的开源模型 dfs-large1 专攻企业代码漏洞,基于 GLM-5.2 训练,性能对标前沿模型,安全团队值得尝试。
MindForge 教小模型从零写完整软件,不用源码只用可执行文件和文档就把 Qwen3.6-27B 在 ProgramBench 上提升了 11.53%,跟大模型差不多。
想用2.8万亿参数的Kimi K3?LM Studio Bionic刚上架,价格透明,还能混搭其他开源模型,值得一试。
团队用不同 AI 工具的话,Nexus 能让它们跑一个平台:自动选模型、控成本,还不改工作方式,省心省力。
Kimi 开源了 K3 模型,Agent Arena 直接干翻 GLM-5.2,净提升超 9%,代码和文本竞技场也是第一,值得关注。
Kimi K3 (Max) 在代码和智能体测试中双料夺冠,连 GLM-5.2 都比它低一截,开发者和研究者可以关注这个新标杆。
Ollama 说 GLM-5.2 太火了,怕服务慢,先暂停 Max 新订阅。Pro 还能买,下周还有大模型上线,想用的话赶紧。
Thomas Wolf讲了个真实故事:HuggingFace被AI智能体入侵,他们用GLM-5.2分析,还和OpenAI联手。比科幻片还刺激。
百度开源了个 30 亿参数的 OCR 模型,能一次读完 100 页 PDF,不用分段处理,海外开发者都说好,Yann LeCun 都转了。
阿里云发了个 2.4T 参数的开源模型 Qwen 3.8 max preview,性能接近 Fable 5,首月才 4 美元,还能在 Claude Code 里用,可以试试。
LongStraw 能让你在固定 GPU 预算下做百万 token 级别的强化学习后训练,比现有 256K 的方法多处理 8 倍上下文,而且内存增长极低。
SGLang让GLM5.2在B300上单用户跑500 tok/s,交互延迟几乎不随上下文增长,对多轮Agent任务很实用。
GLM-5.2的快速模式降价两成,TPS比标准API快1.5~2倍,适合高吞吐的编程助手和智能体场景,有需求的可以关注。
Hy3这个开源模型配Hermes agent能自动搞定电脑上的活,比GLM-5.2小一半,性能却和Opus 4.8差不多,现在还免费,赶紧试试。
Grok-4.5 在编码前端基准里干到了第三,比 4.3 狂升 59 名,跟 GLM-5.2、Claude Opus 4.8 一个水平线。想试试新编码模型的可以关注。
想选行业AI模型?Claude Fable 5 碾压全场,但成本是 DeepSeek V4 Pro 的百倍,性能只多 12 分,性价比得掂量。