9月3日
08:57
08:57SuperTechFans博客/媒体
精选73°
Anthropic推出Claude Fable 5.1和Mythos 5.1,价格降低约25%。Fable 5.1面向公众,Mythos 5.1专用于网络安全和生命科学。新模型在编码、知识工作和长期推理任务上显著超越前代,并推出企业前沿安全措施(EFS)。
事件专题

推荐理由:Anthropic新模型降价25%,Fable 5.1编码能力提升,Mythos 5.1专注网络安全,还新增企业安全功能。
01:35
00:40
00:40Paul Couvert@itsPaulAi
73°
Google发布Gemini 3.8 Flash模型,距离3.7 Flash仅20天。新版本性能与Opus 5和GPT-5.6 Sol相当,但价格仅为前者的1/6和1/5。Google称这是其迄今为止最好的推理和编码模型,包含两个新变体:Gemini 3.8 Flash和Gemini 3.8 Flash Cyber。
事件专题

推荐理由:Google刚发布Gemini 3.8 Flash,性能媲美顶级模型但价格便宜5-6倍,彻底改变了Flash模型的定位。
7月22日
08:09
08:09官方一手marktechpost@Asif Razzaq
精选
Poolside发布Laguna S 2.1,这是一个118B参数的MoE编码模型,每token仅激活8B参数,支持1M上下文。该模型在SWE-Bench Multilingual基准上匹配甚至超越参数规模数倍于它的模型。Laguna S 2.1采用OpenMDW-1.1开放权重许可,可在单台NVIDIA DGX Spark上运行。
事件专题

推荐理由:Poolside出了个小参数但很强的编码模型Laguna S 2.1,8B活跃参数就在SWE-Bench多语言上吊打大模型,还开放权重,单机就能跑。
7月9日
05:27
05:27官方账号OpenAI@OpenAI
OpenAI 在推特上指出,随着编码模型不断进步,现有的评估基准已不足以衡量真实进展。他们强调需要设计更难的测试、更公平的对比和更可靠的结果。这条观点引发社区对当前基准如 SWE-bench 等是否仍有效的讨论。
事件专题

推荐理由:OpenAI 自己说现在的编码测试太简单了,得加点难度和公平性。搞 AI 写代码的可以看看基准怎么改。
6月29日
6月16日
6月12日