全部动态
GPT-5.6 的 Sol 版在 Agent Arena 上表现亮眼,比 Terra 和 Luna 都强,直接对标 Claude Opus 4.8。想了解新模型实力的话可以看看。
Anthropic 出了 Opus 5,接近 Fable 5 的能力但便宜一半,agent 编程和知识工作更强,快去 Poe 试试。
如果你看重模型回答的准确性,LMSys 新出的事实性排名很有参考价值。Claude Opus 5 这次在最重视事实的榜单上拿了第一,比之前只看人类偏好的排名更实在。
Anthropic 的 Claude Opus 5 在多个 Arena 基准上拿了第一,价格还比 Fable 5 便宜一半。做前端编码或文档推理的朋友可以重点关注。
Kimi K3在Fireworks上刚上线,3万亿参数、1M上下文、原生视觉,性能不输Opus但便宜好几倍,做高性价比推理就选它。
Kimi 开源了 K3 模型,Agent Arena 直接干翻 GLM-5.2,净提升超 9%,代码和文本竞技场也是第一,值得关注。
Kimi K3 (Max) 在代码和智能体测试中双料夺冠,连 GLM-5.2 都比它低一截,开发者和研究者可以关注这个新标杆。
微软新MAI-CYB模型和智能体框架号称gamechanger,赶紧去官网注册体验,看看比现有智能体强在哪。
快看,MAI-Cyber-1-Flash在安全基准上拿96%,比Mythos高12个点还便宜一半,性价比炸裂!
微软的新安全模型MAI-Cyber-1-Flash,比Anthropic Mythos高出12个点,成本还减半,搞网络安全的可以盯着。
Anthropic 的 Claude Code 之父 Boris Cherny 在 YC Startup School 上揭秘 Opus 5 的新特性,还分享了删除 80% 系统提示的实战经验。想了解下一代模型和 Agent 构建思路?这视频干货十足。
Cognition 把 Kimi K3 放进 Devin 桌面和终端了,在 FrontierCode 上接近前沿水平,开源模型里很能打。
Kimi 新旗舰 K3 登上 Ollama,2.8T MoE 超强视觉理解,还能直接配合 Claude Code 用,性能提升 2.5 倍每单位计算。
微软用MAI-Cyber-1-Flash模型和MDASH组合,用一半钱做到顶级安全性能,还带了Project Perception智能体干活。
Kimi K3 在真实工程任务基准上拿了 58.2%,而且在 Devin 里特别擅长修 bug 和管理环境,值得做开发的看看。
Cognition 把 Kimi K3 放进 Devin 了,在 FrontierCode 上接近顶尖水平,而且是开源,想试最新的编码模型可以直接用。
Fireworks 上了首个3万亿参数的开放模型 Kimi K3,百万上下文加视觉,推理不输闭源,还零数据保留,上手试试。
Kimi K3 便宜到离谱,$3 输百万 token,推理性能还不输 Claude 和 GPT-4o,想省钱搞推理的可以试试。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档