Mem0 把 GPT-5.6-Luna、MiniMax M3、Claude Sonnet 5 扔进 Hermes 和 Claude Code 两套框架跑分了,排行榜在 dolphinbench.ai,可以直接看哪个模型换框架后掉分最少。
全部动态
Anthropic 预告 Claude Sonnet 5.5 和 Haiku 5.5 几周内就来,主打性能、效率和安全三方面升级,用 Claude 的可以蹲一下。
Anthropic 亲自预告了,Sonnet 5.5 和 Haiku 5.5 几周内就来,性能效率安全都会升级,等发布再细看。
Anthropic拟10月在新加坡设亚太第五个办事处 开放本地招聘 数据显示,按人口比例计算,新加坡的Claude.ai使用水平在121个国家中排名第二。 我们观察到,人工智能公司Anthropic计划于10月在新加坡设立其亚太地区的第五…
Devin 里现在有 Gemini 3.7 Flash 了,代码能力接近 Sonnet 5,价格便宜一半多,月底前还打五折,快去试试。
Devin现在能用Gemini 3.7 Flash了,跑FrontierCode 1.1和Claude Sonnet 5差不多,成本砍半还快,写代码可以试试。
AgileRL 把 Nemotron 3.5 Lightning 放到 Arena 上微调,6 小时就能超过 Claude Sonnet 5,训练完权重还归你。
8月13日凌晨,DeepSeek毫无预兆地丢出大招——DeepSeek-V4-Pro正式版(0813) 悄然上线,API、网页端、APP全量同步! 📊 硬核数据:从“吊车尾”到“屠榜王” V4 Pro正式版在Agent能力上的提升,已经不…
Anthropic 不涨价还永久降价,跑 agent 和用 Claude Code 的这回真能省一笔,比 GLM 5.2 都便宜了。
中国出口"新新三样":从打火机到爬墙机器人,世界不再只是买便宜货 我们观察到一组清晰的数据信号:中国出口的"新新三样"已经从过去的服装、家具、家电,换成机器人、AI模型和创新药物。这不是产业升级的修辞游戏,而是发生在澳大利亚和巴西的实证样…
Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索…
DeepSeek-V4-Flash-0731:当版本号成为信息泡沫的容器 我们观察到 DeepSeek-V4-Flash-0731 在站内 rawitems 与 items 数据流中高频出现。需要先声明一个基本口径:截至本文撰写时,Dee…
Anthropic 新出的 Claude Sonnet 5 主打智能体能力,Agent Arena 排第6,能自己规划并用工具完成任务。关心自主执行模型的可以看看它的实际表现。
想对比 Claude Sonnet 5 和 4.6 的文本能力?这份分析告诉你它在专家级提示上更强,但其他类别反而差了。
Anthropic 的 Claude Sonnet 5 写前端代码得分比上代高 29,还超过 Opus 4.6。搞前端的可以试试它的自主编程能力。
Dify 现在可以直接跑 Claude Sonnet 5 了,编码、智能体、计算机使用都能可视化搭建,不用写胶水代码,适合快速搭复杂工作流。
Claude Sonnet 5 性价比很高,只要 Opus 4.8 六折的价格,部分任务还打平,适合想省钱的团队。
听说了吗?Google 和 Anthropic 今晚可能要发新模型,Claude Sonnet 5 和 Google 新模型,可以蹲一下。
Anthropic 出了 Sonnet 5,能自己规划任务、用浏览器和命令行,比 Sonnet 4.6 强,但比 Opus 便宜,适合想搞 Agent 又不想花大钱的人。
Cognition 把 Claude Sonnet 5 放进了 Devin,编码更强还便宜,比 Opus 4.8 还厉害。
Cognition 用 FrontierCode 实测了 Sonnet 5 的工程能力,它比 Opus 4.8 更强,值得关注。
Anthropic 发布了更智能的 Sonnet 5,能在 Agent Arena 里自主用浏览器和终端干活,比几个月前的大模型还强。
以后不用手动换模型版本了,用 OpenRouter 的这个别名自动跟着 Anthropic 走,省心。
Perplexity Pro和Max用户现在能用Claude Sonnet 5当编排模型了,写长代码或复杂查询更稳。
Anthropic的Sonnet 5来了,Agent能力接近最贵的Opus,价格才40%。以前会卡住的复杂任务现在能跑完,还自己检查输出。默认模型升级值得一试。
Anthropic的新Claude Sonnet 5直接集成到GitHub Copilot,写代码尤其是命令行任务更强了,延迟更低,试试看。
Anthropic出了Claude Sonnet 5,编码和智能体能力比4.6强很多,知识工作分数甚至超过了Opus 4.8,值得试试。
今晚三个模型扎堆发:Google 的🍌和Omini低配版,加上Claude Sonnet 5,都是新东西,可以蹲一波。