这篇论文造了个很较真的基准:不看智能体能不能把指标刷上去,只看它交付的模型到底行不行,连"训练了但没学到东西"这种静默失败都能抓住,四个前沿模型全被拉出来和人类工程师对比。
全部动态
Anthropic拟10月在新加坡设亚太第五个办事处 开放本地招聘 数据显示,按人口比例计算,新加坡的Claude.ai使用水平在121个国家中排名第二。 我们观察到,人工智能公司Anthropic计划于10月在新加坡设立其亚太地区的第五…
谷歌搞了个叫 Stellar Colosseum 的多代理框架,专门用来做数学和理论计算机科学这种需要长期研究的活儿,比单模型干得更好。
Claude、GPT-5和Gemini在代码生成时加入执行约束后,代码效率大幅提升,最高快3.1倍。
GoogleDeepMind 新发布的 Gemini 3.8 Flash (High) 在多个竞技场表现优异,成本比同类模型低 44-50%。
Poonam Soni 在 Replit 上比较了 Free Mode、Gemini 3.7 Flash、Grok 4.6 和 Claude Opus 5,看看哪个在创建 Subway Surfer 克隆时表现最佳。
LangChain出新版了,接上了OpenAI 3.0 SDK,还支持Gemini 3.7 Flash,修了一堆工具调用的坑,用起来更稳。
谷歌把 Gemini 3.7 Flash 开放给 Pro/Ultra 用户了,处理多文件邮件这种复杂活更准,Spark 智能体也更靠谱。
谷歌这周新品不少:Pixel 11有AI拍摄,Gemini 3.7 Flash更强,天气模型WeatherNext 2开源还能多一天预报。
Google 刚发的 3.7 Flash,Genspark 当天就能用,编码和 agent 更强,价格砍半,想试的直接切。
Gemini 3.7 Flash 转正了,编码和智能体跑分大涨,价格还砍半。生产环境被 Preview 并发坑过的话,可以上手试试。
Simon Willison 的 LLM 插件更新了,现在能直接用 Gemini 3.7 Flash,还能看推理过程、开工具跑 Python,装新版就能体验。
谷歌把 Gemini 3.7 Flash 价格砍到 3.6 的一半,编程和智能体场景变强了,还直接给 Spark 用上,搞开发可以试试。
Google 的 Gemini 3.7 Flash 上 Poe 了,1M 上下文,跑代码和 Agent 都快,想试就去 Poe 找。
Devin 里现在有 Gemini 3.7 Flash 了,代码能力接近 Sonnet 5,价格便宜一半多,月底前还打五折,快去试试。
Devin现在能用Gemini 3.7 Flash了,跑FrontierCode 1.1和Claude Sonnet 5差不多,成本砍半还快,写代码可以试试。
Google 的 Gemini 3.7 Flash 上线 GitHub Copilot 了,写代码和智能体任务都有改善,在 Copilot 里就能直接用。
谷歌突袭发布Gemini 3.7 Flash,AutomationBench拿到30%,比贵一倍的模型还强。做智能体自动化任务可以试试。
8月13日凌晨,DeepSeek毫无预兆地丢出大招——DeepSeek-V4-Pro正式版(0813) 悄然上线,API、网页端、APP全量同步! 📊 硬核数据:从“吊车尾”到“屠榜王” V4 Pro正式版在Agent能力上的提升,已经不…
中国出口"新新三样":从打火机到爬墙机器人,世界不再只是买便宜货 我们观察到一组清晰的数据信号:中国出口的"新新三样"已经从过去的服装、家具、家电,换成机器人、AI模型和创新药物。这不是产业升级的修辞游戏,而是发生在澳大利亚和巴西的实证样…
Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索…
DeepSeek-V4-Flash-0731:当版本号成为信息泡沫的容器 我们观察到 DeepSeek-V4-Flash-0731 在站内 rawitems 与 items 数据流中高频出现。需要先声明一个基本口径:截至本文撰写时,Dee…