全部动态
Sam Altman发了Sol和Terra,一个和GPT-5.5同价,一个半价性能差不多,但被美国政府卡住只能预览,挺有意思的。
OpenAI 一口气发了三个 GPT-5.6 变体:Sol 跑前沿任务、Terra 干日常活、Luna 省成本,按需挑就行。
OpenAI 的 GPT-5.6 Sol 编程跑分超过了 Claude Mythos 5,Ultra 模式更强,价格三档可选,值得一看。
OpenAI 发布了 GPT-5.6 三兄弟,Sol 旗舰带 Ultra 模式,能协调多个 subagent 干活,在命令行任务上直接 91.9%。日常用 Terra 性能持平 5.5 但价格砍半,适合干活党。
Fireworks和Faros拿真实工程任务实测GLM-5.2,结果比Opus 4.8和GPT-5.5都更便宜更快,得分还高。想为代码任务选模型可以看看这个。
想知道你用的AI聊天机器人有没有政治立场?《华盛顿邮报》测了GPT-5.5、Grok和Gemini 3.1 Pro,结果左倾现象普遍,连Grok都没逃过。来看看数据。
有传闻说智谱的 GLM-5.5 可能八月上线,要和 Claude 和 GPT 的新版硬刚,吃瓜群众可以蹲一下。
Google 把屏幕操控塞进了 Gemini 3.5 Flash,OSWorld 得分和 GPT-5.5 差不多。开发者直接用 API 就能做自动化,很实在。
Unsloth把GLM-5.2压到1-bit,Mac Studio上跑21 tok/s,创意性居然不输Claude Opus,本地部署党有福了。
Mistral OCR 在 ParseBench 上打败了 GPT-5.5,离 Gemini 3.1 Pro 也不远,价格还便宜,做文档解析很值。
Simon 用 Claude 和 GPT 帮你把 MDN 浏览器数据转成了 SQLite,能直接用 Datasette Lite 在线查,超方便。
OpenAI 发了新的 GPT-5.5 Instant,对话更聪明更自然,Pro 和 Plus 用户现在就能用,免费用户明天也能体验到。
GLM-5.2 在前端任务上干掉了 Claude Opus 系列,对 Kimi 和 Sonnet 胜率超 60%,开源模型里相当能打。
阿里Qwen造了个能模拟7种环境的AgentWorld,在AgentWorldBench上干掉了Claude和GPT最新版,训练智能体不用真实环境也能更强,零微调迁移呢。
OpenAI和博通搞定了自己的推理芯片Jalapeño,性能对标英伟达Blackwell,年底就用上,未来还有多代迭代。
OpenAI 新出的 GPT-5.5-Cyber 专攻网络安全,能自动修补漏洞,基准测试里已经跑赢了 Anthropic 的 Mythos。