全部动态
以后看模型排名不只凭喜好,还能按事实准确性排序。GPT-5.5 狂飙 13 名,Claude 也被挤到第二,快去 Arena 开开关看看。
看谁家搜索模型最靠谱?GPT-5.5-search 刚拿了事实性第一,GPT-5.2-search 飙升到第三,Claude 和 Gemini 反而掉了。
Codex 刚刚大更新,有了 GPT-5.6 Ultra 模式、多智能体协作、操作电脑和浏览器,还能一键发布网站。不是简单补全代码,而是帮你管项目、做 PR 走到底。
OpenAI 的 Codex 两周内更新150多项,新增 GPT-5.6 和 Ultra Parallel,周用户破700万,编程效率又上一台阶。
Pliny 爆出了 GPT-5.6 Sol 在 Codex 里的系统提示,四万多字,教你它怎么跟你聊天、怎么写代码,值得看看背后的设计思路。
别被百万token的噱头骗了!这位工程师用GPT-5.5的数据告诉你,上下文越长准确率反而暴跌,真正的解法是持续学习和真实环境训练。
别被百万token的宣传忽悠了,GPT-5.5实际测试256k时准确率80%,拉到100万直接掉到36%。这不只是容量问题,是模型推理跟不上了。
OpenAI 在 Bedrock 上了 GPT-5.6 的三个档位:Sol 负责强推理,Luna 跑得快,中间 Terra 平衡。现在 AWS 用户直接用,不用折腾部署了。
Google 的新模型 Gemini 3.5 本周就要来了,内部测试居然超过了 GPT-5.6 和 Fable 5,比前代 Pro 版强不少。
OpenAI 的 GPT-5.6 Sol 在 Agent Arena 上冲到第2,离 Claude Fable 5 更近了。看看具体指标差异,特别是用户满意度的信号。
OpenAI的GPT-5.6 Sol在Agent Arena上冲到第二,比前代进步明显,和Claude Fable 5差距缩小了,想看看真实任务中模型表现的话值得关注。
看,有人用GPT-5.6和Cursor直接操作Blender MCP做3D渲染,自己没碰过Blender就搞出逼真MacBook,零基础也能玩。
OpenAI新模型GPT-5.6 Sol在网页设计评测中拿了第一,比上一代强很多,还比Claude Fable 5更快。想看看AI设计的新天花板吗?
Shoumeng 教你用 Fable 5 搭配 Sonnet 5 做 Harness,34% 成本拿 90% 效果,适合想省 token 又不降智能的人。
OpenAI 的 GPT-5.6 Sol 在代码前端基准上追平了 Claude Fable 5,前端能力进步很明显,做网页的可以留意。
OpenAI终于登顶了!GPT-5.6-sol在代码竞技场和Claude Fable 5打成平手,价格还便宜一半,搞前端开发的快来看看。