全部动态
以后看模型排名不只凭喜好,还能按事实准确性排序。GPT-5.5 狂飙 13 名,Claude 也被挤到第二,快去 Arena 开开关看看。
看谁家搜索模型最靠谱?GPT-5.5-search 刚拿了事实性第一,GPT-5.2-search 飙升到第三,Claude 和 Gemini 反而掉了。
别被百万token的噱头骗了!这位工程师用GPT-5.5的数据告诉你,上下文越长准确率反而暴跌,真正的解法是持续学习和真实环境训练。
别被百万token的宣传忽悠了,GPT-5.5实际测试256k时准确率80%,拉到100万直接掉到36%。这不只是容量问题,是模型推理跟不上了。
OpenAI 的 GPT-5.6 Sol 在 Agent Arena 上冲到第2,离 Claude Fable 5 更近了。看看具体指标差异,特别是用户满意度的信号。
OpenAI的GPT-5.6 Sol在Agent Arena上冲到第二,比前代进步明显,和Claude Fable 5差距缩小了,想看看真实任务中模型表现的话值得关注。
OpenAI新模型GPT-5.6 Sol在网页设计评测中拿了第一,比上一代强很多,还比Claude Fable 5更快。想看看AI设计的新天花板吗?
Muse Spark 1.1在Agentic任务上声称能追上GPT-5.5,还能直接用Meta API调用,挺有吸引力。
OpenAI发了GPT-5.6-sol,代码能力直接冲到第一,还比Claude便宜一半,搞前端开发的可以试试。
OpenAI 一口气发了三个 GPT-5.6 模型,编程更强的 Sol 比 Fable 便宜,还出了个能跨应用干活的 agent 和桌面应用,开发者快去体验。
OpenAI 给 GPT-5.6 分了三个档,Sol 专攻复杂编程和智能体任务,Terra 比上一代更强更便宜,Luna 跑得快还省一半钱。
想省钱又想有GPT-5.5级别编码和推理能力?试试OpenRouter的GPT-5.6 Terra,价格腰斩,性能不减。
有人用 Fable 5 和 GPT-5.5 搭了个 Executor-Advisor 流程,还说 GPT-5.6 来了能直接换上去用,不用等新模型就能更好地编排工具和验证。
OpenAI 把 ChatGPT 语音升级成全双工了,能一边听你说话一边插嘴,同传演示挺惊艳。就是刚上线有人嫌它“嗯嗯”太吵,你可以试试调低推理强度或者换语音角色。
OpenAI 出了 GPT-Live,能边听边和你对话,遇到难题自动调 GPT-5.5,还能实时显示卡片,比 Siri 强多了。
Grok 4.5 在代码智能体任务上得分和 GPT-5.5 一样高,但 token 消耗只有三分之一,价格还更便宜,做 agent 开发选它很划算。
OpenAI 出了 GPT-Live,能全双工对话还自动叫 GPT-5.5 帮忙算难题,但用户说聊着聊着被挂电话,距离完美还有段路。
腾讯Hy3开源模型295B参数,比GLM-5.2小一半却和GPT-5.5打平,还超过DeepSeek V4 Pro,免费API两周,智能体应用很香。
GPT-5.6 来了,参数 2-4T,带 Ultracode 推理层级,还有 Cerebras 版速度飙到 750 tokens/s。想试试新模型的可以关注了。