OpenAI 自己搞了个硬核自主任务基准 GDPval,花了大钱,结果 GPT-5.6 的成绩藏起来了。背后有啥故事?不点进来看看?
全部动态
这篇论文拿多个模型种群跑了几万局游戏,发现换一条规则,事故率能差 58 个百分点,而且匿名化也挡不住针对性消除。做多智能体安全的一定要看。
OpenAI 出了 GPT-Live,能边听边和你对话,遇到难题自动调 GPT-5.5,还能实时显示卡片,比 Siri 强多了。
想了解OpenAI、Anthropic、xAI和国产模型的最新动静?这篇爆料把GPT-6的加速发布、Mythos引发的连锁反应都串起来了,还提到DeepSeek V4和GLM-5.2的竞争,信息量很大。
这篇研究告诉你,红外视觉语言模型有多脆弱——一个 QR 风格的边角补丁就能让 OpenAI CLIP 准确率从 98.67% 跌到 0.70%,还能黑盒攻击其它模型。搞安全或对抗训练的值得一看。
今天早报有GPT-5.6上线、Claude Fable 5免费延长、SpaceX股价破发,三条短讯快速掌握动态。
Grok 4.5 在代码智能体任务上得分和 GPT-5.5 一样高,但 token 消耗只有三分之一,价格还更便宜,做 agent 开发选它很划算。
OpenAI 出了 GPT-Live,能全双工对话还自动叫 GPT-5.5 帮忙算难题,但用户说聊着聊着被挂电话,距离完美还有段路。
OpenAI 这次把语音交互做得更自然了,GPT-Live 系列能边听边说,还能打断和调用工具,比以前的 Advanced Voice Mode 流畅很多。
圈内多个模型传闻汇总:GPT-6 来势汹汹,Fable 5.1 几周内上线,DeepSeek 和 MiniMax 也在发力,值得关注。
OpenAI 让 ChatGPT 能同时听和说了,复杂问题自动转给 GPT-5.5 处理,对话更自然。付费用户现在就能体验。
OpenAI 用 GPT-Live 把语音交互做到实时全双工,还能让 GPT-5.5 处理复杂推理,听说是你聊天的好帮手。
OpenAI 的 GPT-5.6-Sol 不只是聊天,能直接干复杂编程活了,比如自己重构 Next.js 服务器。想看看模型实际生产力有多强?这篇实测值得看。
腾讯Hy3开源模型295B参数,比GLM-5.2小一半却和GPT-5.5打平,还超过DeepSeek V4 Pro,免费API两周,智能体应用很香。
多家AI公司扎堆预告新模型,Grok 4.5、GPT-5.6 Sol、Claude Fable 5这些名字你都得知道。
GPT-5.6 来了,参数 2-4T,带 Ultracode 推理层级,还有 Cerebras 版速度飙到 750 tokens/s。想试试新模型的可以关注了。
OpenAI 周四就要上线 GPT-5.6 的全新系列 Sol、Terra 和 Luna,现在就能申请预览,赶紧试试。