全部动态
Doximity Ask在独立测试中把GPT-5.6和Claude Fable 5都干翻了,说明医学领域专用模型才是王道。
Thinking Machines出了个真开源的多模态模型Inkling,41B参数能和GPT-5.6 Sol掰手腕,还准备出12B小版,赶紧试试。
以后看模型排名不只凭喜好,还能按事实准确性排序。GPT-5.5 狂飙 13 名,Claude 也被挤到第二,快去 Arena 开开关看看。
看谁家搜索模型最靠谱?GPT-5.5-search 刚拿了事实性第一,GPT-5.2-search 飙升到第三,Claude 和 Gemini 反而掉了。
Codex 刚刚大更新,有了 GPT-5.6 Ultra 模式、多智能体协作、操作电脑和浏览器,还能一键发布网站。不是简单补全代码,而是帮你管项目、做 PR 走到底。
OpenAI 的 Codex 两周内更新150多项,新增 GPT-5.6 和 Ultra Parallel,周用户破700万,编程效率又上一台阶。
Pliny 爆出了 GPT-5.6 Sol 在 Codex 里的系统提示,四万多字,教你它怎么跟你聊天、怎么写代码,值得看看背后的设计思路。
别被百万token的噱头骗了!这位工程师用GPT-5.5的数据告诉你,上下文越长准确率反而暴跌,真正的解法是持续学习和真实环境训练。
GPT-5.6-sol刚冲进DRACO排行榜,OpenSquilla那个集成方案在Brave组又便宜又能打,搞模型部署的值得关注。
别被百万token的宣传忽悠了,GPT-5.5实际测试256k时准确率80%,拉到100万直接掉到36%。这不只是容量问题,是模型推理跟不上了。
OpenAI 在 Bedrock 上了 GPT-5.6 的三个档位:Sol 负责强推理,Luna 跑得快,中间 Terra 平衡。现在 AWS 用户直接用,不用折腾部署了。
这篇论文不是教你怎么用AI写邮件,而是用真实实验数据告诉你:AI改写邮件语气不会直接提高回复率,但会让读邮件的人感觉更积极,从而更愿意打开和回复。
这篇论文提出沙漏推理,让GPT-5.5和Gemini 3.1 Pro在ARC-AGI、ChipBench等基准上大幅提升,不是靠新模型,而是靠精巧的推理结构设计,值得搞推理的人看看。