想看看两个顶级AI花100美元能做出什么视频?实验显示Claude Fable 5和GPT-5.6 Sol的作品都还行但不惊艳,而且Claude的token成本比GPT高出好几倍。
全部动态
OpenAI的GPT-5.6 Sol在网络安全靶场拿了第一,还能直接帮团队修真实漏洞,试试Codex Security吧。
Kimi-K3刚在代码前端评测中干翻Claude Fable 5,76%胜率,6个领域第一,权重还开源,绝对值得关注。
Moonshot发了2.8万亿参数Kimi K3,前端代码超越Fable 5,开放权重版月底就能用,价格虽高但看齐Claude Sonnet。
Kimi搞了个2.8万亿参数的开源模型K3,性能追平GPT-5.6 Sol和Claude Fable 5,不过价格也上去了,中国AI要涨钱了。
OpenAI 搞了个 GPT-Red 自动红队模型,提示注入赢人类 84% 对 13%,还发现了 Fake Chain-of-Thought 攻击。
Impossible Research的[schema]让LLM像物理学家推理,ARC-AGI-3刷到99% RHAE,太强了
GPT-5.6 智商飙到 136 分,比 Claude-5 还高出一截,而且干活也不含糊,一句话就能造出应用,值得看看它到底多强。
Doximity Ask在独立测试中把GPT-5.6和Claude Fable 5都干翻了,说明医学领域专用模型才是王道。
Thinking Machines出了个真开源的多模态模型Inkling,41B参数能和GPT-5.6 Sol掰手腕,还准备出12B小版,赶紧试试。
Pliny 爆出了 GPT-5.6 Sol 在 Codex 里的系统提示,四万多字,教你它怎么跟你聊天、怎么写代码,值得看看背后的设计思路。
OpenAI 的 GPT-5.6 Sol 在 Agent Arena 上冲到第2,离 Claude Fable 5 更近了。看看具体指标差异,特别是用户满意度的信号。
OpenAI 最强模型 GPT-5.6 系列直接上架 AWS,现在在 Bedrock 就能用,省去自己部署的麻烦,三个版本各有特色,性能很强。
OpenAI的GPT-5.6 Sol在Agent Arena上冲到第二,比前代进步明显,和Claude Fable 5差距缩小了,想看看真实任务中模型表现的话值得关注。
OpenAI新模型GPT-5.6 Sol在网页设计评测中拿了第一,比上一代强很多,还比Claude Fable 5更快。想看看AI设计的新天花板吗?
OpenAI 的 GPT-5.6 Sol Ultra 只用一小时就搞定了一个困扰数学家 50 年的图论难题,用的是 64 个子智能体协作,比人类更有耐心反复试错。
OpenAI 的 GPT-5.6 Sol 在代码前端基准上追平了 Claude Fable 5,前端能力进步很明显,做网页的可以留意。
OpenAI的GPT-5.6 Sol Ultra一小时破解了困扰数学界50年的Cycle Double Cover猜想,虽被指引用不足,但效率惊人。