全部动态
这周模型圈太热闹了,DeepSeek V4、GLM 5.2 刚发,Kimi K3 和 Qwen 3.8 又来了,还有 Claude 和 GPT 对标,开源 SOTA 随时变天。
中国开源模型Kimi K3编码能力比Claude和GPT还强,价格却便宜好几倍,做长上下文编程选它准没错。
SpaceXAI 的 Grok 4.5 用 $0.31 就干到一流水平,比 Claude 便宜 9 倍,token 还省 6 倍,省钱党可以关注。
作者分享了用独立LLM强化/goal的实用技巧,用GPT-5.6-Sol做裁判,让GPT-5.6-Terra/Luna当子智能体,跑得更久更快。
OpenAI的GPT-5.6 Sol在网络安全靶场拿了第一,还能直接帮团队修真实漏洞,试试Codex Security吧。
AI真的在推动数学进步了:GPT-5.6只用90分钟就找到了统计学里一个经典开放问题的反例,而5.5版本折腾20小时都没搞定。这篇报告值得所有关心AI科研能力的人看。
Kimi-K3刚在代码前端评测中干翻Claude Fable 5,76%胜率,6个领域第一,权重还开源,绝对值得关注。
Impossible Research的[schema]让LLM像物理学家推理,ARC-AGI-3刷到99% RHAE,太强了
AI帮你揭开了统计学25年的难题:GPT-5.6 Sol Pro用90分钟证明BH方法在相关数据下会失效,比人类20小时还准。
Doximity Ask在独立测试中把GPT-5.6和Claude Fable 5都干翻了,说明医学领域专用模型才是王道。
Thinking Machines出了个真开源的多模态模型Inkling,41B参数能和GPT-5.6 Sol掰手腕,还准备出12B小版,赶紧试试。
Pliny 爆出了 GPT-5.6 Sol 在 Codex 里的系统提示,四万多字,教你它怎么跟你聊天、怎么写代码,值得看看背后的设计思路。
OpenAI 的 GPT-5.6 Sol 在 Agent Arena 上冲到第2,离 Claude Fable 5 更近了。看看具体指标差异,特别是用户满意度的信号。
OpenAI的GPT-5.6 Sol在Agent Arena上冲到第二,比前代进步明显,和Claude Fable 5差距缩小了,想看看真实任务中模型表现的话值得关注。
看,有人用GPT-5.6和Cursor直接操作Blender MCP做3D渲染,自己没碰过Blender就搞出逼真MacBook,零基础也能玩。
OpenAI新模型GPT-5.6 Sol在网页设计评测中拿了第一,比上一代强很多,还比Claude Fable 5更快。想看看AI设计的新天花板吗?
Shoumeng 教你用 Fable 5 搭配 Sonnet 5 做 Harness,34% 成本拿 90% 效果,适合想省 token 又不降智能的人。
OpenAI 的 GPT-5.6 Sol 在代码前端基准上追平了 Claude Fable 5,前端能力进步很明显,做网页的可以留意。