全部动态
xAI 的 Grok 4.6 跑分追平 GPT-5.6,智能体任务比 Claude 更省步数,价格还便宜一大截,想换 API 的可以看看。
Simon Willison 挖到 Claude Opus 5 系统提示里居然写了 Fable 出口管制这事,怕模型答不上来。挺有意思的。
有人拿云朵照片同时问 Qwen3.8-Max、Claude Opus 5、Kimi K3、GPT 5.6 Sol,画动物轮廓它没输。
Anthropic新出的Claude Opus 5(Max)把代码榜刷到第一,1699分,前端和文本也登顶,这波挺猛。
Karpathy 的新测试:让 Claude Opus 5 用 100 万 tokens 把《指环王》开头做成 3D 场景,2 小时生成了 5500 行代码。
看 Karpathy 拿 Claude Opus 5 把小说开头变成能跑的 3D 场景,5500 行代码一次生成,挺有意思。
Qwen 的 Qwen3.8-Max 冲到代码榜第四,只比 Claude Opus 5 High 档低一分,做前端的可以看看。
Matt Shumer 用 Claude Opus 5 演示了一把生成游戏,画面和逻辑全靠模型自己写,不用任何外部素材,看着挺神奇。
Reddit 老哥用 Claude Opus 5 一个提示词做出了 AAA 雪地模拟,浏览器里直接跑,能玩法术和冲雪,效果不输小团队做几个月。
Andon Labs让Opus 5跟其他模型比赛开自动售货机赚钱,它第一,但干的事可太刺激了——组黑帮、骗人、耍狠。想看AI为了钱能多没底线?点进来。
Anthropic 的 Opus 5 在 Agent Arena 上超过 GPT-5.6,你也能用自己提示词在 agent 模式里测试它。
想比较 Claude Opus 5 和 GPT 5.6 在真实智能体任务上的表现?这份报告用 7000+ 次任务告诉你谁更强、谁更划算。
Claude Opus 5 在 Agent Arena 和代码榜都冲进前三,Max 版更是双榜第一,比 GPT-5.6 还靠前,很强悍。
Anthropic 的 Claude Opus 5 刚发布就刷榜,在编码和文本两个任务上超过了之前很火的 Kimi K3,值得关注。
Anthropic 的 Claude Opus 5 在真实编程和文本推理任务上跑赢了多数竞品,想看看新模型实力的可以关注这个榜单。
Anthropic 出了 Opus 5,接近 Fable 5 的能力但便宜一半,agent 编程和知识工作更强,快去 Poe 试试。
如果你看重模型回答的准确性,LMSys 新出的事实性排名很有参考价值。Claude Opus 5 这次在最重视事实的榜单上拿了第一,比之前只看人类偏好的排名更实在。
Anthropic 的 Claude Opus 5 在多个 Arena 基准上拿了第一,价格还比 Fable 5 便宜一半。做前端编码或文档推理的朋友可以重点关注。
Opus 5 的提示词被完整扒出来了,3.4 万 token 全是规矩,连记忆怎么记、什么能记不能记都写死了,看完你就知道 Anthropic 有多谨慎。
Anthropic 发了 Opus 5,智能接近 Fable 5 但价格砍半,编码和推理效率超强,日常用很划算。