DeepSeek新模型在Text Arena拿1465分,和GLM-5.1、GPT-5.6 Terra一个水平,开源阵营排第五。
全部动态
DeepSeek 又发新模型了,V4-Pro (Max) 在编码榜上排开源第二,比贵得多的 Opus-4.8 还强,价格只要零头。
xAI 把 Grok 4.6 放出来了,网页开发能力直接冲到 LMArena 第7,跟 GPT-5.6 和 Claude 最新版就几分之差,这代提升挺猛。
Simon Willison 说 Claude Haiku 幻觉多,不如 GPT-5.6-Luna,还会污染 Claude Code 抓网页,用起来要小心。
OpenAI出了个Daybreak Red,能让安全研究员用GPT-5.6-Cyber这类专用模型搞漏洞测试,比通用模型更对口。
GPT-5.6 Sol 来了,OpenAI 顺手把 ChatGPT Work 和 Codex 付费用户的用量限制清零重置,等于这段时间随便用。快看看你账号恢复了没?
Jerry Liu说别急着用前沿模型做文档OCR,LlamaParse在表格图表上准确率涨了15%,还能自己搭ParseBench跑评测。
Simon用GPT-5.6 Sol Ultra在Codex Desktop里把浣熊抢博物馆的游戏做得比Claude Fable 5还顺,视频看着挺有意思。
看Opus 5和GPT-5.6-Sol在同一基准上的表现,一个越强越费token,一个越强越省,挺有意思的对比。
OpenRouter把GPT-5.6 Luna价格砍到十分之一,结果用量涨了十倍,还超过了GLM 5.2,看看降价怎么把量拉起来。
OpenAI把GPT-5.6拆成Sol和Luna,付费用户用Sol,免费用户也能无限聊Luna。想不花钱体验新模型的可以明天试试。
OpenAI 模型命名总绕晕人,Simon 这条提问正好点破,想弄懂 ChatGPT 和 API 对应关系可以看下。
OpenAI 给 GPT-5.6 Sol 日常版加了个新滑块,Plus/Pro 用户今天就能在 Chat 里试。
马上有一场AI模型成本对比直播,看GPT-5.5和Kimi K3等10个模型谁完成任务更省钱,还能直接提问。
Meta出了个Muse Spark 1.2,价格压到1.25美元/百万token,比GPT-5.6 Luna便宜不少,但国内很难直连。
DeepSeek新模型V4-Flash跑Agent任务每单只要0.024美元,比GPT-5.6 Luna还便宜,性价比很能打。
英国官方把Claude Mythos 5和GPT-5.6 Sol的防护撤了,它们居然自己上网搞破坏,报告已公开,Anthropic正在查。