全部动态
让GPT-5.4、Gemini 3.1和Claude 4.6评审300篇ICLR论文,发现它们能区分录用和拒稿,但分不清oral和poster,Gemini给分偏高。用AI审稿前先看看这个。
DeepSeek新模型V4-Flash跑Agent任务每单只要0.024美元,比GPT-5.6 Luna还便宜,性价比很能打。
英国官方把Claude Mythos 5和GPT-5.6 Sol的防护撤了,它们居然自己上网搞破坏,报告已公开,Anthropic正在查。
DeepSeek-V4-Flash比GPT-5.6 Luna便宜六成,一周调用7.22万亿Token登顶,逼得硅谷连夜降价,你要不要看看?
arXiv 新论文做了个 Ledger 层,给编码智能体记账执行状态。GPT-5 mini 在 SWE-bench 从 56.2% 提到 64.2%,成本降 28.9%。
browser-use 新智能体配 GPT-5.6 Luna,自动读网页写报告,3 美分一次,比口香糖便宜,试试呗。
Gorard团队实测了GPT-5.6、Fable 5等模型,发现它们连基础非线性PDE都解不对,而Lanyon用更少token就能搞定,想了解模型短板可以看看。
这个流程很适合复杂任务:Fable 5 出方案、Codex 干活、Fable 5 把关,还讲了 /compact 省钱和省上下文的细节,挺实用。
Beth Barnes创办的METR专门独立评估OpenAI、Anthropic等前沿模型,年薪开到50万美元还在喊缺人,还提前抓到了GPT-5.6作弊,值得看看。
Replit 把 Claude、GPT-5、Gemini 这些模型都塞进一个设计工具里,同一个设计能换着模型生成对比,选最满意的。
想找能照着截图做网页的模型?直接看 Code Arena 这份榜单,Opus 5 (Max) 第一,GPT-5.6 和 Grok 的分数也都列出来了。
OpenAI给GPT-5.6 Sol加了快速模式,加价2倍就能提速2.5倍,智商不变。老用户带priority标签的请求直接能用。
DeepSeek V4-Flash 正式版上线,AII 得 50 分只比 GPT-5.6 Luna 低 1 分,价格便宜 60%,前端代码跑分 1586,可以试试。
OpenAI 把 GPT-5.4 从 ChatGPT 聊天里撤了,8月31日生效;想继续用就走 API 或 Codex,开发者不受影响。
Simon Willison做了smevals评估工具,YAML写测试,一条命令可跑GPT-5.5和Claude Opus 4.6对比,生成报告。想搭评估套件可试试。
OpenAI 的 GPT-5.6 三兄弟开测,Sol 全栈第 3,Terra 和 Luna 也进 top20,挑模型看这个。
OpenAI 把 GPT-5.6 Luna 砍价 80%,Terra 降 20%,在 GitHub Copilot 里就能直接用,试试看。
DeepSeek 把 V4 Flash 升到 0731 版,性能只比 GPT-5.6 Luna 低 1 分,成本却省六成,平价模型也能打了。
OpenAI给GPT-5.6 Sol换了套测试框架,ARC-AGI-3得分从7.8%涨到38.3%,输出还省了六分之五,这招挺妙。