Mistral OCR 在 ParseBench 上打败了 GPT-5.5,离 Gemini 3.1 Pro 也不远,价格还便宜,做文档解析很值。
全部动态
OpenAI 发了新的 GPT-5.5 Instant,对话更聪明更自然,Pro 和 Plus 用户现在就能用,免费用户明天也能体验到。
GLM-5.2 在前端任务上干掉了 Claude Opus 系列,对 Kimi 和 Sonnet 胜率超 60%,开源模型里相当能打。
阿里Qwen造了个能模拟7种环境的AgentWorld,在AgentWorldBench上干掉了Claude和GPT最新版,训练智能体不用真实环境也能更强,零微调迁移呢。
OpenAI 的 Daybreak 现在不仅能找漏洞,还能自动打补丁了,连 Linux 内核和 FreeBSD 都支持,安全团队可以试试 GPT-5.5-Cyber。
OpenAI 搞了个 Daybreak 扩展,直接在 Codex 里修漏洞,还有专门的安全模型 GPT-5.5-Cyber,想帮安全团队快速打补丁。
Claude Fable 5 在 ECI 上拿 161 分,超 GPT-5.5 Pro 一分,Anthropic 终于又领先了。
OpenAI 把 GPT-5.5 Instant 的医疗问答能力做到了和自家顶级推理模型一样好,而且免费用户都能用,生病问AI更放心了。
想少想多做?K2.7 Code 编码专用,推理开销比 K2.6 低三成,还能对标 GPT-5.5,适合写代码时不用纠结。
Apodex能派150个Agent跑15000步帮你深挖问题,自主校验结果,在Benchmark上超了GPT-5.5和Claude-Opus。
想知道怎么用Kimi K2.7 Code花不到5分钱做出媲美Claude Fable 5的落地页?实验数据全给你算清楚了,迭代省大钱。
OpenAI搞了个新基准LifeSciBench,专门测生物科学推理,GPT-Rosalind比GPT-5.5还强,值得看看。
NVIDIA 和 CMU 搞了个能自己跑实验的机器人系统,AI agent 操控真实机器人干活,成功率99%,还开源了。
想看看AI Agent在专业软件上到底行不行?Cua-Bench用KiCad的25道真实任务给模型打分,最强的也只过了6道,从零建电路全挂。看完你就知道瓶颈在哪了。
Claude Fable 5 刚在 Epoch 能力指数上以 161 分微弱领先 GPT-5.5 Pro,这是 Anthropic 一年多来首次登顶,你可以看看它具体强在哪。