Mistral OCR 在 ParseBench 上打败了 GPT-5.5,离 Gemini 3.1 Pro 也不远,价格还便宜,做文档解析很值。
全部动态
OpenAI 发了新的 GPT-5.5 Instant,对话更聪明更自然,Pro 和 Plus 用户现在就能用,免费用户明天也能体验到。
GLM-5.2 在前端任务上干掉了 Claude Opus 系列,对 Kimi 和 Sonnet 胜率超 60%,开源模型里相当能打。
阿里Qwen造了个能模拟7种环境的AgentWorld,在AgentWorldBench上干掉了Claude和GPT最新版,训练智能体不用真实环境也能更强,零微调迁移呢。
OpenAI 新出的 GPT-5.5-Cyber 专攻网络安全,能自动修补漏洞,基准测试里已经跑赢了 Anthropic 的 Mythos。
OpenAI新出的网络安全大模型GPT-5.5-Cyber挺猛,CyberGym跑分超了Claude Mythos 5,安全团队可以关注一下。
Qwen2.5-0.5B调优后,在关系抽取任务上干掉了GPT-5.4和Claude Sonnet,而且模型很小,单卡就能跑,适合隐私敏感场景。
字节新出的豆包Seed 2.1 Pro和Turbo,专门优化编程、智能体和多模态任务,Pro适合高难度场景,Turbo便宜且效率高,很适合接项目用。
百川发了医疗增强大模型 M4,在 HealthBench 碾压 GPT-5.5,幻觉率仅 3.3%,看病问诊更靠谱。
OpenAI 要发 GPT-5.6 了,上下文拉到 150 万 tokens,编码能力还干翻了 Anthropic 的 Mythos,价格还更便宜,开发者可以关注一下。
Claude Fable 5 在 ECI 上拿 161 分,超 GPT-5.5 Pro 一分,Anthropic 终于又领先了。
OpenAI 把 GPT-5.5 Instant 的医疗问答能力做到了和自家顶级推理模型一样好,而且免费用户都能用,生病问AI更放心了。
想少想多做?K2.7 Code 编码专用,推理开销比 K2.6 低三成,还能对标 GPT-5.5,适合写代码时不用纠结。
想知道怎么用Kimi K2.7 Code花不到5分钱做出媲美Claude Fable 5的落地页?实验数据全给你算清楚了,迭代省大钱。
想看看AI在药物发现中到底行不行?这个基准测试用4800条轨迹告诉你,Claude Opus 4.8和GPT-5.5都还差得远,最高才59.3%的通过率。
OpenAI搞了个新基准LifeSciBench,专门测生物科学推理,GPT-Rosalind比GPT-5.5还强,值得看看。
NVIDIA 和 CMU 搞了个能自己跑实验的机器人系统,AI agent 操控真实机器人干活,成功率99%,还开源了。
OpenRouter用多个便宜模型拼出顶级效果,成本砍半但性能追上Claude Fable 5,预算有限又想用好模型可以试试。
谷歌新榜单实测,Gemini 3.5 Flash 在安卓开发任务中得分低、成本高,性价比远不如 DeepSeek V4 Flash。