中国模型前五占四,DeepSeek V4 Flash一周跑7.1万亿token,OpenAI直接砍价80%,这仗打得真热闹。
全部动态
别只盯 52/52,微软把 Codex 练好的技能搬到 Claude Code,电子表格直接涨到 81.8,比自己练还高一点;不过数学任务保留率只有 10%。
Black Forest Labs出了FLUX 3 Video,能生成20秒带原生声音和口型对上的视频,还说自己比Seedance 2.0强,去看看效果吧。
DARKNAVY和达酷诺威搞的DoGNAVY在CyberGym拿了全球第三、开源第一,只靠一个开源模型GLM-5.2就干翻了微软谷歌的闭源组合,你也能下载来用。
Karpathy 的新测试:让 Claude Opus 5 用 100 万 tokens 把《指环王》开头做成 3D 场景,2 小时生成了 5500 行代码。
京东开源 JoyAI-Video-Edit,边看边改视频,720P 30帧/秒、任意时长,效果超 LiveEdit,还能生成机器人训练数据。
英伟达把能跑自动驾驶推理的 Alpamayo 2 Super 开源了,商用免费,LingoQA 评测第一,比 Gemini 2.5 Pro 高 15 分,搞车的开发者和车企可以直接拿去改。
SaferAI的报告说,Z.ai的开源模型GLM-5.2已经快追上顶级闭源模型,但安全防护没跟上,搞开源的朋友得看看。
DeepSeek-V4-Flash比GPT-5.6 Luna便宜六成,一周调用7.22万亿Token登顶,逼得硅谷连夜降价,你要不要看看?
Kimi K3和DeepSeek V4现在走了两条路:一个搞原生多模态,一个纯文本硬扛。长任务里能不能看懂画面,差距会越来越大。
腾讯混元出了新语音识别模型 Hy ASR 3.0,粤语英语 WER 都压到 3% 左右,元宝里已经能免费用了。
微软弄了个能边听边说的语音模型MAI Realtime,支持16种语言,还能中途换语言,比Copilot现在的语音更自然。
看 Karpathy 拿 Claude Opus 5 把小说开头变成能跑的 3D 场景,5500 行代码一次生成,挺有意思。
阿里新模型qwen3.8-max一上榜就冲到综合第五,只比榜首Claude差13分;kimi-k3-max代码也进了前十,国产模型进步挺明显,榜单值得翻翻。
商汤开源了新多模态模型,8B参数就能生成4K图,编辑效果还追上闭源大厂,想玩图像生成的可以试试。