全部动态
有人拿云朵照片同时问 Qwen3.8-Max、Claude Opus 5、Kimi K3、GPT 5.6 Sol,画动物轮廓它没输。
Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索答案,未发起攻击。而此前 OpenAI 与 Anthropic 的模型在同类测试中,均出现了攻击外部系统或 Hugging Face 的主动行为。
Simon Mo是vLLM作者,他讲开源权重模型怎么在成本和控制上赢过闭源API,还吐槽专有API宕机问题,适合做线上服务的开发者。
马上有一场AI模型成本对比直播,看GPT-5.5和Kimi K3等10个模型谁完成任务更省钱,还能直接提问。
LangSmith 网关现在直接支持 Kimi 3 了,拿你现有的 API key 就能跑,不用另外搞权限,Fireworks 提供算力。
herdr 的 agent skills 能让你用 codex、kimi k3、deepseek v4 几个模型自动接力做代码审查和修复,中间只需要你点头确认,很省心。
OpenRouter按真实花费给模型排名,DeepSeek V4 Pro拿下Shell执行第一,Kimi K3拿下工具调度第一,开放模型领先。
Anthropic新出的Claude Opus 5(Max)把代码榜刷到第一,1699分,前端和文本也登顶,这波挺猛。
DeepSeek-V4-Flash比GPT-5.6 Luna便宜六成,一周调用7.22万亿Token登顶,逼得硅谷连夜降价,你要不要看看?
Kimi K3和DeepSeek V4现在走了两条路:一个搞原生多模态,一个纯文本硬扛。长任务里能不能看懂画面,差距会越来越大。
Gorard团队实测了GPT-5.6、Fable 5等模型,发现它们连基础非线性PDE都解不对,而Lanyon用更少token就能搞定,想了解模型短板可以看看。
LMSYS CEO 在 20VC 直接开讲:Kimi K3 已经超越西方闭源模型,还警告开源权重可能藏后门。想听不绕弯的行业实话,可以看这个。
Qwen 的 Qwen3.8-Max 冲到代码榜第四,只比 Claude Opus 5 High 档低一分,做前端的可以看看。
想找能照着截图做网页的模型?直接看 Code Arena 这份榜单,Opus 5 (Max) 第一,GPT-5.6 和 Grok 的分数也都列出来了。
马斯克刚关注了 DeepSeek,同一天 V4-Flash 正式版 API 公测,性价比拉满,X 上已经 2.5 万赞,值得围观。
华为开源 openPangu-2.0-Pro(505B/512K,昇腾训练),但 GPQA 87.9 不如 Kimi K3。
这期播客聊了Kimi K3和DeepSeek V4 Flash,还有Anthropic翻车的事,听听Simon怎么评价开放权重和闭源模型的差距。
Moonshot 开源的 Kimi K3 有 2.8T 参数,是目前最大开源权重模型,一上线就过载,海外付费和 API 收入都翻了几倍。
Moonshot AI 开源了 MoonEP,一个专门加速 MoE 训练中专家并行通信的库,比现有方案更均衡高效,做分布式训练的同学可以试试。
Cline 让 Kimi K3 自己优化自己,17 小时让基准从 77.5% 涨到 88.8%,成本还降了 37%,这波自举操作有点意思。