全部动态
Kimi K3 写的 App,拍冰箱就出菜谱,还能自己跑起来,快去 fridgechef.qtkiwi.com 试试!
Fireworks 把 Anthropic 的 J-Lens 探针装到 Kimi K3 和 Qwen 3.5-9B 上,发现模型在蹦出第一个 token 前就把词准备好了。看内部状态搞可解释性,挺有意思。
DeepSeek 价格变了,Pro 的缓存命中涨了最多 12 倍,输出要 27 元/M;但 Flash 涨幅小,日常用更划算。
DeepSeek新模型V4-Pro专攻代码生成,在Code Arena排第8,开源第2,仅次于Kimi K3,还超过了GPT-5.6 Sol。
DeepSeek 又发新模型了,V4-Pro (Max) 在编码榜上排开源第二,比贵得多的 Opus-4.8 还强,价格只要零头。
有人拿云朵照片同时问 Qwen3.8-Max、Claude Opus 5、Kimi K3、GPT 5.6 Sol,画动物轮廓它没输。
Simon Mo是vLLM作者,他讲开源权重模型怎么在成本和控制上赢过闭源API,还吐槽专有API宕机问题,适合做线上服务的开发者。
马上有一场AI模型成本对比直播,看GPT-5.5和Kimi K3等10个模型谁完成任务更省钱,还能直接提问。
LangSmith 网关现在直接支持 Kimi 3 了,拿你现有的 API key 就能跑,不用另外搞权限,Fireworks 提供算力。
herdr 的 agent skills 能让你用 codex、kimi k3、deepseek v4 几个模型自动接力做代码审查和修复,中间只需要你点头确认,很省心。
OpenRouter按真实花费给模型排名,DeepSeek V4 Pro拿下Shell执行第一,Kimi K3拿下工具调度第一,开放模型领先。
Anthropic新出的Claude Opus 5(Max)把代码榜刷到第一,1699分,前端和文本也登顶,这波挺猛。
Gorard团队实测了GPT-5.6、Fable 5等模型,发现它们连基础非线性PDE都解不对,而Lanyon用更少token就能搞定,想了解模型短板可以看看。
LMSYS CEO 在 20VC 直接开讲:Kimi K3 已经超越西方闭源模型,还警告开源权重可能藏后门。想听不绕弯的行业实话,可以看这个。
Qwen 的 Qwen3.8-Max 冲到代码榜第四,只比 Claude Opus 5 High 档低一分,做前端的可以看看。
想找能照着截图做网页的模型?直接看 Code Arena 这份榜单,Opus 5 (Max) 第一,GPT-5.6 和 Grok 的分数也都列出来了。
华为开源 openPangu-2.0-Pro(505B/512K,昇腾训练),但 GPQA 87.9 不如 Kimi K3。
Cline 让 Kimi K3 自己优化自己,17 小时让基准从 77.5% 涨到 88.8%,成本还降了 37%,这波自举操作有点意思。
Gary Marcus 用具体数字拆穿了 Anthropic 年入 1500 亿美元的夸张说法,点出了中国模型竞争和盈利困境,值得一看。
Cline让Kimi K3自己当工程师优化测试框架,17小时得分从77.5%涨到88.8%,成本还降了快一半,挺有意思的实验。
Claude Opus 5 在 Agent Arena 和代码榜都冲进前三,Max 版更是双榜第一,比 GPT-5.6 还靠前,很强悍。
Replit 现在让你选模型了,首发 Kimi K3,和 NVIDIA、微软一起力挺开源,编程时能按需切换,挺实用。
Fireworks和Trilogy AI用Kimi K3搞了个安全自动化方案,能自动审计仓库、扫描和PR。做安全运维的值得看看。