比亚迪悄悄拿出的HyWorldVLA,在NAVSIM上直接以90.59分拿下SOTA,这是他们首次秀自动驾驶基础模型肌肉。
全部动态
Liquid AI 新出的两个双向编码器,230M 在 CPU 上跑 8K 上下文只要 28 秒,350M 在 GLUE 等基准排第四,适合做嵌入和分类任务。
月之暗面刚开源2.8万亿参数的Kimi K3,摩尔线程的国产GPU MTT S5000立马适配,能直接跑官方MXFP4格式,推理部署很方便。
OpenAI 出了两款转录模型,GPT-Live-Transcribe 实时转录延迟低,GPT-Transcribe 批量处理更便宜,错误率比 Whisper 低一半多。
智元发了WITA-Omni Preview,85.21分登顶DailyOmni,比Gemini、千问都强,搞具身智能的多模态模型可以看看
微软出的专用网络防御模型MAI-Cyber-1-Flash,能处理九成扫描任务,CyberGym分数冲到95.95%,安全团队可以关注。
Moonshot AI 发了Kimi K3的47页技术报告,混合注意力、896专家MoE和5100万RL沙箱的架构特别硬核,值得看它怎么跟DeepSeek对标。
Moonshot AI 发布了 2.8T 参数的 Kimi K3,MoE 架构加 1M 上下文,还配套了工具,开源党可以玩起来了。
Moonshot AI 开源了 Kimi-K3,2.8T 参数的大模型,在推理和代理基准上很强,但显存要求高,适合有硬件或想评估部署成本的人看看。
微软出了个专攻安全的AI模型MAI-Cyber-1-Flash,CyberGym跑分95.95%,比Mythos 5和GPT-5.5 Cyber都强,还更省钱。
Moonshot 把 2.8T 参数的金刚级模型权重大方放出来了,就是商用门槛卡得严——大厂做 MaaS 得单独谈。价格倒很统一,OpenRouter 上多家同价。
月之暗面开源了 2.8 万亿参数的 Kimi K3,MoE 架构效率比 K2 高 2.5 倍,支持 100 万 token 上下文和视觉推理,值得关注。
Lightelligence 把光计算从论文带到了真实门禁系统里,PACE 3 芯片的 256x256 矩阵能跑低延迟推理,是商用落地的首个案例,值得关注。
快手开源了KAT-Coder-V2.5,用10万个可验证环境训练代码智能体。AutoBuilder把环境搭建成功率从16%拉到57%,沙盒审计又让反馈错误降到2%以下。做编程智能体训练的值得一看。
Induction Labs 搞了个新套路:不用动作标签,只看视频就能学会模拟桌面、跳棋和台球物理。106B 参数的 MoE 模型,一次预训练就够了。
腾讯开源了三个具身模型,像搭积木一样分层解决机器人从看懂到动起来的难题,VLA 能做到毫秒级反应,做机器人开发的一定要看看。
Opus 5 的提示词被完整扒出来了,3.4 万 token 全是规矩,连记忆怎么记、什么能记不能记都写死了,看完你就知道 Anthropic 有多谨慎。
Sakana AI 新出的网络安全模型 Fugu-Cyber 在 CyberGym 上拿了 86.9%,比 GPT-5.5-Cyber 还高,做安全测试的可以关注。
Reactor 团队把 Dreamer 4 的完整训练配方和代码都开源了,JAX/Flax 实现,想复现世界模型做视频预测的赶紧看。
Anthropic的Opus 5在Auto Mode下把浏览器智能体的提示注入防御做到了100%,129个测试全过,这可能彻底解决智能体安全难题。