全部动态
谷歌跳票几个月的 Gemini 3.5 Pro 突然在盲测平台露脸半小时又被撤,想看看它真实水平的人可以去翻用户截图。
PolyAI出了个新对话模型Dialog-RSN-1,直接听人说话不用转文字,还能自动接话和调函数,延迟不到300毫秒。
阿里把语音识别模型更新到 3.0,医疗等专业词识别更准了,错字率低到 1.7%,还开放了三个版本随便用。
LG开源了韩国最大的K-EXAONE 2.0,750B参数,跑分比初代高10%,长上下文和工具调用还压过了GLM-5.1。
欧洲芯片公司Openchip出了个RISC-V服务器芯片BER10,用亚2纳米工艺,能跑实际工作负载,还兼容Linux,想做AI/HPC的老本行。
华为盘古 505B 的 MoE 模型 openPangu-2.0-Pro 开源了,带权重和推理代码,支持 512k 上下文,想跑昇腾生态可以看。
Moonshot 开源的 Kimi K3 有 2.8T 参数,是目前最大开源权重模型,一上线就过载,海外付费和 API 收入都翻了几倍。
OpenAI把Luna价格打到比Gemini Flash-Lite还低,想省钱换模型?Luna现在比Claude Haiku便宜5倍,跑demo或生产都能省一大笔。
谷歌DeepMind出了个新模型Gemini Robotics ER 2,能让机器人看懂连续视频、自己纠错,还能和别的机器人一起干活,速度比大模型快4倍,开发者现在就能用上。
DeepMind发了三个机器人模型:一个控全身,一个做推理,一个快速适应新身体。只公开了ER 2,感兴趣可以直接试。
腾讯刚开源了AngelSpec,一个统一训练推测解码草稿模型的框架。它带的DFly块扩散器能让HY3模型推理快最多2.4倍,还支持六种架构,实用性强。
RTX Spark提前曝光了!微软Surface Laptop Ultra性能接近RTX 4070但实际游戏卡顿,CPU跑分不如M4 Pro。想买先看这个实测。
马斯克预告了Grok 4.6和4.7,参数飙到1.5万亿和2.1万亿,比之前4.5的'Opus级别'更猛,8月7日见。
OpenAI推出GPT-5.6 Sol,在自定测试里赢了Anthropic的Opus 5,但换官方环境就掉到7.8%,差距挺大。
OpenAI 让自家模型 GPT-5.6 Sol 反过来优化自己的推理,成本降了20%,token 生成快了15%,挺有意思的。
SpaceXAI刚发的Grok Voice Think Fast 2.0,语音转语音又快又准,一分钟才8分钱,比上一代强了一大截,还支持24种语言,适合做语音助手。
Moonshot AI 开源了 MoonEP,一个专门加速 MoE 训练中专家并行通信的库,比现有方案更均衡高效,做分布式训练的同学可以试试。
想在老 Mac 上跑大模型?这个开源引擎让 Gemma 4 26B 只需 2GB 内存就能跑起来,M2 上还有 5-6 tok/s,挺实用的。
AgiBot 发了 WITA-Omni 全模态模型,DailyOmni 上碾压 Gemini 和豆包,还能同时管语音和动作,值得关注。
蚂蚁百灵的新模型Ling-3.0-flash参数量只有124B,却在大多数基准测试里干翻了万亿参数的Ring-2.6,还和DeepSeek V4 Flash并列第一,小模型也能这么猛。
Claude Mythos Preview 花 60 小时和 10 万美元,就找到 HAWK 的致命漏洞,直接把人家从 NIST 名单里打下来了。不是理论,是真能攻破简化 AES,速度还快几百倍。
OpenAI 出了新语音转文字模型,错误率比 ElevenLabs 高不少,自己测试可以,正经用还是优先选 ElevenLabs 吧。
Wiz搞了个Atlas系统,让多个AI智能体像安全团队一样协作挖漏洞,已经在开源项目找到200多个漏洞,基准测试还超过了GPT-5.5-Cyber和Claude 4.6。