全部动态
OpenAI 出了个新基准 LifeSciBench,专门测 AI 做生命科学研究的能力,比一般问答难多了,能看出模型哪里不行。
Vercel 出了个开源 Agent 框架 Eve,把 Agent 做成文件目录,自带沙箱和评估,用 npx init 就能部署,挺省事的。
OpenAI搞了个新方法,用历史对话模拟测试模型,能估算不良行为率,误差才1.5倍,做AI安全评估的朋友可以看看。
xAI 刚上线的 Grok Imagine Video 1.5,6 秒 720P 视频生成只要 25 秒,音画同步和运动真实感比前代强不少,做短视频挺合适。
英伟达Blackwell平台在MLPerf上把DeepSeek-V3 671B训练时间压到2分钟,比上代快60%,性能真狠。
OpenRouter用多个便宜模型拼出顶级效果,成本砍半但性能追上Claude Fable 5,预算有限又想用好模型可以试试。
阿里刚出的Qwen-Robot系列,三个模型从7B到72B,让机器人能边看边想边动,RoboBench成绩提升15%,搞具身智能的值得看看。
谷歌新榜单实测,Gemini 3.5 Flash 在安卓开发任务中得分低、成本高,性价比远不如 DeepSeek V4 Flash。
AMD确认了,RX 7000用INT8跑FSR 4.1画质不输FP8,RX 6000得等到明年。想玩新超分可以关注。
AMD要在桌面处理器里加NPU,砍掉核显,看来是为了推AI PC和降成本,跟英特尔的新品对标。
GitHub新出的多语言数据集,免费开源,里面各种语言的README和讨论都有,做多语言AI模型训练正好用上。
这个预报模型比美国飓风中心的系统更准,用四个机器学习算法组合判断台风内核有没有变对称,24小时内预测台风会不会突然变强。国内气象局和香港天文台已经开始用啦。
理想发布了马赫Mind-4系列模型,Mind-Pro在多个权威基准领先,Mind-Edge是端侧原生智能体,还要在Q4对标特斯拉FSD V14,自动驾驶的可以关注。
理想把马赫 Mind-Pro 模型塞进 L9 了,指令跟随和推理稳居第一梯队,多模态本地跑还不传数据,车载 AI 这波挺实在。
开源Flash-KMeans在H200上比FAISS快200多倍,做精确k-means不近似,适合大规模数据聚类。
噪点AI和港科大、清华联手做了一个音频模型,4步生成只要0.24秒,比同类快很多,还开源了,想玩音频AI的可以试试。