InAgent在OSWorld刷到90.2%,系统级任务100%,比OpenAI、谷歌、Anthropic都高,快看。
全部动态
MiniMax 把 H3 开源了,33B 参数,两张 RTX 5090 就能本地跑,API 价格只有 Seedance 2.0 的三分之一,想玩视频生成的可以试试。
英特尔把 MiniMax H3 跑在多卡 GPU 上,锐炫 Pro B70 首发支持,还搞了 2TP×4USP 混合并行,视频生成部署有参考了。
MiniMax H3 开源当天就被摩尔线程国产卡接住了,2K 视频生成一秒钟才 8 毛钱,视频编辑能力还排全球第一。
华为诺亚开源了MindMemOS,给AI Agent配上能自进化的记忆,经验还能沉淀成技能,做智能体的可以研究下。
MiniMax 把能处理多模态上下文的视频模型直接开源了,最长生成 15 秒 2K 带立体声的视频,比一般文生视频强在能看懂图片、音频和视频混合输入。
清华开源了个能自己改代码的模型VeriLoop Coder-E1,SWE-bench拿85.2分,比很多大模型都强,想搞代码修复的可以试试。
Onton发布了搜索模型Ontology 1,90条查询上precision@10到0.630,压过Google Shopping和Amazon,而且只用了1%索引数据。做搜索的可以看看。
想用 DeepSeek-V4-Flash 的话,超算互联网已经上线了,不用自己配环境,一键就能调 API,试试它的智能体能力。
想用AMD显卡跑大模型的可以看看,AMD把16B总参数、2.8B激活的MoE模型全开源了,连训练配置和数据配方都给了。
马斯克刚关注了 DeepSeek,同一天 V4-Flash 正式版 API 公测,性价比拉满,X 上已经 2.5 万赞,值得围观。
OpenAI用Astra模型解决了十个多年没人做出来的数学难题,整个研究烧了约2000美元的token,还在Lean里验证过,值得看看。
DeepSeek V4-Flash 正式版上线,AII 得 50 分只比 GPT-5.6 Luna 低 1 分,价格便宜 60%,前端代码跑分 1586,可以试试。
DeepSeek 把 V4 Flash 升到 0731 版,性能只比 GPT-5.6 Luna 低 1 分,成本却省六成,平价模型也能打了。
MiniMax H3 8 月 3 日开源,能做 15 秒 2K 音视频,价格只有主流模型的 1/3,看看合不合用。
OpenAI给GPT-5.6 Sol换了套测试框架,ARC-AGI-3得分从7.8%涨到38.3%,输出还省了六分之五,这招挺妙。