8月2日
03:08
03:08官方一手marktechpost@Asif Razzaq
AMD推出Instella-MoE-16B-A3B,这是一个完全开源的混合专家语言模型,总参数16B,每个token仅激活2.8B。模型采用Gated MLA与FarSkip-Collective架构,在Instinct MI300X和MI325X GPU上从零训练。AMD已发布所有训练阶段的权重,并公开数据混合、配置和推理代码。
推荐理由:想用AMD显卡跑大模型的可以看看,AMD把16B总参数、2.8B激活的MoE模型全开源了,连训练配置和数据配方都给了。
8月1日
11:35
11:35小互@imxiaohu
78°
DeepSeek-V4-Flash正式版发布,官方声称可原生接入OpenAI Codex。该模型在九项Agent测试中全部反超自家更大的V4-Pro预览版。它登顶开源模型前三,输出价格比Opus 4.8便宜89倍。DeepSeek还为Codex做了官方适配,提供一条命令接入方案。
事件专题

推荐理由:DeepSeek新出的V4-Flash能直接配Codex,一条命令搞定,跑分还反超自家V4-Pro,价格比Opus 4.8便宜89倍。
02:05
7月31日
23:04
23:04官方一手歸藏(guizang.ai)@op7418
精选
DeepSeek 宣布 V4 Flash 0731 模型已开源。模型权重托管在 Hugging Face 的 deepseek-ai 组织下。该版本属于 Flash 系列,版本号为 0731。开发者可以下载权重进行本地部署或二次开发。
推荐理由:DeepSeek 把 V4 Flash 0731 的开源权重放出来了,想本地跑模型的话直接去 Hugging Face 下载就行。
16:21
16:21官方一手pandaily@contact@pandaily.com (Pandaily)
Kimi K3技术报告披露了MoonEP、KDA和AttnRes三套基础设施方案。报告强调MFU对训练效率的关键作用。Moonshot AI认为专家并行与共享专家的工程实现是真正壁垒。这些经验让开源模型的经济优势难以被复制。
事件专题

推荐理由:Moonshot AI公开了Kimi K3的MoonEP等设计,但真正难抄的是工程调优经验,这决定了开源模型能不能打。
12:58
12:58官方账号arXiv cs.AI@Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, Jianbing Zhang, Ben Kao, Lingpeng Kong
OSReward 是一个用于评估视觉语言模型(VLM)判断计算机使用智能体轨迹能力的基准。研究者在多平台、多智能体框架上收集人工验证的指令轨迹,并通过多阶段标注得到真实标签。评测发现,即使是当前最强的 VLM 判断器也存在系统性宽松偏差,常把失败操作标记为成功。为此,团队构建了包含 10 万条推理标注轨迹的 OS-Shepherd-100K 语料,并训练出 9B 和 35B 的 OS-Shepherd 奖励模型。这两个开源模型能以比商业判断器低 30-60% 的成本提供同等质量的奖励信号。
推荐理由:OS 团队开源了 OSReward 基准和 9B/35B 奖励模型,专测 AI 判断电脑操作任务是否成功,成本比商业方案低 30-60%。
12:21
11:10
11:10OpenRouter@OpenRouterAI
MiniMax 发布开源权重视频模型 Hailuo H3,已上线 OpenRouter。H3 支持文本、图像、音频和视频四种输入,并输出原生音视频。官方定位包括指令驱动编辑、文字/品牌渲染和视频到视频的动作迁移。H3 主打轻量级,可直接在 OpenRouter 上调用。
推荐理由:开源视频模型 H3 上 OpenRouter 了,能按指令改视频、渲染品牌文字,还能视频到视频迁移动作,直接调用很方便。
10:01
10:01官方一手pandaily@contact@pandaily.com (Pandaily)
Kimi K3 是 Moonshot AI 开源的 2.8T 参数模型,也是目前最大的开放权重模型。发布两天内因访问量过大导致服务短暂过载。该模型上线后占全球开源下载量的 41%,海外付费用户增长 4 倍,API 收入增长 400%。
事件专题

推荐理由:Moonshot 开源的 Kimi K3 有 2.8T 参数,是目前最大开源权重模型,一上线就过载,海外付费和 API 收入都翻了几倍。
03:39
03:39lmarena.ai@lmarena_ai
精选
Thinking Machines 发布 Inkling-Small,总参数量 276B,其中 12B 活跃。该模型在 Text Arena 的 AutoEval 初评中获得 1431 分,排名 #88,并在开放模型中位列 #21。它是美国仅有的五个进入开放模型前 25 的模型之一。初始分数基于 Arena 人类偏好数据训练的奖励模型自动投票得出,待与真实投票验证。
事件专题

推荐理由:Thinking Machines 新出的开源模型,276B 参数但只激活 12B,一发布就挤进 Text Arena 前 100,美国厂商里排前几,想试大参数但轻量推理的可以看看。
01:56
7月30日
09:17
09:17官方账号arXiv cs.LG@Petr Simecek, Elnaz Babayeva, Jiri Balhar, Michal Bida, Michal Buran, Vaclav Cadek, Luigino Camastra, Tomas Dulka, Michal Janocko, Tomas Klohna, Pavel Kohout, Ondrej Kokes, Adam Krivka, Jakub Kubik, Patrik Mada, Igor Morgenstern, Marek Pavelka, Joshua Rogers, Petr Stastny, Jan Tattermusch, Dmitrijs Trizna, Martin Votruba, Guido Vranken, Jakub Zikl, Evelina Gabasova, Stanislav Fort
论文提出HoF-Bench基准,由AISLE发现的95个真实CVE组成,覆盖8个开源仓库。在严格协议下,一个最小化LLM分析器重新发现了65个CVE(68%)。10个检测骨干包括5个开源模型(21B-284B参数)和5个专有小模型,均无前沿模型参与。基准提供7,600条模型-CVE通过记录,用于比较漏洞扫描器的可靠性。数据集已在Hugging Face发布。
推荐理由:想看开源模型能不能真挖漏洞?这个基准用95个真实CVE测了10种模型,最弱的也能找回68%,数据很实在。