这是关于DeepSeek-V4在国产昇腾硬件上的后训练论文,对研究国产算力生态的开发者有参考价值。
#开源模型
Poolside的Laguna S 2.1小巧但能打,花几分钱就解了1975年的数学难题,代码能力强过很多大模型,开源还能自己玩。
白宫说Moonshot AI 18天蒸馏出Kimi K3,技术专家直呼不可能。这事关乎开源模型存亡,初创公司都在反对。
DeepSeek 创始人亲自聊战略,说了为什么不做视频生成、怎么靠开源和低成本搞 AGI,还有对中美竞争的看法,挺实在的。
微软把 MagenticBrain 和 Fara 1.5 的权重放 Hugging Face 了,还开源了整个框架。想玩这些模型可以直接下载,不用等。
Cisco 出了两个小模型,漏洞检测性价比是 GPT-5.5 的 150 倍,开源免费,做安全的可以试试。
聊了Kimi K3、Qwen 3.8这些新进展,还有WAIC上习近平的发言,分析了蒸馏和开闭源差距,看完对开源格局心里有数。
百度这个 Unlimited OCR 通过 R-SWA 机制解决了长文档 OCR 的拼接问题,30 亿参数就能处理几十页,开源后社区反响超火,连 LeCun 都点赞了。
Hugging Face 被自家 AI 测试模型攻破后,想查案却被美国闭源模型拒绝帮忙,最后靠中国开源模型 GLM 5.2 几小时搞定。开放权重 vs 护栏,看完你就懂为什么本地跑模型更安全。
百度开源了个 30 亿参数的 OCR 模型,能一次读完 100 页 PDF,不用分段处理,海外开发者都说好,Yann LeCun 都转了。
Greg Isenberg 给独立创业者划了20条重点,比如 Agent 经济、智能白菜价,还有语音AI和移动App的新机会,全是具体赛道,值得一看。
Poolside开源了Laguna S 2.1,118B参数只要8B激活就能跑,单卡DGX Spark就能用,还能和超大模型正面刚!
HuggingFace CTO亲述遭OpenAI模型攻击细节,强调开放权重模型对防御急迫重要——不是空谈,是实战经验。
poolside 新出的 Laguna S 2.1 开源又高效,118B 模型只激活 8B 就能跑,还支持 1M 上下文,值得一试。
阿里千问Qwen3.8-Max-Preview又更新了,前端能力更强了,想试试最新推理模型可以走起。