7月11日
00:08
00:08Harrison Chase@hwchase17
Sierra全员使用内部Agent Pinecone,该工具可自动化90%的编码、分析和琐事。Pinecone支持接入Slack、Github、Linear等工具,可在本地测试,并兼容多模型。LangChain基于此发布了开源版OpenSWE,它模型无关且完全开源,能与LangSmith集成实现可观测性。
事件专题

推荐理由:LangChain搞了个开源版OpenSWE,能像Sierra的Pinecone一样自动搞定90%编码工作,还支持多种模型。想省力气写代码的可以试试。
7月10日
10:09
10:09AI Will@FinanceYF5
@robbyant_brain 开源了LingBot-World 2.0 (Infinity)世界模型。该模型支持小时级实时生成,长时间运行后画质不衰减。输出为720p/60fps视频,解决了大多数世界模型运行几分钟后画面崩坏的问题。
事件专题

推荐理由:这个开源世界模型能稳跑几小时不崩画质,比那些几分钟就坏的强多了,机器人预判世界的好工具。
09:44
09:44官方一手arXiv: DeepSeek@Zuming Huang, Jun Huang, Kexuan Ren, Baode Wang, Weizhen Li, Jianming Feng, Yu Wang, Yichen Yao, Shijun Lin, Yige Tang, Cheng Peng, Weidi Xu, Wei Chu, Yinghui Xu, Yuan Qi
精选
Infinity-Parser2 是一个大型多模态模型,通过可控数据合成管道和多任务强化学习实现端到端文档解析。研究团队构建并开源了包含500万样本的中英双语数据集Infinity-Doc2-5M,涵盖多种文档类型和标注形式。模型采用8个联合训练目标,包括文档解析、布局分析、表格/数学公式/图表/化学公式解析及文档VQA。Infinity-Parser2-Pro 在olmOCR-Bench上达到87.6%,在ParseBench上达到74.3%,超越DeepSeek-OCR-2、PaddleOCR-VL-1.5和MinerU2.5。Flash变体推理吞吐量较Infinity-Parser-7B提升3.68倍。
推荐理由:Infinity-Parser2 用多任务强化学习搞定文档解析,开源了500万样本数据集,Pro版在OCR基准上刷新纪录,Flash版速度快3倍多。适合做文档智能处理的开发者。
05:04
05:04Cognition@cognition_labs
Cognition 推出 SWE-1.7,基于开源模型 Kimi K2.7 构建。Kimi K2.7 完成了 87% 其他模型因人权问题拒绝的任务。SWE-1.7 经专门训练以增强可信度,在评估中达到与美国模型相当的水平。
事件专题

推荐理由:Cognition 新模型 SWE-1.7 用开源 Kimi K2.7 做基座,专门解决可信度短板,评测数据不输美国模型。
04:39
04:39Cognition@cognition_labs
Cognition 在博客中表示,开源衍生模型并非天生不可信。通过精心开发、现实评估和针对性缓解措施,这类模型可以适用于生产环境的智能体。该结论基于对开源模型在实际应用中的可信度研究。
推荐理由:Cognition 给开源模型正名了,他们实测发现只要做好评估和防范,开源模型也能可靠地驱动生产级智能体。
04:03
04:03Fireworks AI@FireworksAI_HQ
Gumloop选择在Fireworks平台上部署开源开放权重模型进行生产。与OpenAI等封闭实验室API相比,成本下降80%。Fireworks的开放权重模型方案让Gumloop的API账单大幅缩减。双方合作旨在推动开源模型规模化应用。
事件专题

推荐理由:Fireworks和Gumloop联手,用开源模型替代闭源API,成本直接砍掉80%,想省钱的AI团队赶紧看看。
02:31
02:31Aravind Srinivas@AravSrinivas
精选
Arav Srinivas宣布将在美国的NVIDIA B200s上托管一个模型,并计划对Nemotron 3 Ultra进行后训练。后训练旨在提升该模型的性能,使其与美国开源模型具备同等能力。更多细节即将公布。
事件专题

推荐理由:Arav Srinivas说要在美国用B200s跑Nemotron 3 Ultra后训练,让美国开源模型追上对手进度。
02:04
00:30
7月9日
22:42
19:13
19:13官方账号Decoder@Matthias Bastian
精选
Databricks在其数百万行代码库上测试编程智能体,发现中国开源模型GLM 5.2性能与Anthropic的Opus 4.8相当。每任务成本GLM 5.2为1.28美元,Opus为1.94美元。Databricks计划将GLM 5.2作为日常编程工作主力。该公司认为没有单一供应商占主导地位,企业应自建基准而非依赖公共基准。
事件专题

推荐理由:Databricks选了国产开源模型GLM 5.2当默认编程引擎,每花1.28美元能干出Opus 1.94美元的活,省钱了性能还不差。
15:00
08:53
08:53@koltregaskes@koltregaskes
83°
MiniMax计划在Q3开源代号M3 Pro的模型,参数量达2.7T,是当前旗舰M3(428B参数)的6倍多。新模型在复杂推理和多步任务上有显著提升。由于规模巨大,M3 Pro仅适合在专业基础设施上运行,无法在消费级硬件上实时使用。开源权重可供社区实验、微调或蒸馏更小模型。

推荐理由:MiniMax要开源2.7T参数的巨模型,比M3大六倍多,专攻复杂推理。虽然本地跑不动,但开源权重让研究者能动手玩,看看中国厂商怎么卷。
03:52
02:44
02:44官方账号Clement Delangue@ClementDelangue
HuggingFace CEO Clement Delangue 表示开源模型推理在速度、质量和成本上还有巨大提升空间。ZML AI 公司由 Steeve 创立,其推理引擎已与 HuggingFace 作为存储层集成。该引擎旨在让开源模型的推理变得更高效、更便宜。

推荐理由:HuggingFace 和 ZML AI 搞了个新推理引擎,集成在 HuggingFace 上,专为开源模型提速降本,可以直接用。
02:32
02:32官方账号Epoch AI@EpochAIResearch
精选
智谱AI的GLM-5.2在Epoch Capabilities Index上获得152分,是评估过的所有开源权重模型中的最高分。该分数仍低于7个多月前发布的Gemini 3 Pro。这一结果显示出开源模型在能力基准上的进展,但与顶级闭源模型仍有差距。
事件专题

推荐理由:智谱开源模型GLM-5.2在能力指数上拿到开源最高152分,不过还是比不过7个月前发布的Gemini 3 Pro,差距一目了然。