9月3日
12:55
12:16
12:16官方账号arXiv cs.AI@Jianlyu Chen, Yuyang Hu, Hongjin Qian, Jiawei Liu, Wenqing Wei, Xiaolong Chen, Defu Lian, Zhicheng Dou, Chaozhuo Li, Qiwei Ye, Zheng Liu
精选73°
研究人员提出DisCo技能驱动型研究代理,能将广泛使用的ML仓库提炼为可重用技能。该代理创建了AREX-Skill Library,包含5000多个从1000个常用ML仓库中提炼的验证技能,组织成20个领域和178个能力家族。使用GPT-5.5作为骨干模型,在MLE-bench基准上得分提升134.3%,在PaperBench上提升34.4%,在FrontierCS上提升9.2%,在PassNet上提升14.0%。
推荐理由:DisCo代理把GitHub仓库变成可重用技能,在多个AI研究基准上大幅提升性能,比无技能版本表现更好。
11:51
11:51官方账号arXiv cs.LG@Aleksander Ficek, Sean Narenthiran, Mehrzad Samadi, Somshubra Majumdar, Boris Ginsburg
78°
NVIDIA研究人员使用22,000道精选问题训练了Nemotron-3-Nano-CC和Ultra-CC模型。Nano-CC模型通过后训练从130分提升至291分,配合GenCorrect策略达到468分,超过IOI 2025金牌线438.3分。Ultra-CC模型在IOI 2026模拟中取得535.4分,超越人类最高分498.27分。
事件专题

推荐理由:NVIDIA训练的编程竞赛模型首次在IOI中击败人类冠军,分数535.4远超金牌线361.12。
10:17
10:17Tech in Asia@Aiko Gao Ishida
精选
Google推出Gemini 3.8 Flash和Flash Cyber两个新模型。Gemini 3.8 Flash Cyber在CWE-Bench基准测试中达到47.2%的pass@1分数。该基准测试专门用于评估软件漏洞修复能力。Flash Cyber专注于网络安全领域的应用。

推荐理由:Google新发布的Gemini 3.8 Flash Cyber在软件漏洞修复基准上取得47.2%的pass@1分数,专为网络安全场景优化。
10:14
10:14shao__meng@shao__meng
精选73°
Anthropic 开源了 Claude Commerce Agents,包含购物智能体和商家智能体。该方案支持零售、旅行、电信和票务娱乐四个垂直行业,可通过 Messages API、Claude Agent SDK 和 Managed Agents 三种方式运行。架构采用单智能体 + Skills 设计,而非多子智能体,在质量和成本延迟上表现更优。
事件专题

推荐理由:Anthropic 开源了电商智能体方案,包含面向消费者和商家的两个智能体,采用单智能体架构,比子智能体方案更优。
08:57
08:57SuperTechFans博客/媒体
精选73°
Anthropic推出Claude Fable 5.1和Mythos 5.1,价格降低约25%。Fable 5.1面向公众,Mythos 5.1专用于网络安全和生命科学。新模型在编码、知识工作和长期推理任务上显著超越前代,并推出企业前沿安全措施(EFS)。
事件专题

推荐理由:Anthropic新模型降价25%,Fable 5.1编码能力提升,Mythos 5.1专注网络安全,还新增企业安全功能。
06:05
05:12
04:33
04:33ollama@ollama
Muse Spark 1.3 版本今日发布,在编程和智能体工作方面实现了迄今为止最大的性能提升。该模型性能接近前沿水平,成本极低。用户可以在 Muse Code 和 API 中试用此模型。未来还将发布 Muse Spark 开放权重版本。
事件专题

推荐理由:Muse Spark 1.3 发布了,编程和智能体工作能力大幅提升,成本还很低,开放权重版本也快来了。
04:22
04:13
04:13
04:02
04:02宝玉@dotey
73°
OpenAI API出现了GPT-6-Astra的404错误响应,而非通常的400错误。这一异常模式与Bedrock API在Fable 5.1发布前一天出现的异常相似。OpenAI Responses API对GPT-6-Astra返回404,而对不存在的slug返回400。
事件专题

推荐理由:OpenAI API出现GPT-6-Astra的404错误,类似Bedrock API在Fable 5.1发布前的异常,暗示新模型即将发布。
03:38
03:22
01:37
01:37lmarena.ai@lmarena_ai
73°
Anthropic的Fable 5.1 (Max)在Code Arena: WebDev基准测试中以1765分排名第一,领先第二名Qwen3.8-Max-0902达77分。相比前代Fable 5 (Max)排名第八,新版本提升了137分。Fable 5.1 (Max)每百万代币成本为40美元,在高价区间重新定义了性能边界。
事件专题

推荐理由:Anthropic新发布的Fable 5.1 Max在代码基准测试中大幅领先,比第二名高出77分,刷新了高价模型性能标准。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。