9月3日
12:16
12:16官方账号arXiv cs.AI@Jianlyu Chen, Yuyang Hu, Hongjin Qian, Jiawei Liu, Wenqing Wei, Xiaolong Chen, Defu Lian, Zhicheng Dou, Chaozhuo Li, Qiwei Ye, Zheng Liu
精选73°
研究人员提出DisCo技能驱动型研究代理,能将广泛使用的ML仓库提炼为可重用技能。该代理创建了AREX-Skill Library,包含5000多个从1000个常用ML仓库中提炼的验证技能,组织成20个领域和178个能力家族。使用GPT-5.5作为骨干模型,在MLE-bench基准上得分提升134.3%,在PaperBench上提升34.4%,在FrontierCS上提升9.2%,在PassNet上提升14.0%。
推荐理由:DisCo代理把GitHub仓库变成可重用技能,在多个AI研究基准上大幅提升性能,比无技能版本表现更好。
10:17
10:17Tech in Asia@Aiko Gao Ishida
精选
Google推出Gemini 3.8 Flash和Flash Cyber两个新模型。Gemini 3.8 Flash Cyber在CWE-Bench基准测试中达到47.2%的pass@1分数。该基准测试专门用于评估软件漏洞修复能力。Flash Cyber专注于网络安全领域的应用。

推荐理由:Google新发布的Gemini 3.8 Flash Cyber在软件漏洞修复基准上取得47.2%的pass@1分数,专为网络安全场景优化。
10:14
10:14shao__meng@shao__meng
精选73°
Anthropic 开源了 Claude Commerce Agents,包含购物智能体和商家智能体。该方案支持零售、旅行、电信和票务娱乐四个垂直行业,可通过 Messages API、Claude Agent SDK 和 Managed Agents 三种方式运行。架构采用单智能体 + Skills 设计,而非多子智能体,在质量和成本延迟上表现更优。
事件专题

推荐理由:Anthropic 开源了电商智能体方案,包含面向消费者和商家的两个智能体,采用单智能体架构,比子智能体方案更优。
08:57
08:57SuperTechFans博客/媒体
精选73°
Anthropic推出Claude Fable 5.1和Mythos 5.1,价格降低约25%。Fable 5.1面向公众,Mythos 5.1专用于网络安全和生命科学。新模型在编码、知识工作和长期推理任务上显著超越前代,并推出企业前沿安全措施(EFS)。
事件专题

推荐理由:Anthropic新模型降价25%,Fable 5.1编码能力提升,Mythos 5.1专注网络安全,还新增企业安全功能。
9月2日
23:33
23:33IT之家博客/媒体
精选73°
谷歌在 Google DeepMind 网站上线了 Gemini 3.8 Flash 模型,基于 Gemini 3.7 Flash 开发。该模型拥有最高 1M token 上下文窗口和 64K token 文本输出能力。在编程、知识处理、多模态处理等基准测试中表现优异。模型面向个人用户、开发者和企业,适合软件工程和智能体任务场景。
事件专题

推荐理由:谷歌新发布的 Gemini 3.8 Flash 模型,在软件工程和智能体任务方面有提升,支持自定义努力水平,适合大规模部署。
20:53
20:53官方账号Decoder@Jonathan Kemper
精选73°
World Labs由AI研究员李飞飞联合创立,推出Atlas模型。该模型仅需几张照片即可生成、重建和模拟3D场景。Atlas在3D空间中锚定所有输入,而非处理为平面序列。公司称其性能超过专业模型。Atlas还能在模拟中生成机器人训练数据。

推荐理由:李飞飞团队出的Atlas模型,几张照片就能生成3D世界,还能做机器人训练数据,比专业模型还强。
18:43
16:29
16:29官方一手pandaily@contact@pandaily.com (Pandaily)
精选73°
科大讯飞全资子公司发布并开源了Spark X2.5-4B和X2.5-1.7B模型。这两款模型原生支持高达100万token的上下文长度。它们是首批支持如此长上下文的边缘模型。这些模型专为设备端AI设计。

推荐理由:科大讯飞开源了百万token上下文的边缘模型,比普通模型能处理更长文本,适合设备端部署。
11:53
11:53官方账号阿里通义 Qwen@Alibaba_Qwen
精选73°
Qwen3.8-Max-0902在Code Arena WebDev基准测试中以1691分获得第一名。该模型以每百万代币5美元的价格成为帕累托前沿最高分模型。在更新后的前沿排名中,Qwen3.8-Max-0902领先于HY4 Preview和Qwen3.8-Flash-Next。
推荐理由:阿里发布Qwen3.8-Max-0902,在编程评测中夺冠,性价比超越对手。
10:46
10:46官方账号arXiv cs.AI@Danze Chen, Zeqing Wang, Ziyue Lin, Xingyi Yang, Yeying Jin
精选73°
研究人员提出H3-World框架,将33B参数的MiniMax-H3视频生成器转化为交互式世界模型。该框架通过结构化组合角色和相机指令,实现精确的时间控制,无需专用动作模块。仅需8000个游戏样本和10000步LoRA优化,H3-World在保持高质量生成的同时实现了有效控制。
事件专题

推荐理由:MiniMax团队发布H3-World,让33B视频模型通过语言精确控制角色和相机,训练成本低效果好。
10:15
10:15官方账号arXiv cs.LG@Haoyuan Deng, Haichao Liu, Wenkai Guo, Yuan Ling, Zaijia Yang, Yuanjiang Xue, Haosheng Sun, Liangzi Wang, Ziwei Wang
精选73°
Facet-0 是一个新的机器人基础模型,专为亚毫米级精密装配任务设计。该模型在 ManuFacet-1K 数据集上训练,包含 1000 小时的同步力数据。在五个亚毫米级计算机装配任务中,Facet-0 达到 82% 的平均成功率,而最强基线模型仅为 15%。系统实现了 0.5 毫米的放置精度和 50 毫秒的命令延迟。
推荐理由:Facet-0 模型通过预测和评估接触后果,让机器人能完成高精度装配,成功率比最强基线高出 5 倍多。
08:53
08:53官方账号Simon Willison@simonw
精选73°
Anthropic发布了Claude Fable 5.1模型,最高思维级别可生成高质量SVG图像。用户使用该模型创建了一只SVG pelican图像,成本为3.30美元。该模型还支持将生成的图像动画化。Claude Fable 5.1在图像生成方面表现优于此前Anthropic模型。
事件专题

推荐理由:Anthropic新出的Claude F5.1花3.3美元能生成超棒的SVG海鸥,还能直接变动画,比之前的模型强多了。
08:23
08:23官方账号Simon Willison’s Weblog博客/媒体
精选73°
Claude Fable 5.1 在 Terminal-Bench-Science 0.1 基准测试中得分为 52.6%,较 Fable 5 的 24.7% 有显著提升。该模型提供五种推理级别:低、中、高、超高和最高。在生成 SVG 鸬鹚图像任务中,最高推理级别产生了最佳结果,消耗 65,927 个输出 tokens,耗时 13 分 54 秒,成本 3.30 美元。
事件专题

推荐理由:Anthropic 发布了 Fable 5.1,在科学基准测试中大幅领先,推理级别设置对创意输出质量影响显著。
08:13
01:58
9月1日
23:15
23:15官方一手歸藏(guizang.ai)@op7418
精选
Runway发布了Solaris模型,号称首个界面世界模型。该模型能逐帧实时生成交互界面,支持用户点击和拖动操作。用户可以拖动改变物体大小和位置,点击弹出UI选项变换样式。目前仍面临延迟、成本和一致性问题。

推荐理由:Runway的Solaris模型能实时生成可交互的界面视频,拖动树木、壁画等元素会实时变化,开创了视频模型新应用。