9月2日
11:53
11:53官方账号阿里通义 Qwen@Alibaba_Qwen
精选73°
Qwen3.8-Max-0902在Code Arena WebDev基准测试中以1691分获得第一名。该模型以每百万代币5美元的价格成为帕累托前沿最高分模型。在更新后的前沿排名中,Qwen3.8-Max-0902领先于HY4 Preview和Qwen3.8-Flash-Next。
推荐理由:阿里发布Qwen3.8-Max-0902,在编程评测中夺冠,性价比超越对手。
10:46
10:46官方账号arXiv cs.AI@Danze Chen, Zeqing Wang, Ziyue Lin, Xingyi Yang, Yeying Jin
精选73°
研究人员提出H3-World框架,将33B参数的MiniMax-H3视频生成器转化为交互式世界模型。该框架通过结构化组合角色和相机指令,实现精确的时间控制,无需专用动作模块。仅需8000个游戏样本和10000步LoRA优化,H3-World在保持高质量生成的同时实现了有效控制。
事件专题

推荐理由:MiniMax团队发布H3-World,让33B视频模型通过语言精确控制角色和相机,训练成本低效果好。
10:43
10:33
10:33AI Will@FinanceYF5
73°
World Labs 发布了 Atlas,这是全球首个多模态世界模型。Atlas 能够以像素级精确的相机控制生成图像和视频帧。该模型可以将生成的图像重建为 3D 场景。Atlas 能够建模世界、移动相机并模拟空间与时间。
推荐理由:World Labs 推出 Atlas,首个能精确控制相机并生成 3D 内容的世界模型,比传统方法更逼真。
10:18
10:18官方账号阿里通义 Qwen@Alibaba_Qwen
73°
阿里巴巴推出Qwen3.8-Max-0902模型,参数量达2.4T,上下文窗口扩展至100万token。该模型在Code & Cowork数据上进行额外训练,在复杂企业任务、科研和长流程工作流中表现更强。QwenCloud API现已上线,输入每百万token收费2美元,输出收费6美元。

推荐理由:阿里升级了Qwen3.8-Max到0902版本,参数量和上下文都大幅提升,企业级任务表现更强,价格也公布了。
10:15
10:15官方账号arXiv cs.LG@Haoyuan Deng, Haichao Liu, Wenkai Guo, Yuan Ling, Zaijia Yang, Yuanjiang Xue, Haosheng Sun, Liangzi Wang, Ziwei Wang
精选73°
Facet-0 是一个新的机器人基础模型,专为亚毫米级精密装配任务设计。该模型在 ManuFacet-1K 数据集上训练,包含 1000 小时的同步力数据。在五个亚毫米级计算机装配任务中,Facet-0 达到 82% 的平均成功率,而最强基线模型仅为 15%。系统实现了 0.5 毫米的放置精度和 50 毫秒的命令延迟。
推荐理由:Facet-0 模型通过预测和评估接触后果,让机器人能完成高精度装配,成功率比最强基线高出 5 倍多。
08:53
08:53官方账号Simon Willison@simonw
精选73°
Anthropic发布了Claude Fable 5.1模型,最高思维级别可生成高质量SVG图像。用户使用该模型创建了一只SVG pelican图像,成本为3.30美元。该模型还支持将生成的图像动画化。Claude Fable 5.1在图像生成方面表现优于此前Anthropic模型。
事件专题

推荐理由:Anthropic新出的Claude F5.1花3.3美元能生成超棒的SVG海鸥,还能直接变动画,比之前的模型强多了。
08:44
08:44cat@_catwu
Claude推出Fable 5.1和Mythos 5.1,这是全球最先进的编程和知识工作模型。Fable 5.1能处理原本需要数月才能完成的项目。这些模型可在Claude Code、Claude Cowork和Claude Tag中使用。
事件专题

推荐理由:Claude发布了Fable 5.1和Mythos 5.1,号称全球最先进的编程和知识工作模型,能帮你完成原本需要数月的大项目。
08:23
08:23官方账号Simon Willison’s Weblog博客/媒体
精选73°
Claude Fable 5.1 在 Terminal-Bench-Science 0.1 基准测试中得分为 52.6%,较 Fable 5 的 24.7% 有显著提升。该模型提供五种推理级别:低、中、高、超高和最高。在生成 SVG 鸬鹚图像任务中,最高推理级别产生了最佳结果,消耗 65,927 个输出 tokens,耗时 13 分 54 秒,成本 3.30 美元。
事件专题

推荐理由:Anthropic 发布了 Fable 5.1,在科学基准测试中大幅领先,推理级别设置对创意输出质量影响显著。
08:13
06:48
06:48Claude@claudeai
Claude模型在Terminal-Bench-Science 0.1测试中得分为52.6%,是Fable 5的两倍多。在Terminal-Bench 4.0测试中,Claude得分为55.8%,而Fable 5为42.0%。这些成绩表明Claude在科学任务和综合能力方面表现优异。
事件专题

推荐理由:Claude在两项重要基准测试中大幅领先Fable 5,科学任务得分翻倍,综合能力提升13.8%。
06:08
05:13
04:38
04:38官方账号OpenAI@OpenAI (@OpenAI)
73°
OpenAI即将发布Astra模型,该模型在网络安全能力方面取得重大进展,在Preparedness框架下达到Critical阈值。OpenAI展示了如何评估该模型,以及其安全措施如何随能力一同提升。Astra代表了AI安全性和可访问性的重要进步。
事件专题

推荐理由:OpenAI要发Astra了,网络安全能力达到Critical级别,安全措施和能力同步升级。
04:29
04:29官方账号Decoder@Matthias Bastian
73°
Anthropic推出Claude Fable 5.1和Mythos 5.1,这是其迄今为止最强大的AI模型。Fable 5.1在Terminal-Bench-Science基准测试中的得分比前代提升一倍,智能体编码能力提高30%。长程自主运行且包含大量工具调用的场景下,成本降低最高达45%。
事件专题

推荐理由:Anthropic新发布的Fable 5.1模型在科学基准测试中翻倍得分,编码能力提升30%,同时成本降低45%。
04:14
04:14官方一手OpenAI Blog博客/媒体
OpenAI推出Astra模型,成为首个满足Preparedness Framework框架下关键网络安全能力阈值的模型。该模型具备更强的发布安全防护措施。Astra代表了OpenAI在AI安全领域的重要进展。
事件专题

推荐理由:OpenAI发布了满足关键安全标准的Astra模型,比之前的模型有更强的安全防护。
04:13
03:54

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。