9月3日
10:17
10:17Tech in Asia@Aiko Gao Ishida
精选
Google推出Gemini 3.8 Flash和Flash Cyber两个新模型。Gemini 3.8 Flash Cyber在CWE-Bench基准测试中达到47.2%的pass@1分数。该基准测试专门用于评估软件漏洞修复能力。Flash Cyber专注于网络安全领域的应用。

推荐理由:Google新发布的Gemini 3.8 Flash Cyber在软件漏洞修复基准上取得47.2%的pass@1分数,专为网络安全场景优化。
08:57
08:57SuperTechFans博客/媒体
精选73°
Anthropic推出Claude Fable 5.1和Mythos 5.1,价格降低约25%。Fable 5.1面向公众,Mythos 5.1专用于网络安全和生命科学。新模型在编码、知识工作和长期推理任务上显著超越前代,并推出企业前沿安全措施(EFS)。
事件专题

推荐理由:Anthropic新模型降价25%,Fable 5.1编码能力提升,Mythos 5.1专注网络安全,还新增企业安全功能。
04:22
01:13
9月2日
23:33
23:33IT之家博客/媒体
精选73°
谷歌在 Google DeepMind 网站上线了 Gemini 3.8 Flash 模型,基于 Gemini 3.7 Flash 开发。该模型拥有最高 1M token 上下文窗口和 64K token 文本输出能力。在编程、知识处理、多模态处理等基准测试中表现优异。模型面向个人用户、开发者和企业,适合软件工程和智能体任务场景。
事件专题

推荐理由:谷歌新发布的 Gemini 3.8 Flash 模型,在软件工程和智能体任务方面有提升,支持自定义努力水平,适合大规模部署。
20:53
20:53官方账号Decoder@Jonathan Kemper
精选73°
World Labs由AI研究员李飞飞联合创立,推出Atlas模型。该模型仅需几张照片即可生成、重建和模拟3D场景。Atlas在3D空间中锚定所有输入,而非处理为平面序列。公司称其性能超过专业模型。Atlas还能在模拟中生成机器人训练数据。

推荐理由:李飞飞团队出的Atlas模型,几张照片就能生成3D世界,还能做机器人训练数据,比专业模型还强。
16:29
16:29官方一手pandaily@contact@pandaily.com (Pandaily)
精选73°
科大讯飞全资子公司发布并开源了Spark X2.5-4B和X2.5-1.7B模型。这两款模型原生支持高达100万token的上下文长度。它们是首批支持如此长上下文的边缘模型。这些模型专为设备端AI设计。

推荐理由:科大讯飞开源了百万token上下文的边缘模型,比普通模型能处理更长文本,适合设备端部署。
16:13
16:13爱范儿@莫崇宇
李飞飞团队发布了全球首个多模态世界模型 Atlas。该模型仅需几张照片就能省去传统拍摄所需的数百个机位。Atlas 能够理解空间关系,为影视制作带来新可能。这一技术突破将改变内容创作方式。
推荐理由:李飞飞团队新发布的 Atlas 模型,几张照片就能替代传统拍摄中的数百个机位,理解空间关系。
15:58
15:58官方账号Latent Space (swyx)博客/媒体
Anthropic 发布 Claude Fable/Mythos 5.1 模型,成为新的 SOTA 模型。该模型缓存价格降低 75%,同时输出 token 增加 70%。新模型在多个基准测试中表现优异,为用户提供更高性价比的选择。
事件专题

推荐理由:Anthropic 推出 Claude Fable/Mythos 5.1,价格大幅降低但输出能力提升,性价比超高。
14:48
14:48IT之家博客/媒体
73°
Arena平台发布2026年第35周AI大模型盲测排行榜。国产GLM-5.3-Flash首次进入代码榜Top 10,ELO分数达1535分。Qwen3.8-Max-0902首次入榜即登顶前端开发榜榜首,ELO分数未公布。Kimi-K3-Max稳定守住综合榜Top 10位置,ELO分数为1489分。
事件专题

推荐理由:国产模型在细分领域表现亮眼,GLM-5.3-Flash代码能力超越多数海外模型,千问3.8-Max直接登顶前端榜。
12:46
08:23
08:23官方账号Simon Willison’s Weblog博客/媒体
精选73°
Claude Fable 5.1 在 Terminal-Bench-Science 0.1 基准测试中得分为 52.6%,较 Fable 5 的 24.7% 有显著提升。该模型提供五种推理级别:低、中、高、超高和最高。在生成 SVG 鸬鹚图像任务中,最高推理级别产生了最佳结果,消耗 65,927 个输出 tokens,耗时 13 分 54 秒,成本 3.30 美元。
事件专题

推荐理由:Anthropic 发布了 Fable 5.1,在科学基准测试中大幅领先,推理级别设置对创意输出质量影响显著。
05:13
04:38
04:38官方账号OpenAI@OpenAI (@OpenAI)
73°
OpenAI即将发布Astra模型,该模型在网络安全能力方面取得重大进展,在Preparedness框架下达到Critical阈值。OpenAI展示了如何评估该模型,以及其安全措施如何随能力一同提升。Astra代表了AI安全性和可访问性的重要进步。
事件专题

推荐理由:OpenAI要发Astra了,网络安全能力达到Critical级别,安全措施和能力同步升级。
04:29
04:29官方账号Decoder@Matthias Bastian
73°
Anthropic推出Claude Fable 5.1和Mythos 5.1,这是其迄今为止最强大的AI模型。Fable 5.1在Terminal-Bench-Science基准测试中的得分比前代提升一倍,智能体编码能力提高30%。长程自主运行且包含大量工具调用的场景下,成本降低最高达45%。
事件专题

推荐理由:Anthropic新发布的Fable 5.1模型在科学基准测试中翻倍得分,编码能力提升30%,同时成本降低45%。
04:14
04:14官方一手OpenAI Blog博客/媒体
OpenAI推出Astra模型,成为首个满足Preparedness Framework框架下关键网络安全能力阈值的模型。该模型具备更强的发布安全防护措施。Astra代表了OpenAI在AI安全领域的重要进展。
事件专题

推荐理由:OpenAI发布了满足关键安全标准的Astra模型,比之前的模型有更强的安全防护。
9月1日
12:58
12:58官方账号Latent Space (swyx)博客/媒体
Fal公司发布了H3 Max Live模型,实现了实时视频生成。该模型能够以每秒24帧的速度生成视频,比观看速度更快。H3 Max Live在多个基准测试中表现出色,显著提升了视频生成效率。

推荐理由:Fal刚发布的H3 Max Live模型能实时生成视频,比观看速度还快,彻底改变了视频生成方式。