9月3日
16:33
14:05
14:05Genspark@genspark_ai
精选73°
Genspark平台已上线Gemini-3.8-Flash模型,提供AI聊天、代码助手和Claw功能。这是Google发布的最新推理与编码模型,距离前代3.7 Flash仅三周时间。新模型包括Gemini 3.8 Flash和Gemini 3.8 Flash Cyber两个版本。
事件专题

推荐理由:Google发布Gemini 3.8 Flash,比前代仅三周就更新,推理和编码能力更强。
04:23
04:22
03:38
01:35
01:13
00:40
00:40Paul Couvert@itsPaulAi
73°
Google发布Gemini 3.8 Flash模型,距离3.7 Flash仅20天。新版本性能与Opus 5和GPT-5.6 Sol相当,但价格仅为前者的1/6和1/5。Google称这是其迄今为止最好的推理和编码模型,包含两个新变体:Gemini 3.8 Flash和Gemini 3.8 Flash Cyber。
事件专题

推荐理由:Google刚发布Gemini 3.8 Flash,性能媲美顶级模型但价格便宜5-6倍,彻底改变了Flash模型的定位。
00:17
00:14
00:14Google Gemini App@GeminiApp
73°
Google今日发布Gemini 3.8 Flash模型,Pro和Ultra用户可使用。该模型针对日常话题提供可靠全面的建议,并支持文本分析和复杂编码等深度任务。Gemini 3.8 Flash在响应质量和实用性方面有所提升。
事件专题

推荐理由:Google发布了Gemini 3.8 Flash,Pro和Ultra用户现在可以用它做文本分析和复杂编程了。
00:13
00:13
9月2日
15:58
15:58官方账号Latent Space (swyx)博客/媒体
Anthropic 发布 Claude Fable/Mythos 5.1 模型,成为新的 SOTA 模型。该模型缓存价格降低 75%,同时输出 token 增加 70%。新模型在多个基准测试中表现优异,为用户提供更高性价比的选择。
事件专题

推荐理由:Anthropic 推出 Claude Fable/Mythos 5.1,价格大幅降低但输出能力提升,性价比超高。
15:03
10:18
10:18官方账号阿里通义 Qwen@Alibaba_Qwen
73°
阿里巴巴推出Qwen3.8-Max-0902模型,参数量达2.4T,上下文窗口扩展至100万token。该模型在Code & Cowork数据上进行额外训练,在复杂企业任务、科研和长流程工作流中表现更强。QwenCloud API现已上线,输入每百万token收费2美元,输出收费6美元。

推荐理由:阿里升级了Qwen3.8-Max到0902版本,参数量和上下文都大幅提升,企业级任务表现更强,价格也公布了。
10:08
10:08官方账号arXiv cs.LG@Mariia Drozdova, Aidan Sirbu, Pietro Miotti, Robert Obryk, Mayalen Etcheverry, Eyvind Niklasson, Blake Richards
精选73°
研究人员将持久隐藏状态添加到扩散去噪器中,移除其时间步条件,创建了一个可运行任意深度的共享更新模型。该模型在Sudoku-Extreme上达到99.90%的精确解决率,在Maze-Unique上获得98.93%的解决率。推理过程中,每步用高斯噪声替换所有非线索变量,无需渐进去噪即可实现近乎完美的求解。
推荐理由:新研究将扩散模型转化为迭代推理器,解决数独和迷宫问题表现优异,无需并行回滚或外部验证器。
08:23
08:23官方账号Simon Willison’s Weblog博客/媒体
精选73°
Claude Fable 5.1 在 Terminal-Bench-Science 0.1 基准测试中得分为 52.6%,较 Fable 5 的 24.7% 有显著提升。该模型提供五种推理级别:低、中、高、超高和最高。在生成 SVG 鸬鹚图像任务中,最高推理级别产生了最佳结果,消耗 65,927 个输出 tokens,耗时 13 分 54 秒,成本 3.30 美元。
事件专题

推荐理由:Anthropic 发布了 Fable 5.1,在科学基准测试中大幅领先,推理级别设置对创意输出质量影响显著。
06:48
06:48Claude@claudeai
Claude模型在Terminal-Bench-Science 0.1测试中得分为52.6%,是Fable 5的两倍多。在Terminal-Bench 4.0测试中,Claude得分为55.8%,而Fable 5为42.0%。这些成绩表明Claude在科学任务和综合能力方面表现优异。
事件专题

推荐理由:Claude在两项重要基准测试中大幅领先Fable 5,科学任务得分翻倍,综合能力提升13.8%。
04:38
04:38官方账号OpenAI@OpenAI (@OpenAI)
73°
OpenAI即将发布Astra模型,该模型在网络安全能力方面取得重大进展,在Preparedness框架下达到Critical阈值。OpenAI展示了如何评估该模型,以及其安全措施如何随能力一同提升。Astra代表了AI安全性和可访问性的重要进步。
事件专题

推荐理由:OpenAI要发Astra了,网络安全能力达到Critical级别,安全措施和能力同步升级。
04:13
02:25