9月3日
12:55
10:14
10:14shao__meng@shao__meng
精选73°
Anthropic 开源了 Claude Commerce Agents,包含购物智能体和商家智能体。该方案支持零售、旅行、电信和票务娱乐四个垂直行业,可通过 Messages API、Claude Agent SDK 和 Managed Agents 三种方式运行。架构采用单智能体 + Skills 设计,而非多子智能体,在质量和成本延迟上表现更优。
事件专题

推荐理由:Anthropic 开源了电商智能体方案,包含面向消费者和商家的两个智能体,采用单智能体架构,比子智能体方案更优。
06:05
05:12
04:33
04:33ollama@ollama
Muse Spark 1.3 版本今日发布,在编程和智能体工作方面实现了迄今为止最大的性能提升。该模型性能接近前沿水平,成本极低。用户可以在 Muse Code 和 API 中试用此模型。未来还将发布 Muse Spark 开放权重版本。
事件专题

推荐理由:Muse Spark 1.3 发布了,编程和智能体工作能力大幅提升,成本还很低,开放权重版本也快来了。
04:13
04:13
04:02
04:02宝玉@dotey
73°
OpenAI API出现了GPT-6-Astra的404错误响应,而非通常的400错误。这一异常模式与Bedrock API在Fable 5.1发布前一天出现的异常相似。OpenAI Responses API对GPT-6-Astra返回404,而对不存在的slug返回400。
事件专题

推荐理由:OpenAI API出现GPT-6-Astra的404错误,类似Bedrock API在Fable 5.1发布前的异常,暗示新模型即将发布。
03:38
03:22
01:37
01:37lmarena.ai@lmarena_ai
73°
Anthropic的Fable 5.1 (Max)在Code Arena: WebDev基准测试中以1765分排名第一,领先第二名Qwen3.8-Max-0902达77分。相比前代Fable 5 (Max)排名第八,新版本提升了137分。Fable 5.1 (Max)每百万代币成本为40美元,在高价区间重新定义了性能边界。
事件专题

推荐理由:Anthropic新发布的Fable 5.1 Max在代码基准测试中大幅领先,比第二名高出77分,刷新了高价模型性能标准。
01:35
01:33
01:33Varun Mohan@_mohansolo
Gemini 3.8 Flash已正式发布,相比3.7 Flash版本在智能体编程和通用知识工作方面有显著提升。该模型已在内部团队中使用并获得良好反馈。现在所有用户都可以通过Antigravity平台访问这一新版本。
事件专题

推荐理由:Google发布了Gemini 3.8 Flash,在编程和知识工作上比前代更强,现在人人都能用。
00:50
00:50Sundar Pichai@sundarpichai
73°
3.8 Flash Cyber 在真实 Chrome 安全漏洞评估中,比更大模型多产生 2.6 倍的正确补丁。Google 通过 Fairwind 计划向政府机构和网络安全合作伙伴提供该模型访问权限。该模型在真实世界用例中展现出超越基准测试的能力。
推荐理由:Google 发布的 3.8 Flash Cyber 模型在真实安全漏洞修复上比大模型强 2.6 倍,现在政府机构也能用上了。
00:45
00:45官方账号Google DeepMind@GoogleDeepMind
谷歌推出Gemini 3.8 Flash模型,在软件工程、智能体任务和多步推理方面相比3.7 Flash有显著提升。同时发布Gemini 3.8 Flash Cyber模型,具备前沿级漏洞检测和自动修补能力。这两个新模型旨在帮助扩展AI代理并保障代码安全。

推荐理由:谷歌发布了Gemini 3.8系列模型,一个提升推理能力,一个专注网络安全,都是各自领域的升级款。
00:40
00:40Paul Couvert@itsPaulAi
73°
Google发布Gemini 3.8 Flash模型,距离3.7 Flash仅20天。新版本性能与Opus 5和GPT-5.6 Sol相当,但价格仅为前者的1/6和1/5。Google称这是其迄今为止最好的推理和编码模型,包含两个新变体:Gemini 3.8 Flash和Gemini 3.8 Flash Cyber。
事件专题

推荐理由:Google刚发布Gemini 3.8 Flash,性能媲美顶级模型但价格便宜5-6倍,彻底改变了Flash模型的定位。
00:33
00:33lmarena.ai@lmarena_ai
78°
Gemini 3.8 Flash (High)在Agent Arena排名第14,较3.7版本提升5.94个百分点。在Text Arena中位列第7,超越Claude Opus 5 (High)的1492分。该模型在写作、多轮对话和长查询等类别中排名显著提升。
事件专题

推荐理由:GoogleDeepMind发布Gemini 3.8 Flash (High),在多个基准测试中超越前代版本和Claude Opus 5。
00:28

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。