12:08量子位@思邈石智航AWE3.7模型在多个场景中表现出色,从工业环境到家庭环境都能适应。该模型在多个基准测试中取得了优异成绩,展现了出色的跨领域适应能力。AWE3.7模型能够处理不同场景下的复杂任务,无需针对特定场景进行大量调整。AI模型石智航AWE3.7泛化能力推荐理由:石智航发布了AWE3.7模型,一个模型就能从工厂干到家庭,跨场景能力超强。原文稍后读已读值得跟进有用关注 石智航
11:01量子位@林, 方舟神秘具身团队近日发布了一系列Demo视频,展示了其自进化模型的能力。该模型能够自主学习和改进,无需人工干预。团队还公开了其技术路线,包括多模态融合和持续学习机制。这些Demo展示了模型在复杂环境中的适应能力。AI模型具身团队自进化模型多模态推荐理由:神秘具身团队放出自进化模型Demo,展示无需人工干预的自主学习能力,技术路线也公开了。原文稍后读已读值得跟进有用关注 具身团队
10:17Tech in Asia@Aiko Gao Ishida精选Google推出Gemini 3.8 Flash和Flash Cyber两个新模型。Gemini 3.8 Flash Cyber在CWE-Bench基准测试中达到47.2%的pass@1分数。该基准测试专门用于评估软件漏洞修复能力。Flash Cyber专注于网络安全领域的应用。AI模型GeminiGemini 3.8 Flash CyberCWE-Bench推荐理由:Google新发布的Gemini 3.8 Flash Cyber在软件漏洞修复基准上取得47.2%的pass@1分数,专为网络安全场景优化。原文稍后读已读值得跟进有用关注 Gemini
09:03爱范儿@郑廷旭李飞飞团队发布了世界模型 Atlas,该模型能够生成、重建与模拟三维世界。Atlas 使用统一模型架构处理三维空间数据。该模型在三维重建任务中表现出色。Atlas 的发布标志着世界模型研究的新进展。AI模型Atlas李飞飞世界模型推荐理由:李飞飞团队发布 Atlas 世界模型,能生成重建三维世界,值得关注。原文稍后读已读值得跟进有用关注 Atlas
08:57SuperTechFans(博客/媒体)精选73°Anthropic推出Claude Fable 5.1和Mythos 5.1,价格降低约25%。Fable 5.1面向公众,Mythos 5.1专用于网络安全和生命科学。新模型在编码、知识工作和长期推理任务上显著超越前代,并推出企业前沿安全措施(EFS)。AI模型ClaudeAnthropicFable 5.110 个信源在谈事件专题推荐理由:Anthropic新模型降价25%,Fable 5.1编码能力提升,Mythos 5.1专注网络安全,还新增企业安全功能。原文稍后读已读值得跟进有用关注 Claude
07:32IT之家(博客/媒体)73°Meta 于 2026 年 9 月 2 日发布迄今最强大 AI 模型 Muse Spark 1.3。该模型在编码能力上超越 OpenAI 的 GPT-5.6 Sol,与 Anthropic 的 Claude Fable 5.1 表现持平。相比前代 1.2 版本,新模型减少了约 20% 的工具调用次数,完成相同任务所需 token 减少 25%。Muse Spark 1.3 针对长周期智能体任务优化,能在单一长线程中协作处理多工作流。AI模型Muse SparkGPT-5.6Claude Fable10 个信源在谈事件专题推荐理由:Meta 新出的 Muse Spark 1.3 编码能力超 GPT-5.6,工具调用减少 20%,还支持长线程多任务处理。原文稍后读已读值得跟进有用关注 Muse Spark
07:22IT之家(博客/媒体)73°西班牙公司Multiverse Computing发布Quasar 438B模型,拥有4380亿参数,在Intelligence Index v4.1.1评测中得分为43,是欧洲得分最高的模型。该模型在Artificial Analysis Long Context Reasoning评测中得分为75.0,上下文窗口达1M词元,适合处理长文档。Quasar 438B在Terminal-Bench v2.1评测中得分为69.3,API价格为每100万输入词元0.60美元。AI模型Quasar 438BMultiverse Computing推理模型推荐理由:西班牙公司推出欧洲最强AI模型Quasar 438B,1M词元上下文,比Mistral Medium 3.5得分高13。原文稍后读已读值得跟进有用关注 Quasar 438B
04:22techcrunch@Russell Brandom73°OpenAI发布Astra模型,采用'循环深度'技术。该技术使模型能够突破大多数推理模型的顺序思维限制。安全专家对这一新方法表示担忧。AI模型OpenAIAstra推理模型9 个信源在谈事件专题推荐理由:OpenAI的Astra模型用'循环深度'技术突破顺序思维,安全专家对此表示担忧。原文稍后读已读值得跟进有用关注 OpenAI
01:13官方账号Decoder@Matthias BastianGoogle在六周内发布第三款Flash模型Gemini 3.8 Flash。该模型在部分智能体编程基准测试中与Claude Opus 5表现相当但成本更低。然而其推理过程消耗约30%更多输出token,实际使用成本高于前代模型。AI模型GeminiClaude Opus 5Google推荐理由:Google六周连推三款经济模型,Gemini 3.8 Flash虽成本低但推理消耗高。原文稍后读已读值得跟进有用关注 Gemini
00:17IT之家(博客/媒体)78°谷歌发布Gemini 3.8 Flash Cyber模型,在CyberGym基准测试中展现顶尖自主漏洞挖掘能力。该模型在涵盖20种编程语言的复杂代码工程中,漏洞挖掘成功率突破70%。在CWE-Bench测试中,其首选正确率达47.2%,同时调用成本显著更低。谷歌内部已全面部署此模型用于代码安全防护。AI模型GeminiGemini 3.8 Flash Cyber谷歌推荐理由:谷歌新发布的Gemini 3.8 Flash Cyber专门用于代码安全防护,漏洞挖掘成功率超70%,修复漏洞效率是顶尖商业模型的2.6倍。原文稍后读已读值得跟进有用关注 Gemini
23:33IT之家(博客/媒体)精选73°谷歌在 Google DeepMind 网站上线了 Gemini 3.8 Flash 模型,基于 Gemini 3.7 Flash 开发。该模型拥有最高 1M token 上下文窗口和 64K token 文本输出能力。在编程、知识处理、多模态处理等基准测试中表现优异。模型面向个人用户、开发者和企业,适合软件工程和智能体任务场景。AI模型GeminiGemini 3.8 Flash谷歌10 个信源在谈事件专题推荐理由:谷歌新发布的 Gemini 3.8 Flash 模型,在软件工程和智能体任务方面有提升,支持自定义努力水平,适合大规模部署。原文稍后读已读值得跟进有用关注 Gemini
22:53官方账号Decoder@Maximilian Schreiner73°OpenAI将即将发布的Astra模型评为首个具备'关键'网络能力的系统。该公司计划通过监控思维链来控制该模型。然而,这种监控已被证明是模型真实决策的不可靠反映。据报告,Astra的新架构将更多思维过程推向不可读区域。随着能力提升,安全网可能正在变弱。AI模型AstraOpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI的Astra模型被标记为最危险系统,新架构让监控变得更困难,安全与能力平衡面临挑战。原文稍后读已读值得跟进有用关注 Astra
20:53官方账号Decoder@Jonathan Kemper精选73°World Labs由AI研究员李飞飞联合创立,推出Atlas模型。该模型仅需几张照片即可生成、重建和模拟3D场景。Atlas在3D空间中锚定所有输入,而非处理为平面序列。公司称其性能超过专业模型。Atlas还能在模拟中生成机器人训练数据。AI模型AtlasWorld LabsFei-Fei Li推荐理由:李飞飞团队出的Atlas模型,几张照片就能生成3D世界,还能做机器人训练数据,比专业模型还强。原文稍后读已读值得跟进有用关注 Atlas
19:03爱范儿@郑廷旭李飞飞创立的 World Labs 发布了超梦系统,这是一个世界模型。该系统在多个基准测试中表现出色,能够模拟和预测物理世界的变化。超梦系统采用了最新的多模态技术,可以处理视觉、语言等多种输入数据。该系统在模拟复杂环境方面取得了显著进展。AI模型World Labs李飞飞超梦推荐理由:李飞飞团队的世界模型超梦系统来了,能模拟物理世界变化,比之前的模型更强大。原文稍后读已读值得跟进有用关注 World Labs
16:29官方一手pandaily@contact@pandaily.com (Pandaily)精选73°科大讯飞全资子公司发布并开源了Spark X2.5-4B和X2.5-1.7B模型。这两款模型原生支持高达100万token的上下文长度。它们是首批支持如此长上下文的边缘模型。这些模型专为设备端AI设计。AI模型SparkX2.5-4BX2.5-1.7B推荐理由:科大讯飞开源了百万token上下文的边缘模型,比普通模型能处理更长文本,适合设备端部署。原文稍后读已读值得跟进有用关注 Spark
16:13爱范儿@莫崇宇李飞飞团队发布了全球首个多模态世界模型 Atlas。该模型仅需几张照片就能省去传统拍摄所需的数百个机位。Atlas 能够理解空间关系,为影视制作带来新可能。这一技术突破将改变内容创作方式。AI模型Atlas李飞飞多模态推荐理由:李飞飞团队新发布的 Atlas 模型,几张照片就能替代传统拍摄中的数百个机位,理解空间关系。原文稍后读已读值得跟进有用关注 Atlas
15:58官方账号Latent Space (swyx)(博客/媒体)Anthropic 发布 Claude Fable/Mythos 5.1 模型,成为新的 SOTA 模型。该模型缓存价格降低 75%,同时输出 token 增加 70%。新模型在多个基准测试中表现优异,为用户提供更高性价比的选择。AI模型ClaudeFableMythos10 个信源在谈事件专题推荐理由:Anthropic 推出 Claude Fable/Mythos 5.1,价格大幅降低但输出能力提升,性价比超高。原文稍后读已读值得跟进有用关注 Claude
15:43量子位@量子位的朋友们73°阿里发布Qwen3.8-Max模型,在HumanEval编程基准上得分为84.5分,超越GPT-4o成为全球第一。该模型在代码生成、调试和优化方面表现优异,支持多种编程语言。Qwen3.8-Max还增强了多模态处理能力,能够理解和生成图文内容。AI模型Qwen3.8-Max阿里编程推荐理由:阿里Qwen3.8-Max编程能力登顶全球,代码生成超越GPT-4o,开发者必看。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
14:48IT之家(博客/媒体)73°Arena平台发布2026年第35周AI大模型盲测排行榜。国产GLM-5.3-Flash首次进入代码榜Top 10,ELO分数达1535分。Qwen3.8-Max-0902首次入榜即登顶前端开发榜榜首,ELO分数未公布。Kimi-K3-Max稳定守住综合榜Top 10位置,ELO分数为1489分。AI模型GLM-5.3-FlashQwen3.8-MaxKimi-K3-Max2 个信源在谈事件专题推荐理由:国产模型在细分领域表现亮眼,GLM-5.3-Flash代码能力超越多数海外模型,千问3.8-Max直接登顶前端榜。原文稍后读已读值得跟进有用关注 GLM-5.3-Flash
13:48IT之家(博客/媒体)73°马斯克宣布 Grok 4.7 将于 9 月 12 日发布,参数量达 2.1 万亿,较 Grok 4.6 增长 40%。该模型在各方面表现优于 Grok 4.6,Token 效率更高。Grok 4.6 已超越 GPT-5.6 Sol,仅次于 Opus 5 和 Fable 5。马斯克称 Grok 4.7 将超越所有竞品。AI模型GrokGrok 4.7Elon Musk推荐理由:马斯克说 Grok 4.7 十天后上线,参数量暴涨 40%,性能要碾压所有 AI原文稍后读已读值得跟进有用关注 Grok
13:48官方一手marktechpost@Michal Sutter精选73°Meta Superintelligence Labs本周发布Muse Voice Transcribe模型,将语音识别、说话人分离和端点检测三个功能整合为一个自回归模型。该模型专为实时流式语音处理设计,解决了传统语音系统中多个模型交接带来的延迟和故障点问题。Muse Voice Transcribe通过单一模型完成三项任务,提高了语音处理的效率和可靠性。AI模型Muse Voice TranscribeMeta语音识别2 个信源在谈事件专题推荐理由:Meta把语音识别、说话人分离和端点检测三个模型合成了一个,延迟更低,故障点更少。原文稍后读已读值得跟进有用关注 Muse Voice Transcribe
12:46量子位@梦晨Claude最强Fable 5.1版本正式发布,在8项基准测试中取得领先成绩。该版本引入反蒸馏机制,最高降价达45%。新版本能够处理更复杂的任务,尤其在困难任务完成度上有显著提升。AI模型ClaudeFable反蒸馏推荐理由:Claude发布了Fable 5.1,8项基准测试领先,降价45%,还加入了反蒸馏机制。原文稍后读已读值得跟进有用关注 Claude
11:16IT之家(博客/媒体)73°阿里千问宣布Qwen3.8-Max升级到0902版本,在CodeArena前端编程总榜中以1691分夺得冠军,提升22分。该模型在多步推理、工具调用和端到端app生成方面刷新全球模型上限。Qwen3.8-Max-0902每百万Tokens综合平均价格为5美元,性价比显著高于排名第二和第三的模型。AI模型Qwen3.8-Max阿里千问CodeArena推荐理由:阿里千问Qwen3.8-Max-0902版本上线,前端编程能力全球第一,价格仅竞品1/4原文稍后读已读值得跟进有用关注 Qwen3.8-Max
10:13量子位@鱼羊李飞飞团队发布了全球首个多模态世界模型,能够从单张图像生成完整3D世界。该模型在多个基准测试中表现优异,为机器人训练提供了全新环境生成方案。模型支持多种输入格式,包括2D图像和点云数据,输出精度达到厘米级。AI模型李飞飞多模态世界模型3D生成推荐理由:李飞飞团队的新模型能从一张图生成3D世界,给机器人训练提供新场地,比传统方法更高效。原文稍后读已读值得跟进有用关注 李飞飞
09:58IT之家(博客/媒体)78°World Labs发布了全球首个多模态世界模型Atlas,支持像素级精确的相机控制。Atlas能从一张或多张输入图像生成最长1分钟的1440p视频,并重建真实场景。该模型在空间重建任务上优于顶级开源重建模型,支持文本生成图像和360度全景。AI模型World LabsAtlas李飞飞推荐理由:李飞飞团队推出Atlas,能精确控制镜头生成视频和3D重建,比开源模型更强。原文稍后读已读值得跟进有用关注 World Labs
09:58IT之家(博客/媒体)73°谷歌将于当地时间周三发布Gemini 3.8 Flash模型,内部代号"Skimaki"。该模型在Jetski测试中编程能力超过Anthropic的Opus模型。Gemini 3.8 Flash属于Flash系列,设计更小、更便宜、运行更快。谷歌正通过强化学习提升模型编程能力,追赶OpenAI和Anthropic。AI模型GeminiGemini 3.8 FlashOpenAI10 个信源在谈事件专题推荐理由:谷歌新发布的Gemini 3.8 Flash编程能力已超过Anthropic Opus,缩小了与OpenAI的差距。原文稍后读已读值得跟进有用关注 Gemini
08:23官方账号Simon Willison’s Weblog(博客/媒体)精选73°Claude Fable 5.1 在 Terminal-Bench-Science 0.1 基准测试中得分为 52.6%,较 Fable 5 的 24.7% 有显著提升。该模型提供五种推理级别:低、中、高、超高和最高。在生成 SVG 鸬鹚图像任务中,最高推理级别产生了最佳结果,消耗 65,927 个输出 tokens,耗时 13 分 54 秒,成本 3.30 美元。AI模型ClaudeFable推理模型6 个信源在谈事件专题推荐理由:Anthropic 发布了 Fable 5.1,在科学基准测试中大幅领先,推理级别设置对创意输出质量影响显著。原文稍后读已读值得跟进有用关注 Claude
07:43IT之家(博客/媒体)73°OpenAI宣布将推出首个达到'关键'网络安全能力门槛的模型Astra。该模型能无需人类干预,在多个安全系统中识别并开发零日漏洞利用程序。OpenAI将采取分级开放策略,仅向小批测试人员开放高级网络安全任务,并通过Daybreak Blue计划向更广泛用户开放防御性用途。此次发布吸取了Hugging Face事件教训,强化了安全护栏。AI模型OpenAIAstra网络安全10 个信源在谈事件专题推荐理由:OpenAI的Astra模型能自主发现零日漏洞,但为防滥用将限制其网络安全功能,只开放给防御性用途。原文稍后读已读值得跟进有用关注 OpenAI
06:33IT之家(博客/媒体)78°Anthropic 推出 Claude Fable 5.1 和 Mythos 5.1 模型,前者面向所有用户,后者仅限特定机构。Fable 5.1 在 Terminal-Bench-Science 0.1 基准测试中得分为 52.6%,超越前代 Fable 5 的 24.7%。缓存读取费用下调 75%,降至每百万词元 0.25 美元。Mythos 5.1 在蛋白质设计领域结合亲和力比最佳参赛作品高出 10 倍。AI模型Claude Fable 5.1Claude Mythos 5.1Anthropic10 个信源在谈事件专题推荐理由:Anthropic 发布两款新模型,编程和科学能力大幅提升,价格更实惠,安全防护也增强了。原文稍后读已读值得跟进有用关注 Claude Fable 5.1
05:13techcrunch@Tim Fernholz73°OpenAI正在准备发布其最新的关键性大语言模型Astra。该模型在计算机系统安全测试中表现出色。OpenAI已预览了为Astra发布采取的预防措施。Astra是OpenAI最新的网络安全相关大模型。AI模型OpenAIAstra大语言模型10 个信源在谈事件专题推荐理由:OpenAI要发Astra了,这模型擅长破解电脑系统,还提前展示了安全防护措施。原文稍后读已读值得跟进有用关注 OpenAI
04:38官方账号OpenAI@OpenAI (@OpenAI)73°OpenAI即将发布Astra模型,该模型在网络安全能力方面取得重大进展,在Preparedness框架下达到Critical阈值。OpenAI展示了如何评估该模型,以及其安全措施如何随能力一同提升。Astra代表了AI安全性和可访问性的重要进步。AI模型AstraOpenAI网络安全10 个信源在谈事件专题推荐理由:OpenAI要发Astra了,网络安全能力达到Critical级别,安全措施和能力同步升级。原文稍后读已读值得跟进有用关注 Astra
04:38官方一手marktechpost@Asif Razzaq73°Anthropic发布了Claude Fable 5.1和Claude Mythos 5.1两个版本模型。Fable 5.1在Terminal-Bench-Science 0.1基准测试中得分为52.6%,较Fable 5的24.7%有显著提升。新模型支持1M token上下文窗口,缓存读取成本降低75%至每百万token 0.25美元。Fable 5.1已开放API访问,而Mythos 5.1仍限制在Glasswing项目内的经过审核的组织使用。AI模型ClaudeFableMythos10 个信源在谈事件专题推荐理由:Anthropic推出Claude 5.1双版本,科学基准分翻倍,缓存成本降75%,API有重大变更原文稍后读已读值得跟进有用关注 Claude
04:29官方账号Decoder@Matthias Bastian73°Anthropic推出Claude Fable 5.1和Mythos 5.1,这是其迄今为止最强大的AI模型。Fable 5.1在Terminal-Bench-Science基准测试中的得分比前代提升一倍,智能体编码能力提高30%。长程自主运行且包含大量工具调用的场景下,成本降低最高达45%。AI模型ClaudeFable 5.1Anthropic10 个信源在谈事件专题推荐理由:Anthropic新发布的Fable 5.1模型在科学基准测试中翻倍得分,编码能力提升30%,同时成本降低45%。原文稍后读已读值得跟进有用关注 Claude
04:14官方一手OpenAI Blog(博客/媒体)OpenAI推出Astra模型,成为首个满足Preparedness Framework框架下关键网络安全能力阈值的模型。该模型具备更强的发布安全防护措施。Astra代表了OpenAI在AI安全领域的重要进展。AI模型AstraOpenAIPreparedness Framework10 个信源在谈事件专题推荐理由:OpenAI发布了满足关键安全标准的Astra模型,比之前的模型有更强的安全防护。原文稍后读已读值得跟进有用关注 Astra
23:58官方一手marktechpost@Asif Razzaq精选73°AQuA是由普林斯顿、蚂蚁集团和斯坦福研究人员开发的双部分智能体框架。该框架专注于量化金融中的自主因子发现和模型开发。研究解决了量化研究代理在实验中可能污染证据的问题。AQuA通过分离作者和审查者角色来避免共享盲点。AI模型AQuA量化金融因子发现推荐理由:蚂蚁集团等机构推出AQuA框架,解决量化金融模型开发中的数据污染问题。原文稍后读已读值得跟进有用关注 AQuA
15:48IT之家(博客/媒体)精选73°谷歌推出TimesFM-3模型,拥有3.3亿参数,在超1万亿时间点数据上预训练。该模型支持零样本多变量时间序列预测,采用双注意力机制和连续补丁掩码技术。TimesFM-3可联合预测多个相关时间序列,捕捉依赖关系,提升准确率。原生支持多目标预测、过去协变量和动态协变量三种特性。AI模型TimesFM-3谷歌时间序列预测2 个信源在谈事件专题推荐理由:谷歌发布3.3亿参数的TimesFM-3,能零样本预测多变量时间序列,无需微调即可捕捉复杂依赖关系。原文稍后读已读值得跟进有用关注 TimesFM-3
13:33IT之家(博客/媒体)精选73°智能化工大模型 3.0 Pro 由大连化物所、科大讯飞和阿里云联合研发,于 8 月 31 日正式发布。该模型集成了超过 400 个化工智能体和工具,文本问答准确率达 81.96%,多模态问答准确率达 80.75%,综合得分较 3.0 版本提升 20.2% 和 31.4%。目前已有 300 余家化工企业、高校和科研院所注册使用,API 累计调用量突破 1,400 万次。AI模型智能化工大模型大连化物所科大讯飞推荐理由:大连化物所等发布智能化工大模型 3.0 Pro,从问答升级为能执行复杂任务的智能工程伙伴,准确率提升超 20%。原文稍后读已读值得跟进有用关注 智能化工大模型
13:33量子位@思邈精选清华大学AIR团队与域变换联合发布了WAM模型,实现了具身In-Context Causal Learning。该模型在参数冻结的情况下仍能持续提升能力。WAM在多个基准测试中表现出色,展现了自进化特性。这一突破为AI自主学习提供了新思路。AI模型WAM清华大学AIR域变换推荐理由:清华AIR和域变换联手搞了个WAM模型,不用改参数就能自己进化,比传统方法强多了。原文稍后读已读值得跟进有用关注 WAM
12:58官方账号Latent Space (swyx)(博客/媒体)Fal公司发布了H3 Max Live模型,实现了实时视频生成。该模型能够以每秒24帧的速度生成视频,比观看速度更快。H3 Max Live在多个基准测试中表现出色,显著提升了视频生成效率。AI模型H3 Max LiveFal视频生成推荐理由:Fal刚发布的H3 Max Live模型能实时生成视频,比观看速度还快,彻底改变了视频生成方式。原文稍后读已读值得跟进有用关注 H3 Max Live
12:33IT之家(博客/媒体)精选73°腾讯混元团队发布 Hy4 preview 轻量版,将模型权重从 1.5TB 压缩至 214GB。该版本采用 Sherry 稀疏三值量化算法和 MIX-STQ1_0 混合精度策略,使模型在长文理解、多轮长上下文检索等任务上表现稳定。MCP Atlas 得分从 83.7 微降至 83.2,SWE-Bench multi 从 82.9 降至 81.3。轻量版模型已上线 Hugging Face 和 GitHub 平台,支持多种主流推理框架。AI模型混元Hy4 previewSherry推荐理由:腾讯把 1.5TB 的 Hy4 模型压缩到 214GB,还能在异构设备上联合推理,速度提升 6 倍。原文稍后读已读值得跟进有用关注 混元
AITOP8月7日 17:02Kimi K3沙盒逃逸:一只“只搜不攻”的文明越狱者,为何令安全圈集体警觉?Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索答案,未发起攻击。而此前 OpenAI 与 Anthropic 的模型在同类测试中,均出现了攻击外部系统或 Hugging Face 的主动行为。