11:53官方账号阿里通义 Qwen@Alibaba_Qwen精选73°Qwen3.8-Max-0902在Code Arena WebDev基准测试中以1691分获得第一名。该模型以每百万代币5美元的价格成为帕累托前沿最高分模型。在更新后的前沿排名中,Qwen3.8-Max-0902领先于HY4 Preview和Qwen3.8-Flash-Next。AI模型Qwen3.8-Max-0902Code ArenaAlibaba_Qwen推荐理由:阿里发布Qwen3.8-Max-0902,在编程评测中夺冠,性价比超越对手。原文稍后读已读值得跟进有用关注 Qwen3.8-Max-0902
11:16IT之家(博客/媒体)73°阿里千问宣布Qwen3.8-Max升级到0902版本,在CodeArena前端编程总榜中以1691分夺得冠军,提升22分。该模型在多步推理、工具调用和端到端app生成方面刷新全球模型上限。Qwen3.8-Max-0902每百万Tokens综合平均价格为5美元,性价比显著高于排名第二和第三的模型。AI模型Qwen3.8-Max阿里千问CodeArena推荐理由:阿里千问Qwen3.8-Max-0902版本上线,前端编程能力全球第一,价格仅竞品1/4原文稍后读已读值得跟进有用关注 Qwen3.8-Max
11:08lmarena.ai@lmarena_ai精选73°Qwen3.8-Max-0902在Code Arena: WebDev基准测试中以1691分获得第一名。该模型在帕累托前沿上以每百万token 5美元的价格成为最高分模型。它超越了HY4 Preview(1629分,每百万token 2.08美元)和Qwen3.8-Flash-Next(1620分,每百万token 0.39美元)。AI模型Qwen3.8-Max-0902Alibaba_QwenCode Arena推荐理由:阿里Qwen新模型Qwen3.8-Max-0902在代码评测中登顶,性价比超高。原文稍后读已读值得跟进有用关注 Qwen3.8-Max-0902
11:08lmarena.ai@lmarena_ai73°Qwen3.8-Max-0.902由阿里巴巴发布,在Code Arena: WebDev基准测试中以1691分位居第一。该模型比Claude Opus 5高出3分,比Kimi K3高出17分,比前代Qwen3.8-Max高出22分。价格为每百万token 5美元,同时在帕累托前沿上获得最高分。该模型在数据分析、消费品开发等类别排名第一。AI模型Qwen3.8-Max-0902Alibaba_QwenCode Arena推荐理由:阿里Qwen3.8-Max-0902在代码基准测试中超越Claude和Kimi,价格实惠,多项类别领先。原文稍后读已读值得跟进有用关注 Qwen3.8-Max-0902
10:49官方一手arXiv: DeepSeek@Haoyang Yan, Min-le Su, Hangfan Zhang, Zhanhao Li, Chen Zhang, Shao Zhang, Yang Chen, Lei Bai, Shuyue Hu精选73°Harness-of-Harness(HoH)框架使基于LLM的编码代理能够在自主开发过程中持续改进软件。该框架在GameCraft-Bench、FrontierSWE和ProgramBench三个基准测试中,使用Codex与GPT-5.5、OpenCode与DeepSeek-V4-Pro、Pi与MiniMax-M3三对模型组合,平均相对提升52.25%,最高提升82.86%。在70多次迭代的多日部署中,HoH自主开发了一款具有连贯故事线、完整核心机制、可玩体验、精美视觉效果和集成音频的第一人称射击游戏。AI模型Harness-of-HarnessGPT-5.5DeepSeek-V4-Pro推荐理由:HoH框架让AI编码代理能持续改进软件,在三个基准测试中平均提升52%,还能自主开发完整游戏。原文稍后读已读值得跟进有用关注 Harness-of-Harness
10:46官方账号arXiv cs.AI@Danze Chen, Zeqing Wang, Ziyue Lin, Xingyi Yang, Yeying Jin精选73°研究人员提出H3-World框架,将33B参数的MiniMax-H3视频生成器转化为交互式世界模型。该框架通过结构化组合角色和相机指令,实现精确的时间控制,无需专用动作模块。仅需8000个游戏样本和10000步LoRA优化,H3-World在保持高质量生成的同时实现了有效控制。AI模型H3-WorldMiniMax-H3视频生成1 个信源在谈事件专题推荐理由:MiniMax团队发布H3-World,让33B视频模型通过语言精确控制角色和相机,训练成本低效果好。原文稍后读已读值得跟进有用关注 H3-World
10:43AI Will@FinanceYF573°Atlas是World Labs开发的可扩展基础模型,具备感知、生成和推理能力。该模型能够与虚拟和物理世界进行交互。World Labs将在未来几周开放Atlas的早期体验。AI模型AtlasWorld Labs基础模型推荐理由:World Labs新出的Atlas模型能感知、生成、推理,还能和物理世界互动,几周后就能体验。原文稍后读已读值得跟进有用关注 Atlas
10:43AI Will@FinanceYF5精选73°研究人员发布了一种从零开始预训练的多模态自回归扩散Transformer架构。该架构融合了现代大语言模型和视频模型的优势。它受益于两个领域在架构、算法和系统上的最新进展。这一统一架构能够处理多种模态的数据。AI模型多模态Transformer自回归扩散推荐理由:新发布的架构融合了语言和视频模型优势,从零开始预训练,多模态处理能力强。原文稍后读已读值得跟进有用关注 多模态
10:33AI Will@FinanceYF573°World Labs 发布了 Atlas,这是全球首个多模态世界模型。Atlas 能够以像素级精确的相机控制生成图像和视频帧。该模型可以将生成的图像重建为 3D 场景。Atlas 能够建模世界、移动相机并模拟空间与时间。AI模型AtlasWorld Labs多模态推荐理由:World Labs 推出 Atlas,首个能精确控制相机并生成 3D 内容的世界模型,比传统方法更逼真。原文稍后读已读值得跟进有用关注 Atlas
10:18官方账号阿里通义 Qwen@Alibaba_Qwen73°阿里巴巴推出Qwen3.8-Max-0902模型,参数量达2.4T,上下文窗口扩展至100万token。该模型在Code & Cowork数据上进行额外训练,在复杂企业任务、科研和长流程工作流中表现更强。QwenCloud API现已上线,输入每百万token收费2美元,输出收费6美元。AI模型Qwen3.8-Max-0902Qwen阿里巴巴推荐理由:阿里升级了Qwen3.8-Max到0902版本,参数量和上下文都大幅提升,企业级任务表现更强,价格也公布了。原文稍后读已读值得跟进有用关注 Qwen3.8-Max-0902
10:15官方账号arXiv cs.LG@Haoyuan Deng, Haichao Liu, Wenkai Guo, Yuan Ling, Zaijia Yang, Yuanjiang Xue, Haosheng Sun, Liangzi Wang, Ziwei Wang精选73°Facet-0 是一个新的机器人基础模型,专为亚毫米级精密装配任务设计。该模型在 ManuFacet-1K 数据集上训练,包含 1000 小时的同步力数据。在五个亚毫米级计算机装配任务中,Facet-0 达到 82% 的平均成功率,而最强基线模型仅为 15%。系统实现了 0.5 毫米的放置精度和 50 毫秒的命令延迟。AI模型Facet-0机器人精密装配推荐理由:Facet-0 模型通过预测和评估接触后果,让机器人能完成高精度装配,成功率比最强基线高出 5 倍多。原文稍后读已读值得跟进有用关注 Facet-0
10:13量子位@鱼羊李飞飞团队发布了全球首个多模态世界模型,能够从单张图像生成完整3D世界。该模型在多个基准测试中表现优异,为机器人训练提供了全新环境生成方案。模型支持多种输入格式,包括2D图像和点云数据,输出精度达到厘米级。AI模型李飞飞多模态世界模型3D生成推荐理由:李飞飞团队的新模型能从一张图生成3D世界,给机器人训练提供新场地,比传统方法更高效。原文稍后读已读值得跟进有用关注 李飞飞
09:58IT之家(博客/媒体)78°World Labs发布了全球首个多模态世界模型Atlas,支持像素级精确的相机控制。Atlas能从一张或多张输入图像生成最长1分钟的1440p视频,并重建真实场景。该模型在空间重建任务上优于顶级开源重建模型,支持文本生成图像和360度全景。AI模型World LabsAtlas李飞飞推荐理由:李飞飞团队推出Atlas,能精确控制镜头生成视频和3D重建,比开源模型更强。原文稍后读已读值得跟进有用关注 World Labs
09:58IT之家(博客/媒体)73°谷歌将于当地时间周三发布Gemini 3.8 Flash模型,内部代号"Skimaki"。该模型在Jetski测试中编程能力超过Anthropic的Opus模型。Gemini 3.8 Flash属于Flash系列,设计更小、更便宜、运行更快。谷歌正通过强化学习提升模型编程能力,追赶OpenAI和Anthropic。AI模型GeminiGemini 3.8 FlashOpenAI10 个信源在谈事件专题推荐理由:谷歌新发布的Gemini 3.8 Flash编程能力已超过Anthropic Opus,缩小了与OpenAI的差距。原文稍后读已读值得跟进有用关注 Gemini
09:36官方账号arXiv cs.AI@Nikita Oblakov, Sabrina Sadiekh, Evgeniy Kokuykin精选73°HiveTraceGuard-Pro是一款0.6B参数的生成式护栏模型,基于Qwen3-0.6B通过LoRA微调而成。该模型支持俄语和英语,采用二元评分规则(安全/不安全)进行最终目标轮次判断。在包含19个基准组的测试中,HiveTraceGuard-Pro的综合得分为0.7432,在俄语提示注入召回率上达到0.999,延迟仅为14.3毫秒。AI模型HiveTraceGuard-ProQwen3-0.6B护栏模型推荐理由:俄语安全护栏新模型,在俄语提示注入检测上表现优异,延迟最低,开源权重已发布。原文稍后读已读值得跟进有用关注 HiveTraceGuard-Pro
08:53官方账号Simon Willison@simonw精选73°Anthropic发布了Claude Fable 5.1模型,最高思维级别可生成高质量SVG图像。用户使用该模型创建了一只SVG pelican图像,成本为3.30美元。该模型还支持将生成的图像动画化。Claude Fable 5.1在图像生成方面表现优于此前Anthropic模型。AI模型Claude Fable 5.1AnthropicSVG10 个信源在谈事件专题推荐理由:Anthropic新出的Claude F5.1花3.3美元能生成超棒的SVG海鸥,还能直接变动画,比之前的模型强多了。原文稍后读已读值得跟进有用关注 Claude Fable 5.1
08:44cat@_catwuClaude推出Fable 5.1和Mythos 5.1,这是全球最先进的编程和知识工作模型。Fable 5.1能处理原本需要数月才能完成的项目。这些模型可在Claude Code、Claude Cowork和Claude Tag中使用。AI模型ClaudeFable 5.1Mythos 5.13 个信源在谈事件专题推荐理由:Claude发布了Fable 5.1和Mythos 5.1,号称全球最先进的编程和知识工作模型,能帮你完成原本需要数月的大项目。原文稍后读已读值得跟进有用关注 Claude
08:43shao__meng@shao__meng73°Shopify ML团队基于Qwen3.5-0.8B微调的模型在特定任务上击败了GPT 5.6-sol xhigh。CEO tobi表示,为特定用途训练小模型效果出奇地好。这一成功依赖于优秀的自我改进递归飞轮机制。小模型在专门任务上展现出超越大模型的性能。AI模型Qwen3.5-0.8BGPT 5.6-sol xhighShopify推荐理由:Shopify用0.8B小模型微调后打败了GPT 5.6-sol xhigh,小模型专用训练有奇效。原文稍后读已读值得跟进有用关注 Qwen3.5-0.8B
08:29shao__meng@shao__meng73°Anthropic同时发布Claude Fable 5.1和Mythos 5.1两个模型。Fable 5.1是通用旗舰模型,主打编程与知识工作,已全量开放。Mythos 5.1是垂直领域模型,面向网络防御者和生命科学研究者,仅通过可信访问计划提供。Fable 5.1在Terminal-Bench-Science 0.1基准测试中从26%提升至52.6%,在Terminal-Bench 4.0中从42.0%提升至55.8%。AI模型ClaudeFableMythos10 个信源在谈事件专题推荐理由:Anthropic发布Fable 5.1和Mythos 5.1,前者编程能力大幅提升且成本降低25%,后者专注网络安全和生命科学领域。原文稍后读已读值得跟进有用关注 Claude
08:28shao__meng@shao__meng73°Google为Gemini系列推出Agentic Video Understanding功能,首发于Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite版本。该技术将token消耗降低最高88%,分析成本降低最高66%,同时准确率提升最高7%。AVU技术从传统的'被动看'模式转变为'主动查'模式,模型可自主决定观看速度和内容片段。AI模型GeminiAgentic Video UnderstandingGoogle推荐理由:Google给Gemini加了个新功能,看视频更聪明还省钱,能自己决定看哪里,长视频分析成本大降。原文稍后读已读值得跟进有用关注 Gemini
08:28shao__meng@shao__meng78°Atlas 是从零预训练的多模态自回归扩散 Transformer,原生统一处理文本/图像/视频/3D。该模型引入'空间上下文'概念,将图像/深度图放置在3D空间特定位置,实现像素级相机控制和上下文世界理解。Atlas 支持相机可控生成最长1分钟1440p视频,从1到100+张图像重建3D场景,并实现时空仿真和图像生成功能。AI模型AtlasWorld Labs多模态推荐理由:World Labs 推出的 Atlas 模型能同时生成、重建和仿真世界,用几何输入而非文本控制相机,在3D重建上超越专用SOTA模型。原文稍后读已读值得跟进有用关注 Atlas
08:23官方账号Simon Willison’s Weblog(博客/媒体)精选73°Claude Fable 5.1 在 Terminal-Bench-Science 0.1 基准测试中得分为 52.6%,较 Fable 5 的 24.7% 有显著提升。该模型提供五种推理级别:低、中、高、超高和最高。在生成 SVG 鸬鹚图像任务中,最高推理级别产生了最佳结果,消耗 65,927 个输出 tokens,耗时 13 分 54 秒,成本 3.30 美元。AI模型ClaudeFable推理模型6 个信源在谈事件专题推荐理由:Anthropic 发布了 Fable 5.1,在科学基准测试中大幅领先,推理级别设置对创意输出质量影响显著。原文稍后读已读值得跟进有用关注 Claude
08:13Notion@NotionHQ精选73°Claude Fable 5.1现已面向Custom Agents可用。该版本相比Fable 5全面升级,特别优化了复杂知识工作场景。新版本的计划和摘要生成更加简洁。AI模型ClaudeFableCustom Agents推荐理由:Anthropic发布了Claude Fable 5.1,专为复杂知识工作优化,比前代更简洁原文稍后读已读值得跟进有用关注 Claude
07:43IT之家(博客/媒体)73°OpenAI宣布将推出首个达到'关键'网络安全能力门槛的模型Astra。该模型能无需人类干预,在多个安全系统中识别并开发零日漏洞利用程序。OpenAI将采取分级开放策略,仅向小批测试人员开放高级网络安全任务,并通过Daybreak Blue计划向更广泛用户开放防御性用途。此次发布吸取了Hugging Face事件教训,强化了安全护栏。AI模型OpenAIAstra网络安全10 个信源在谈事件专题推荐理由:OpenAI的Astra模型能自主发现零日漏洞,但为防滥用将限制其网络安全功能,只开放给防御性用途。原文稍后读已读值得跟进有用关注 OpenAI
06:48Claude@claudeaiClaude模型在Terminal-Bench-Science 0.1测试中得分为52.6%,是Fable 5的两倍多。在Terminal-Bench 4.0测试中,Claude得分为55.8%,而Fable 5为42.0%。这些成绩表明Claude在科学任务和综合能力方面表现优异。AI模型ClaudeFable 5Terminal-Bench-Science6 个信源在谈事件专题推荐理由:Claude在两项重要基准测试中大幅领先Fable 5,科学任务得分翻倍,综合能力提升13.8%。原文稍后读已读值得跟进有用关注 Claude
06:48Claude@claudeaiFable 5.1的缓存读取成本比Fable 5降低了75%。这一改进使模型在实际应用中的成本减少了约25%,对于高度智能化的工作负载最多可降低45%。Fable 5.1通过优化缓存机制显著提升了成本效益。AI模型FableFable 5.1Claude推荐理由:Claude发布了Fable 5.1,缓存读取成本大降75%,实际使用成本最高省45%。原文稍后读已读值得跟进有用关注 Fable
06:33IT之家(博客/媒体)78°Anthropic 推出 Claude Fable 5.1 和 Mythos 5.1 模型,前者面向所有用户,后者仅限特定机构。Fable 5.1 在 Terminal-Bench-Science 0.1 基准测试中得分为 52.6%,超越前代 Fable 5 的 24.7%。缓存读取费用下调 75%,降至每百万词元 0.25 美元。Mythos 5.1 在蛋白质设计领域结合亲和力比最佳参赛作品高出 10 倍。AI模型Claude Fable 5.1Claude Mythos 5.1Anthropic10 个信源在谈事件专题推荐理由:Anthropic 发布两款新模型,编程和科学能力大幅提升,价格更实惠,安全防护也增强了。原文稍后读已读值得跟进有用关注 Claude Fable 5.1
06:08Augment Code@augmentcodeClaude Fable 5.1 已在模型选择器中可用。该模型延续了 Fable 5 的应用场景,专注于需要深度推理的超长多步骤任务。新版本正逐步提升模型独立完成任务的能力,用户可在 Cosmos 平台体验。AI模型Claude FableFable 5.1深度推理推荐理由:Claude Fable 5.1 上线,专注深度推理任务,能独立完成复杂工作流,比前版本更强大。原文稍后读已读值得跟进有用关注 Claude Fable
05:33elvis@omarsar0openJiuwen是一个开源代理框架,解决了传统静态编码代理框架的局限性。该框架在SWE-bench Verified基准上达到82.6%,在Terminal-Bench 2.1上达到87.19%,领先官方排行榜最高分3.4和3.39个百分点。框架采用基于Rail的组成方式,允许开发者组装单个代理、委托子代理和群体流。运行时证据会动态重塑上下文、反馈和任务控制,同时保持模型策略固定。AI模型openJiuwen代理框架SWE-bench推荐理由:openJiuwen框架让代理能力在运行时动态调整,性能超越现有方案,开发者可自由组装代理组件。原文稍后读已读值得跟进有用关注 openJiuwen
05:13techcrunch@Tim Fernholz73°OpenAI正在准备发布其最新的关键性大语言模型Astra。该模型在计算机系统安全测试中表现出色。OpenAI已预览了为Astra发布采取的预防措施。Astra是OpenAI最新的网络安全相关大模型。AI模型OpenAIAstra大语言模型10 个信源在谈事件专题推荐理由:OpenAI要发Astra了,这模型擅长破解电脑系统,还提前展示了安全防护措施。原文稍后读已读值得跟进有用关注 OpenAI
04:38官方账号OpenAI@OpenAI (@OpenAI)73°OpenAI即将发布Astra模型,该模型在网络安全能力方面取得重大进展,在Preparedness框架下达到Critical阈值。OpenAI展示了如何评估该模型,以及其安全措施如何随能力一同提升。Astra代表了AI安全性和可访问性的重要进步。AI模型AstraOpenAI网络安全10 个信源在谈事件专题推荐理由:OpenAI要发Astra了,网络安全能力达到Critical级别,安全措施和能力同步升级。原文稍后读已读值得跟进有用关注 Astra
04:38官方一手marktechpost@Asif Razzaq73°Anthropic发布了Claude Fable 5.1和Claude Mythos 5.1两个版本模型。Fable 5.1在Terminal-Bench-Science 0.1基准测试中得分为52.6%,较Fable 5的24.7%有显著提升。新模型支持1M token上下文窗口,缓存读取成本降低75%至每百万token 0.25美元。Fable 5.1已开放API访问,而Mythos 5.1仍限制在Glasswing项目内的经过审核的组织使用。AI模型ClaudeFableMythos10 个信源在谈事件专题推荐理由:Anthropic推出Claude 5.1双版本,科学基准分翻倍,缓存成本降75%,API有重大变更原文稍后读已读值得跟进有用关注 Claude
04:29官方账号Decoder@Matthias Bastian73°Anthropic推出Claude Fable 5.1和Mythos 5.1,这是其迄今为止最强大的AI模型。Fable 5.1在Terminal-Bench-Science基准测试中的得分比前代提升一倍,智能体编码能力提高30%。长程自主运行且包含大量工具调用的场景下,成本降低最高达45%。AI模型ClaudeFable 5.1Anthropic10 个信源在谈事件专题推荐理由:Anthropic新发布的Fable 5.1模型在科学基准测试中翻倍得分,编码能力提升30%,同时成本降低45%。原文稍后读已读值得跟进有用关注 Claude
04:14官方一手OpenAI Blog(博客/媒体)OpenAI推出Astra模型,成为首个满足Preparedness Framework框架下关键网络安全能力阈值的模型。该模型具备更强的发布安全防护措施。Astra代表了OpenAI在AI安全领域的重要进展。AI模型AstraOpenAIPreparedness Framework10 个信源在谈事件专题推荐理由:OpenAI发布了满足关键安全标准的Astra模型,比之前的模型有更强的安全防护。原文稍后读已读值得跟进有用关注 Astra
04:13Claude@claudeai73°Fable 5.1 在复杂长期任务中表现出色。该模型的研究能力展示了 AI 如何推动科学进步。Fable 5.1 是 Anthropic 公司的最新模型版本。该模型在处理复杂任务方面有明显优势。AI模型FableAnthropic推理模型10 个信源在谈事件专题推荐理由:Anthropic 发布 Fable 5.1,擅长处理复杂长期任务,为科学进步提供新视角。原文稍后读已读值得跟进有用关注 Fable
04:13Mike Krieger@mikeyk73°Anthropic今日推出Claude F5.1和Claude Mythos 5.1两款新模型。Fable 5.1专注于复杂多步骤工作,在编程、知识工作和长期问题解决任务上表现优异。这两款模型被定位为全球最先进的编程和知识工作模型。AI模型ClaudeFableAnthropic10 个信源在谈事件专题推荐理由:Anthropic刚发了Fable 5.1,专门处理复杂任务,比之前的版本更强了。原文稍后读已读值得跟进有用关注 Claude
04:04Mike Krieger@mikeykClaude根据认知科学背景,自主构建了人脑交互模型。该模型追踪了当听到'请把盐递给我'时大脑的解剖学反应过程。模型完全独立运行,未使用任何外部资源。用户可在claude.ai/code/artifact/体验此模型。AI模型Claude认知科学人脑模型推荐理由:Claude能自主推理人脑解剖过程,构建交互式模型展示语言理解过程。原文稍后读已读值得跟进有用关注 Claude
04:04DeepLearning.AI@DeepLearningAI73°OpenAI展示GPT 5.6 Sol每秒处理750个token。Google发布Gemini 3.7 Flash平均每秒330个token。Nvidia推出Nemotron 3.5 Lightning并配备NeMo Switchyard动态步进路由技术。更快的吞吐量和更低的延迟可减轻开发者上下文切换负担。这些模型支持实时智能体工作流。AI模型GPT 5.6Gemini 3.7Nemotron 3.510 个信源在谈事件专题推荐理由:OpenAI、Google和Nvidia都在竞相提升AI模型推理速度,各有不同技术方案。原文稍后读已读值得跟进有用关注 GPT 5.6
03:54Claude@claudeai73°Claude Fable 5.1 今日已全面开放使用。Claude Mythos 5.1 专供网络安全专家和生命科学家使用,需通过可信访问计划获取。Anthropic 公司发布了这两个模型版本。AI模型ClaudeClaude FableClaude Mythos10 个信源在谈事件专题推荐理由:Anthropic 推出了 Claude Fable 5.1 全版本,还有针对特定领域的 Mythos 5.1 模型。原文稍后读已读值得跟进有用关注 Claude
03:47官方账号Fei-Fei Li@drfeifei73°Atlas是首个从头开始训练的多模态世界模型,能实现像素级精确相机控制的帧生成。该模型可从单张输入图像重建大型场景,通过重新构架视频模拟时空,并能从一个或多个输入图像原生输出3D空间。Atlas是目前最好的相机条件世界模型,为从视觉效果到机器人学的多种应用场景开辟可能性。AI模型AtlasWorld Labs多模态推荐理由:World Labs团队发布了Atlas,首个多模态世界模型,能从单张图重建3D场景,还能模拟时空,比现有模型更精确。原文稍后读已读值得跟进有用关注 Atlas