12:16官方账号arXiv cs.AI@Jianlyu Chen, Yuyang Hu, Hongjin Qian, Jiawei Liu, Wenqing Wei, Xiaolong Chen, Defu Lian, Zhicheng Dou, Chaozhuo Li, Qiwei Ye, Zheng Liu精选73°研究人员提出DisCo技能驱动型研究代理,能将广泛使用的ML仓库提炼为可重用技能。该代理创建了AREX-Skill Library,包含5000多个从1000个常用ML仓库中提炼的验证技能,组织成20个领域和178个能力家族。使用GPT-5.5作为骨干模型,在MLE-bench基准上得分提升134.3%,在PaperBench上提升34.4%,在FrontierCS上提升9.2%,在PassNet上提升14.0%。AI模型DisCoGPT-5.5MLE-bench推荐理由:DisCo代理把GitHub仓库变成可重用技能,在多个AI研究基准上大幅提升性能,比无技能版本表现更好。原文稍后读已读值得跟进有用关注 DisCo
10:17Tech in Asia@Aiko Gao Ishida精选Google推出Gemini 3.8 Flash和Flash Cyber两个新模型。Gemini 3.8 Flash Cyber在CWE-Bench基准测试中达到47.2%的pass@1分数。该基准测试专门用于评估软件漏洞修复能力。Flash Cyber专注于网络安全领域的应用。AI模型GeminiGemini 3.8 Flash CyberCWE-Bench推荐理由:Google新发布的Gemini 3.8 Flash Cyber在软件漏洞修复基准上取得47.2%的pass@1分数,专为网络安全场景优化。原文稍后读已读值得跟进有用关注 Gemini
10:14shao__meng@shao__meng精选73°Anthropic 开源了 Claude Commerce Agents,包含购物智能体和商家智能体。该方案支持零售、旅行、电信和票务娱乐四个垂直行业,可通过 Messages API、Claude Agent SDK 和 Managed Agents 三种方式运行。架构采用单智能体 + Skills 设计,而非多子智能体,在质量和成本延迟上表现更优。AI模型Claude Commerce AgentsAnthropic智能体10 个信源在谈事件专题推荐理由:Anthropic 开源了电商智能体方案,包含面向消费者和商家的两个智能体,采用单智能体架构,比子智能体方案更优。原文稍后读已读值得跟进有用关注 Claude Commerce Agents
08:57SuperTechFans(博客/媒体)精选73°Anthropic推出Claude Fable 5.1和Mythos 5.1,价格降低约25%。Fable 5.1面向公众,Mythos 5.1专用于网络安全和生命科学。新模型在编码、知识工作和长期推理任务上显著超越前代,并推出企业前沿安全措施(EFS)。AI模型ClaudeAnthropicFable 5.110 个信源在谈事件专题推荐理由:Anthropic新模型降价25%,Fable 5.1编码能力提升,Mythos 5.1专注网络安全,还新增企业安全功能。原文稍后读已读值得跟进有用关注 Claude
23:33IT之家(博客/媒体)精选73°谷歌在 Google DeepMind 网站上线了 Gemini 3.8 Flash 模型,基于 Gemini 3.7 Flash 开发。该模型拥有最高 1M token 上下文窗口和 64K token 文本输出能力。在编程、知识处理、多模态处理等基准测试中表现优异。模型面向个人用户、开发者和企业,适合软件工程和智能体任务场景。AI模型GeminiGemini 3.8 Flash谷歌10 个信源在谈事件专题推荐理由:谷歌新发布的 Gemini 3.8 Flash 模型,在软件工程和智能体任务方面有提升,支持自定义努力水平,适合大规模部署。原文稍后读已读值得跟进有用关注 Gemini
20:53官方账号Decoder@Jonathan Kemper精选73°World Labs由AI研究员李飞飞联合创立,推出Atlas模型。该模型仅需几张照片即可生成、重建和模拟3D场景。Atlas在3D空间中锚定所有输入,而非处理为平面序列。公司称其性能超过专业模型。Atlas还能在模拟中生成机器人训练数据。AI模型AtlasWorld LabsFei-Fei Li推荐理由:李飞飞团队出的Atlas模型,几张照片就能生成3D世界,还能做机器人训练数据,比专业模型还强。原文稍后读已读值得跟进有用关注 Atlas
18:43AI Will@FinanceYF5精选73°Ox Alpha、DeepSeek V4 Flash、MiMo和GPT-5.6 Luna共同推动市场增长。这四款模型在近期表现突出,获得了市场关注。数据显示这些模型在各自领域展现出强劲竞争力。AI模型Ox AlphaDeepSeek V4 FlashMiMo2 个信源在谈事件专题推荐理由:看看这四款模型Ox Alpha、DeepSeek V4 Flash、MiMo和GPT-5.6 Luna如何推动市场增长原文稍后读已读值得跟进有用关注 Ox Alpha
16:29官方一手pandaily@contact@pandaily.com (Pandaily)精选73°科大讯飞全资子公司发布并开源了Spark X2.5-4B和X2.5-1.7B模型。这两款模型原生支持高达100万token的上下文长度。它们是首批支持如此长上下文的边缘模型。这些模型专为设备端AI设计。AI模型SparkX2.5-4BX2.5-1.7B推荐理由:科大讯飞开源了百万token上下文的边缘模型,比普通模型能处理更长文本,适合设备端部署。原文稍后读已读值得跟进有用关注 Spark
13:48官方一手marktechpost@Michal Sutter精选73°Meta Superintelligence Labs本周发布Muse Voice Transcribe模型,将语音识别、说话人分离和端点检测三个功能整合为一个自回归模型。该模型专为实时流式语音处理设计,解决了传统语音系统中多个模型交接带来的延迟和故障点问题。Muse Voice Transcribe通过单一模型完成三项任务,提高了语音处理的效率和可靠性。AI模型Muse Voice TranscribeMeta语音识别2 个信源在谈事件专题推荐理由:Meta把语音识别、说话人分离和端点检测三个模型合成了一个,延迟更低,故障点更少。原文稍后读已读值得跟进有用关注 Muse Voice Transcribe
11:53官方账号阿里通义 Qwen@Alibaba_Qwen精选73°Qwen3.8-Max-0902在Code Arena WebDev基准测试中以1691分获得第一名。该模型以每百万代币5美元的价格成为帕累托前沿最高分模型。在更新后的前沿排名中,Qwen3.8-Max-0902领先于HY4 Preview和Qwen3.8-Flash-Next。AI模型Qwen3.8-Max-0902Code ArenaAlibaba_Qwen推荐理由:阿里发布Qwen3.8-Max-0902,在编程评测中夺冠,性价比超越对手。原文稍后读已读值得跟进有用关注 Qwen3.8-Max-0902
11:08lmarena.ai@lmarena_ai精选73°Qwen3.8-Max-0902在Code Arena: WebDev基准测试中以1691分获得第一名。该模型在帕累托前沿上以每百万token 5美元的价格成为最高分模型。它超越了HY4 Preview(1629分,每百万token 2.08美元)和Qwen3.8-Flash-Next(1620分,每百万token 0.39美元)。AI模型Qwen3.8-Max-0902Alibaba_QwenCode Arena推荐理由:阿里Qwen新模型Qwen3.8-Max-0902在代码评测中登顶,性价比超高。原文稍后读已读值得跟进有用关注 Qwen3.8-Max-0902
10:49官方一手arXiv: DeepSeek@Haoyang Yan, Min-le Su, Hangfan Zhang, Zhanhao Li, Chen Zhang, Shao Zhang, Yang Chen, Lei Bai, Shuyue Hu精选73°Harness-of-Harness(HoH)框架使基于LLM的编码代理能够在自主开发过程中持续改进软件。该框架在GameCraft-Bench、FrontierSWE和ProgramBench三个基准测试中,使用Codex与GPT-5.5、OpenCode与DeepSeek-V4-Pro、Pi与MiniMax-M3三对模型组合,平均相对提升52.25%,最高提升82.86%。在70多次迭代的多日部署中,HoH自主开发了一款具有连贯故事线、完整核心机制、可玩体验、精美视觉效果和集成音频的第一人称射击游戏。AI模型Harness-of-HarnessGPT-5.5DeepSeek-V4-Pro推荐理由:HoH框架让AI编码代理能持续改进软件,在三个基准测试中平均提升52%,还能自主开发完整游戏。原文稍后读已读值得跟进有用关注 Harness-of-Harness
10:46官方账号arXiv cs.AI@Danze Chen, Zeqing Wang, Ziyue Lin, Xingyi Yang, Yeying Jin精选73°研究人员提出H3-World框架,将33B参数的MiniMax-H3视频生成器转化为交互式世界模型。该框架通过结构化组合角色和相机指令,实现精确的时间控制,无需专用动作模块。仅需8000个游戏样本和10000步LoRA优化,H3-World在保持高质量生成的同时实现了有效控制。AI模型H3-WorldMiniMax-H3视频生成1 个信源在谈事件专题推荐理由:MiniMax团队发布H3-World,让33B视频模型通过语言精确控制角色和相机,训练成本低效果好。原文稍后读已读值得跟进有用关注 H3-World
10:43AI Will@FinanceYF5精选73°研究人员发布了一种从零开始预训练的多模态自回归扩散Transformer架构。该架构融合了现代大语言模型和视频模型的优势。它受益于两个领域在架构、算法和系统上的最新进展。这一统一架构能够处理多种模态的数据。AI模型多模态Transformer自回归扩散推荐理由:新发布的架构融合了语言和视频模型优势,从零开始预训练,多模态处理能力强。原文稍后读已读值得跟进有用关注 多模态
10:15官方账号arXiv cs.LG@Haoyuan Deng, Haichao Liu, Wenkai Guo, Yuan Ling, Zaijia Yang, Yuanjiang Xue, Haosheng Sun, Liangzi Wang, Ziwei Wang精选73°Facet-0 是一个新的机器人基础模型,专为亚毫米级精密装配任务设计。该模型在 ManuFacet-1K 数据集上训练,包含 1000 小时的同步力数据。在五个亚毫米级计算机装配任务中,Facet-0 达到 82% 的平均成功率,而最强基线模型仅为 15%。系统实现了 0.5 毫米的放置精度和 50 毫秒的命令延迟。AI模型Facet-0机器人精密装配推荐理由:Facet-0 模型通过预测和评估接触后果,让机器人能完成高精度装配,成功率比最强基线高出 5 倍多。原文稍后读已读值得跟进有用关注 Facet-0
09:36官方账号arXiv cs.AI@Nikita Oblakov, Sabrina Sadiekh, Evgeniy Kokuykin精选73°HiveTraceGuard-Pro是一款0.6B参数的生成式护栏模型,基于Qwen3-0.6B通过LoRA微调而成。该模型支持俄语和英语,采用二元评分规则(安全/不安全)进行最终目标轮次判断。在包含19个基准组的测试中,HiveTraceGuard-Pro的综合得分为0.7432,在俄语提示注入召回率上达到0.999,延迟仅为14.3毫秒。AI模型HiveTraceGuard-ProQwen3-0.6B护栏模型推荐理由:俄语安全护栏新模型,在俄语提示注入检测上表现优异,延迟最低,开源权重已发布。原文稍后读已读值得跟进有用关注 HiveTraceGuard-Pro
08:53官方账号Simon Willison@simonw精选73°Anthropic发布了Claude Fable 5.1模型,最高思维级别可生成高质量SVG图像。用户使用该模型创建了一只SVG pelican图像,成本为3.30美元。该模型还支持将生成的图像动画化。Claude Fable 5.1在图像生成方面表现优于此前Anthropic模型。AI模型Claude Fable 5.1AnthropicSVG10 个信源在谈事件专题推荐理由:Anthropic新出的Claude F5.1花3.3美元能生成超棒的SVG海鸥,还能直接变动画,比之前的模型强多了。原文稍后读已读值得跟进有用关注 Claude Fable 5.1
08:23官方账号Simon Willison’s Weblog(博客/媒体)精选73°Claude Fable 5.1 在 Terminal-Bench-Science 0.1 基准测试中得分为 52.6%,较 Fable 5 的 24.7% 有显著提升。该模型提供五种推理级别:低、中、高、超高和最高。在生成 SVG 鸬鹚图像任务中,最高推理级别产生了最佳结果,消耗 65,927 个输出 tokens,耗时 13 分 54 秒,成本 3.30 美元。AI模型ClaudeFable推理模型6 个信源在谈事件专题推荐理由:Anthropic 发布了 Fable 5.1,在科学基准测试中大幅领先,推理级别设置对创意输出质量影响显著。原文稍后读已读值得跟进有用关注 Claude
08:13Notion@NotionHQ精选73°Claude Fable 5.1现已面向Custom Agents可用。该版本相比Fable 5全面升级,特别优化了复杂知识工作场景。新版本的计划和摘要生成更加简洁。AI模型ClaudeFableCustom Agents推荐理由:Anthropic发布了Claude Fable 5.1,专为复杂知识工作优化,比前代更简洁原文稍后读已读值得跟进有用关注 Claude
01:58Google AI Developers@googleaidevs精选Google发布Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite模型,新增智能体视频理解功能。用户可通过Gemini API上传视频或分析YouTube内容。该功能已在Google AI Studio和Gemini Enterprise Agent Platform上线。AI模型GeminiGemini 3.7 Flash智能体推荐理由:Google让Gemini系列模型看懂视频了,API直接调用,比之前强不少。原文稍后读已读值得跟进有用关注 Gemini
00:58官方账号xAI@xai精选LatchBio评估了Grok 4.6在生物安全监控和对抗性生物任务中的表现。该模型能够正确检测并拒绝危险查询,包括恶意模糊的生物任务。同时,Grok 4.6允许回答有益的科学查询。这些结果在LatchBio的博客文章中进行了详细讨论。AI模型GrokGrok 4.6生物安全推荐理由:LatchBio测试了Grok 4.6的生物安全能力,它能拒绝危险查询同时允许科学查询。原文稍后读已读值得跟进有用关注 Grok
00:34elvis@omarsar0精选73°Shopify ML团队训练的0.8B模型在特定任务上击败了GPT-5.6-sol xhigh。小型专用模型在特殊场景下表现出色。拥有自己的智能堆栈对未来公司保持竞争力至关重要。Tobi Lutke强调了小型模型在特定用例中的有效性。AI模型ShopifyGPT-5.60.8B模型推荐理由:Shopify用0.8B模型干翻GPT-5.6,小模型专用场景真香原文稍后读已读值得跟进有用关注 Shopify
23:58官方一手marktechpost@Asif Razzaq精选73°AQuA是由普林斯顿、蚂蚁集团和斯坦福研究人员开发的双部分智能体框架。该框架专注于量化金融中的自主因子发现和模型开发。研究解决了量化研究代理在实验中可能污染证据的问题。AQuA通过分离作者和审查者角色来避免共享盲点。AI模型AQuA量化金融因子发现推荐理由:蚂蚁集团等机构推出AQuA框架,解决量化金融模型开发中的数据污染问题。原文稍后读已读值得跟进有用关注 AQuA
23:15官方一手歸藏(guizang.ai)@op7418精选Runway发布了Solaris模型,号称首个界面世界模型。该模型能逐帧实时生成交互界面,支持用户点击和拖动操作。用户可以拖动改变物体大小和位置,点击弹出UI选项变换样式。目前仍面临延迟、成本和一致性问题。AI模型RunwaySolaris界面世界模型推荐理由:Runway的Solaris模型能实时生成可交互的界面视频,拖动树木、壁画等元素会实时变化,开创了视频模型新应用。原文稍后读已读值得跟进有用关注 Runway
19:18Hunyuan@TXhunyuan精选腾讯混元Hy4预览版模型参数达770B,活跃参数49B,支持1M上下文长度。该模型通过算子融合和通信优化,自行发现推理瓶颈,将端到端吞吐量提升31.8%。性能在不同上下文长度和并发场景下保持稳定。模型面向生产力场景,采用一致且亲民的定价策略。AI模型Hy4Tencent混元推荐理由:腾讯发布了Hy4预览版,770B参数模型能自发现推理瓶颈并提升31.8%吞吐量,1M上下文还开源。原文稍后读已读值得跟进有用关注 Hy4
15:48IT之家(博客/媒体)精选73°谷歌推出TimesFM-3模型,拥有3.3亿参数,在超1万亿时间点数据上预训练。该模型支持零样本多变量时间序列预测,采用双注意力机制和连续补丁掩码技术。TimesFM-3可联合预测多个相关时间序列,捕捉依赖关系,提升准确率。原生支持多目标预测、过去协变量和动态协变量三种特性。AI模型TimesFM-3谷歌时间序列预测2 个信源在谈事件专题推荐理由:谷歌发布3.3亿参数的TimesFM-3,能零样本预测多变量时间序列,无需微调即可捕捉复杂依赖关系。原文稍后读已读值得跟进有用关注 TimesFM-3
13:33IT之家(博客/媒体)精选73°智能化工大模型 3.0 Pro 由大连化物所、科大讯飞和阿里云联合研发,于 8 月 31 日正式发布。该模型集成了超过 400 个化工智能体和工具,文本问答准确率达 81.96%,多模态问答准确率达 80.75%,综合得分较 3.0 版本提升 20.2% 和 31.4%。目前已有 300 余家化工企业、高校和科研院所注册使用,API 累计调用量突破 1,400 万次。AI模型智能化工大模型大连化物所科大讯飞推荐理由:大连化物所等发布智能化工大模型 3.0 Pro,从问答升级为能执行复杂任务的智能工程伙伴,准确率提升超 20%。原文稍后读已读值得跟进有用关注 智能化工大模型
13:33量子位@思邈精选清华大学AIR团队与域变换联合发布了WAM模型,实现了具身In-Context Causal Learning。该模型在参数冻结的情况下仍能持续提升能力。WAM在多个基准测试中表现出色,展现了自进化特性。这一突破为AI自主学习提供了新思路。AI模型WAM清华大学AIR域变换推荐理由:清华AIR和域变换联手搞了个WAM模型,不用改参数就能自己进化,比传统方法强多了。原文稍后读已读值得跟进有用关注 WAM
12:33IT之家(博客/媒体)精选73°腾讯混元团队发布 Hy4 preview 轻量版,将模型权重从 1.5TB 压缩至 214GB。该版本采用 Sherry 稀疏三值量化算法和 MIX-STQ1_0 混合精度策略,使模型在长文理解、多轮长上下文检索等任务上表现稳定。MCP Atlas 得分从 83.7 微降至 83.2,SWE-Bench multi 从 82.9 降至 81.3。轻量版模型已上线 Hugging Face 和 GitHub 平台,支持多种主流推理框架。AI模型混元Hy4 previewSherry推荐理由:腾讯把 1.5TB 的 Hy4 模型压缩到 214GB,还能在异构设备上联合推理,速度提升 6 倍。原文稍后读已读值得跟进有用关注 混元
12:20官方一手arXiv: DeepSeek@Rui Xiao, Yili Xu精选73°研究人员成功将1750亿参数的DeepSeek 175B模型部署在单台RTX 4060笔记本电脑上,该设备配备32GB系统内存和8GB显存。该框架完成了针对20种不同蛋白质靶点的20万规模蛋白质配体虚拟筛选工作流。在相同任务配置下,该实现比8卡A100集群基线快100倍,平均结合亲和力预测误差为0.88 kcal/mol,满足临床前药物发现的1.0 kcal/mol化学精度要求。AI模型DeepSeek 175BRTX 4060蛋白质配体虚拟筛选推荐理由:DeepSeek 175B在普通笔记本上完成20万蛋白质筛选,比A100集群快100倍,误差仅0.88,让小团队也能做药物发现。原文稍后读已读值得跟进有用关注 DeepSeek 175B
AITOP7月8日 10:58智谱AI GLM-Image:中文AI图像生成领域的破局者智谱AI最近发布的GLM-Image确实在AI图像生成领域投下了一枚重磅炸弹。免费、无水印、中文文本渲染能力强,这三个特点组合在一起,足以让整个行业重新审视中国AI技术的实际进展。 国内AI图像生成工具一直面临着中文文本渲染的难题。Midjourney等国外工具虽然在图像质量上表现优异,但对中文的支持却始终不尽如人意。GLM-Image的出现,似乎正在改变这一现状。GLM