11:01量子位@林, 方舟神秘具身团队近日发布了一系列Demo视频,展示了其自进化模型的能力。该模型能够自主学习和改进,无需人工干预。团队还公开了其技术路线,包括多模态融合和持续学习机制。这些Demo展示了模型在复杂环境中的适应能力。AI模型具身团队自进化模型多模态推荐理由:神秘具身团队放出自进化模型Demo,展示无需人工干预的自主学习能力,技术路线也公开了。原文稍后读已读值得跟进有用关注 具身团队
09:48lmarena.ai@lmarena_ai73°Wan 3.0在Image-to-Video Arena中以1481分排名第三,比Wan 2.7提升53分。Wan 3.0胜率达57%,距离第二名Gemini Omni 1.1 Flash仅差7分。该模型现已在阿里云Model Studio和Qwen Cloud上线,8月23日至9月23日可享30%折扣。AI模型Wan 3.0Alibaba_WanImage-to-Video Arena推荐理由:阿里Wan 3.0在视频生成榜单跃升至第三,性能大幅提升,现在还有优惠价。原文稍后读已读值得跟进有用关注 Wan 3.0
06:18官方账号Pika Labs@pika_labsGemini Omni 1.1 Flash现已通过Pika API Club提供,是Gemini家族的快速新成员。该模型由Google开发,定位为轻量级版本。创作者已使用它完成了从地球到月球的概念艺术创作。Pika API Club为开发者提供了接入该模型的渠道。AI产品GeminiPikaGemini Omni 1.1 Flash推荐理由:Google的Gemini Omni 1.1 Flash加入Pika API Club,比标准版更快,适合创意工作者使用。原文稍后读已读值得跟进有用关注 Gemini
06:12a16z@a16z73°World Labs联合创始人Justin Johnson介绍Atlas模型,可通过5张手机照片教会机器人在陌生环境中工作。该模型支持实时到模拟再到现实(real-to-sim-to-real)技术,用户上传照片后可生成3D重建空间。整个过程仅需5分钟,用户可通过自然语言描述任务,让智能体构建模拟环境并强化学习微调基础模型。AI产品AtlasWorld Labs多模态推荐理由:World Labs新出的Atlas能用5张手机照片教会机器人适应新环境,比传统方法快多了。原文稍后读已读值得跟进有用关注 Atlas
05:43官方一手AWS Machine Learning Blog@Frank Huang澳大利亚团队现可通过亚太(悉尼)和亚太(墨尔本)区域,使用Amazon Bedrock访问OpenAI GPT-5.6 Sol、Terra和Luna模型。该服务支持全球跨区域推理功能。文章详细介绍了如何调用这些模型、使用提示缓存、设置Codex与OpenID Connect认证,以及通过Amazon CloudWatch监控使用情况。AI产品OpenAIGPT-5.6Amazon Bedrock10 个信源在谈事件专题推荐理由:AWS在澳大利亚上线了OpenAI最新GPT-5.6模型,支持跨区域调用,还附带了完整的使用教程和监控方案。原文稍后读已读值得跟进有用关注 OpenAI
05:02elvis@omarsar0Muse Spark 1.3 今日发布,在编程和长周期任务方面取得重大改进。该版本专门针对编程能力进行了训练,是 Muse Spark 系列中编程和智能体工作能力的最大提升。新版本已在 Muse Code 和 API 中可用,性能接近前沿水平。AI产品Muse SparkMuse Code编程助手3 个信源在谈事件专题推荐理由:Muse Spark 推出 1.3 版,编程能力大幅提升,4周内迭代速度惊人。原文稍后读已读值得跟进有用关注 Muse Spark
03:38Poe@poe_platform78°Claude Fable 5.1 是 Anthropic 最强大的模型,专为复杂推理和长期智能体工作设计。该模型支持 100 万 token 上下文窗口,具备网络搜索功能,并能从低到高自适应调整思考深度。用户现可在 Poe 平台体验这一最新版本。AI产品Claude Fable 5.1AnthropicPoe10 个信源在谈事件专题推荐理由:Anthropic 发布了 Claude Fable 5.1,在 Poe 上可用,支持百万 token 上下文和自适应思考。原文稍后读已读值得跟进有用关注 Claude Fable 5.1
00:14Google Gemini App@GeminiApp73°Google今日发布Gemini 3.8 Flash模型,Pro和Ultra用户可使用。该模型针对日常话题提供可靠全面的建议,并支持文本分析和复杂编码等深度任务。Gemini 3.8 Flash在响应质量和实用性方面有所提升。AI模型GeminiGemini 3.8 FlashGoogle10 个信源在谈事件专题推荐理由:Google发布了Gemini 3.8 Flash,Pro和Ultra用户现在可以用它做文本分析和复杂编程了。原文稍后读已读值得跟进有用关注 Gemini
00:08官方账号Google AI@GoogleAI73°谷歌推出Gemini 3.8 Flash模型,专为处理复杂智能体和多步骤任务设计。该模型在推理能力方面有显著提升,不仅能编写代码还能导航复杂项目。Gemini 3.8 Flash结合原生视频理解和高级编程功能,可自主构建3D游戏、测试并修复错误。模型配备了努力控制机制,确保思考量与消耗的token成正比。AI模型GeminiGemini 3.8 Flash智能体10 个信源在谈事件专题推荐理由:谷歌新发布的Gemini 3.8 Flash能自主完成复杂项目,比前代模型推理能力更强,还支持视频理解与编程的智能体循环。原文稍后读已读值得跟进有用关注 Gemini
00:08Google AI Developers@googleaidevsGoogle 发布了 Gemini 3.8 Flash 模型,该模型专为复杂推理任务设计。研究人员使用该模型与 ThreeJS 在 Google AI Studio 中构建了交互式 3D 可视化工具。该模型能够生成硬件设备逼真的、符合物理比例的拆解视图,并自动将设备分解为可展开检查的层次结构。用户可以通过拆解滑块交互式地探索设备内部结构。AI模型Gemini 3.8 FlashThreeJSGoogleAIStudio10 个信源在谈事件专题推荐理由:Google 推出了 Gemini 3.8 Flash,能自动生成硬件设备的 3D 拆解视图,比普通模型更擅长复杂推理任务。原文稍后读已读值得跟进有用关注 Gemini 3.8 Flash
19:03爱范儿@郑廷旭李飞飞创立的 World Labs 发布了超梦系统,这是一个世界模型。该系统在多个基准测试中表现出色,能够模拟和预测物理世界的变化。超梦系统采用了最新的多模态技术,可以处理视觉、语言等多种输入数据。该系统在模拟复杂环境方面取得了显著进展。AI模型World Labs李飞飞超梦推荐理由:李飞飞团队的世界模型超梦系统来了,能模拟物理世界变化,比之前的模型更强大。原文稍后读已读值得跟进有用关注 World Labs
16:13爱范儿@莫崇宇李飞飞团队发布了全球首个多模态世界模型 Atlas。该模型仅需几张照片就能省去传统拍摄所需的数百个机位。Atlas 能够理解空间关系,为影视制作带来新可能。这一技术突破将改变内容创作方式。AI模型Atlas李飞飞多模态推荐理由:李飞飞团队新发布的 Atlas 模型,几张照片就能替代传统拍摄中的数百个机位,理解空间关系。原文稍后读已读值得跟进有用关注 Atlas
13:48官方一手marktechpost@Michal Sutter精选73°Meta Superintelligence Labs本周发布Muse Voice Transcribe模型,将语音识别、说话人分离和端点检测三个功能整合为一个自回归模型。该模型专为实时流式语音处理设计,解决了传统语音系统中多个模型交接带来的延迟和故障点问题。Muse Voice Transcribe通过单一模型完成三项任务,提高了语音处理的效率和可靠性。AI模型Muse Voice TranscribeMeta语音识别2 个信源在谈事件专题推荐理由:Meta把语音识别、说话人分离和端点检测三个模型合成了一个,延迟更低,故障点更少。原文稍后读已读值得跟进有用关注 Muse Voice Transcribe
12:13官方一手歸藏(guizang.ai)@op741878°李飞飞的World Labs发布了新世界模型Atlas,能从单张图片生成完整3D场景。Atlas支持三大任务:生成最长1分钟1440p的视频,重建3D场景效果超过专业模型,以及时空仿真。模型能将多张图像整合到共享空间上下文中,理解时间演变规律。AI模型AtlasWorld Labs李飞飞推荐理由:World Labs的Atlas能从单张图片生成3D场景,视频生成长达1分钟,效果超过专业3D重建模型。原文稍后读已读值得跟进有用关注 Atlas
10:43AI Will@FinanceYF5精选73°研究人员发布了一种从零开始预训练的多模态自回归扩散Transformer架构。该架构融合了现代大语言模型和视频模型的优势。它受益于两个领域在架构、算法和系统上的最新进展。这一统一架构能够处理多种模态的数据。AI模型多模态Transformer自回归扩散推荐理由:新发布的架构融合了语言和视频模型优势,从零开始预训练,多模态处理能力强。原文稍后读已读值得跟进有用关注 多模态
10:33AI Will@FinanceYF573°World Labs 发布了 Atlas,这是全球首个多模态世界模型。Atlas 能够以像素级精确的相机控制生成图像和视频帧。该模型可以将生成的图像重建为 3D 场景。Atlas 能够建模世界、移动相机并模拟空间与时间。AI模型AtlasWorld Labs多模态推荐理由:World Labs 推出 Atlas,首个能精确控制相机并生成 3D 内容的世界模型,比传统方法更逼真。原文稍后读已读值得跟进有用关注 Atlas
10:18官方账号阿里通义 Qwen@Alibaba_Qwen73°阿里巴巴推出Qwen3.8-Max-0902模型,参数量达2.4T,上下文窗口扩展至100万token。该模型在Code & Cowork数据上进行额外训练,在复杂企业任务、科研和长流程工作流中表现更强。QwenCloud API现已上线,输入每百万token收费2美元,输出收费6美元。AI模型Qwen3.8-Max-0902Qwen阿里巴巴推荐理由:阿里升级了Qwen3.8-Max到0902版本,参数量和上下文都大幅提升,企业级任务表现更强,价格也公布了。原文稍后读已读值得跟进有用关注 Qwen3.8-Max-0902
10:15官方账号arXiv cs.LG@Haoyuan Deng, Haichao Liu, Wenkai Guo, Yuan Ling, Zaijia Yang, Yuanjiang Xue, Haosheng Sun, Liangzi Wang, Ziwei Wang精选73°Facet-0 是一个新的机器人基础模型,专为亚毫米级精密装配任务设计。该模型在 ManuFacet-1K 数据集上训练,包含 1000 小时的同步力数据。在五个亚毫米级计算机装配任务中,Facet-0 达到 82% 的平均成功率,而最强基线模型仅为 15%。系统实现了 0.5 毫米的放置精度和 50 毫秒的命令延迟。AI模型Facet-0机器人精密装配推荐理由:Facet-0 模型通过预测和评估接触后果,让机器人能完成高精度装配,成功率比最强基线高出 5 倍多。原文稍后读已读值得跟进有用关注 Facet-0
09:58IT之家(博客/媒体)78°World Labs发布了全球首个多模态世界模型Atlas,支持像素级精确的相机控制。Atlas能从一张或多张输入图像生成最长1分钟的1440p视频,并重建真实场景。该模型在空间重建任务上优于顶级开源重建模型,支持文本生成图像和360度全景。AI模型World LabsAtlas李飞飞推荐理由:李飞飞团队推出Atlas,能精确控制镜头生成视频和3D重建,比开源模型更强。原文稍后读已读值得跟进有用关注 World Labs
08:29shao__meng@shao__meng73°Anthropic同时发布Claude Fable 5.1和Mythos 5.1两个模型。Fable 5.1是通用旗舰模型,主打编程与知识工作,已全量开放。Mythos 5.1是垂直领域模型,面向网络防御者和生命科学研究者,仅通过可信访问计划提供。Fable 5.1在Terminal-Bench-Science 0.1基准测试中从26%提升至52.6%,在Terminal-Bench 4.0中从42.0%提升至55.8%。AI模型ClaudeFableMythos10 个信源在谈事件专题推荐理由:Anthropic发布Fable 5.1和Mythos 5.1,前者编程能力大幅提升且成本降低25%,后者专注网络安全和生命科学领域。原文稍后读已读值得跟进有用关注 Claude
08:28shao__meng@shao__meng73°Google为Gemini系列推出Agentic Video Understanding功能,首发于Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite版本。该技术将token消耗降低最高88%,分析成本降低最高66%,同时准确率提升最高7%。AVU技术从传统的'被动看'模式转变为'主动查'模式,模型可自主决定观看速度和内容片段。AI模型GeminiAgentic Video UnderstandingGoogle推荐理由:Google给Gemini加了个新功能,看视频更聪明还省钱,能自己决定看哪里,长视频分析成本大降。原文稍后读已读值得跟进有用关注 Gemini
08:28shao__meng@shao__meng78°Atlas 是从零预训练的多模态自回归扩散 Transformer,原生统一处理文本/图像/视频/3D。该模型引入'空间上下文'概念,将图像/深度图放置在3D空间特定位置,实现像素级相机控制和上下文世界理解。Atlas 支持相机可控生成最长1分钟1440p视频,从1到100+张图像重建3D场景,并实现时空仿真和图像生成功能。AI模型AtlasWorld Labs多模态推荐理由:World Labs 推出的 Atlas 模型能同时生成、重建和仿真世界,用几何输入而非文本控制相机,在3D重建上超越专用SOTA模型。原文稍后读已读值得跟进有用关注 Atlas
08:23官方账号Simon Willison’s Weblog(博客/媒体)精选73°Claude Fable 5.1 在 Terminal-Bench-Science 0.1 基准测试中得分为 52.6%,较 Fable 5 的 24.7% 有显著提升。该模型提供五种推理级别:低、中、高、超高和最高。在生成 SVG 鸬鹚图像任务中,最高推理级别产生了最佳结果,消耗 65,927 个输出 tokens,耗时 13 分 54 秒,成本 3.30 美元。AI模型ClaudeFable推理模型6 个信源在谈事件专题推荐理由:Anthropic 发布了 Fable 5.1,在科学基准测试中大幅领先,推理级别设置对创意输出质量影响显著。原文稍后读已读值得跟进有用关注 Claude
04:29Guillermo Rauch@rauchgFable 5.1 模型现已部署在 Vercel AI Gateway 平台。用户可通过 fx.sh 体验该模型。该版本提供多个模型供用户选择使用。AI产品FableVercelAI Gateway推荐理由:Vercel 上线了 Fable 5.1,一个多模型平台,fx.sh 即可体验原文稍后读已读值得跟进有用关注 Fable
03:47techcrunch@Russell BrandomAnthropic发布了Fable 5.1版本,降低了token成本。该版本减少了模型安全机制导致的错误限制。Fable 5.1在保持安全性的同时提高了性价比。AI产品FableAnthropic多模态10 个信源在谈事件专题推荐理由:Anthropic的Fable 5.1更便宜限制更少,比前版本更实用。原文稍后读已读值得跟进有用关注 Fable
03:47官方账号Fei-Fei Li@drfeifei73°Atlas是首个从头开始训练的多模态世界模型,能实现像素级精确相机控制的帧生成。该模型可从单张输入图像重建大型场景,通过重新构架视频模拟时空,并能从一个或多个输入图像原生输出3D空间。Atlas是目前最好的相机条件世界模型,为从视觉效果到机器人学的多种应用场景开辟可能性。AI模型AtlasWorld Labs多模态推荐理由:World Labs团队发布了Atlas,首个多模态世界模型,能从单张图重建3D场景,还能模拟时空,比现有模型更精确。原文稍后读已读值得跟进有用关注 Atlas
03:45Windsurf@windsurf_ai73°Claude Fable 5.1 现已登陆 Devin Desktop 和 Devin CLI。Fable 5.1 智能级别价格降低 54%,比 Opus 更便宜。Devin 的 Fusion harness 在 FrontierCode 基准上成本降低 47%,与 Fable 5.1 性能相当。价格调整主要源于缓存机制的改变。AI产品ClaudeFableDevin推荐理由:Devin 上线了更便宜的 Fable 5.1,价格比 Opus 还低,成本降了 47%原文稍后读已读值得跟进有用关注 Claude
03:45elvis@omarsar073°Claude推出Fable 5.1模型,在典型工作负载上降低成本约25%,在高智能体任务上降低约45%。该模型针对科学工作流程进行了优化,提高了令牌效率,在写作和文本生成方面表现更佳。Opus 5仍能满足大多数任务需求,而Fable 5.1则作为更复杂协调器和验证者。AI模型ClaudeFable 5.1Opus 53 个信源在谈事件专题推荐理由:Claude新出的Fable 5.1比Opus 5成本更低,特别适合科学工作流,是日常使用的不错选择。原文稍后读已读值得跟进有用关注 Claude
03:28Milvus@milvusioMilvus 3.0 发布 StructArray 功能,允许在单个实体内存储多个元素。每个元素可包含向量和元数据,支持视频片段、多图像产品文档等场景。新功能提供元素级搜索和 EmbeddingList 搜索,适用于 ColBERT、ColPali 和智能体记忆等应用。AI产品Milvus向量数据库多模态推荐理由:Milvus 3.0 新增 StructArray,一个实体可存多个向量,视频搜索、文档检索更精准。原文稍后读已读值得跟进有用关注 Milvus
03:21官方一手Google DeepMind: Blog(博客/媒体)Google发布Gemini新功能,支持智能体视频理解。该功能能分析视频内容并回答相关问题。Gemini在视频理解基准测试中表现优异。此功能已向部分用户开放使用。AI产品Gemini视频理解智能体推荐理由:Google给Gemini加了视频理解新功能,能看懂视频内容并回答问题,比普通视频分析更智能。原文稍后读已读值得跟进有用关注 Gemini
03:15宝玉@dotey93°Anthropic今天发布Claude Fable 5.1和Mythos 5.1,两个模型性能显著提升。Fable 5.1在Terminal-Bench-Science 0.1测试中得分52.6%,较Fable 5的24.7%翻倍。缓存读取价格降低75%,企业客户数据留存争议得到解决。Mythos 5.1在蛋白质设计上结合亲和力比行业最佳提交高10倍。AI模型ClaudeFableMythos10 个信源在谈事件专题推荐理由:Anthropic发布Fable 5.1和Mythos 5.1,科研能力翻倍,缓存成本降75%,企业数据留存问题解决。原文稍后读已读值得跟进有用关注 Claude
03:03a16z@a16zWorld Labs推出Atlas,这是首个多模态世界模型,能生成具有像素级相机控制的图像和视频帧,并在3D中重建它们。该模型能够模拟世界、移动相机并模拟时空。CEO @drfeifei强调,世界模型与语言模型有本质区别,因为3D世界遵循物理定律,具有材料结构。AI模型AtlasWorld Labs多模态推荐理由:World Labs的Atlas能模拟真实世界物理规律,不同于语言模型,支持3D重建和像素级相机控制。原文稍后读已读值得跟进有用关注 Atlas
02:24Fireworks AI@FireworksAI_HQ73°DeepSeek V4 Flash 现已在 Fireworks 平台支持原生视觉功能。该模型在服务器层和优先层均可使用。相比纯文本版本的 0731 版本,DeepSeek V4 Flash 在基准测试中表现更好。价格保持不变,输入每百万 token 0.22 美元,输出每百万 token 0.66 美元。AI产品DeepSeekFireworks视觉模型推荐理由:DeepSeek V4 Flash 在 Fireworks 上新增视觉功能,价格不变但性能提升,性价比更高。原文稍后读已读值得跟进有用关注 DeepSeek
02:18官方账号Google DeepMind@GoogleDeepMindGemini不再扫描整个文件,而是基于视频转录文本、音频和帧进行推理,动态调整帧率提取所需时刻。这一方法在10分钟指南至多小时的长时间内容中效率提升显著。Agentic视频理解功能已通过API在Google AI Studio中面向3.7 Flash、3.6 Flash和3.5 Flash-Lite模型推出,并即将在Gemini App中上线。AI产品GeminiGoogleDeepMind视频理解推荐理由:GoogleDeepMind让Gemini能同时分析视频文本、音频和画面,只提取关键帧,长视频处理效率大增。原文稍后读已读值得跟进有用关注 Gemini
17:08小互@imxiaohuReddit用户开发了一款Claude手写互动软件,支持双向手写交流。用户可在屏幕上手写笔记,Claude会以手写字体直接回复。该软件支持PDF和电子书导入,Claude能针对标记内容生成旁注并出题测验。这种沉浸式学习体验强化了记忆与理解。AI产品Claude手写互动学习软件推荐理由:Claude现在能和你手写对话了,像哈利波特日记一样,还能在书上做批注出题。原文稍后读已读值得跟进有用关注 Claude
11:28IT之家(博客/媒体)78°科大讯飞发布星火 X2.5-4B 和 X2.5-1.7B 两款端侧通用大模型,原生支持最长 100 万 Token 上下文窗口,是目前端侧模型中唯一支持该量级的产品。两款模型采用混合注意力架构,基于约 20 万亿 Token 多样化数据预训练,在 Domux 智能家居测试集上控制指令端到端执行正确率达 90.3%,平均响应时间 0.85 秒。模型支持英伟达、华为、海光及后摩等硬件平台,兼容 vLLM、SGLang、llama.cpp 等主流推理框架,可通过 Ollama、LM Studio 等工具快速部署。AI模型星火 X2.5-4B星火 X2.5-1.7B科大讯飞推荐理由:科大讯飞开源百万 Token 端侧模型,支持完整售后手册分析,可部署于机器人或边缘设备,9月7日还将发布293B版本。原文稍后读已读值得跟进有用关注 星火 X2.5-4B
10:34官方一手Pandaily@contact@pandaily.com (Pandaily)DeepSeek在Hugging Face上发布了V4-Flash-Vision-Exp,采用MIT许可证。这是V4系列首次支持图像输入的原生视觉模型。该模型扩展了DeepSeek的产品线,为多模态应用提供了新选择。AI模型DeepSeekV4-Flash-Vision-ExpHugging Face推荐理由:DeepSeek开源了首个原生视觉模型V4-Flash-Vision-Exp,支持图像输入,MIT许可证可商用。原文稍后读已读值得跟进有用关注 DeepSeek
10:11官方账号arXiv cs.AI@Yinwen Lu, Weihao Luo, Yueqi Zhong73°GarmentWeaver是一种新型框架,通过激活服装相关结构分支构建紧凑层次化目标,从草图和文本描述中推断可执行缝纫模式。该模型基于预训练视觉语言模型构建,引入了感知可行性的正则化方法。实验表明,GarmentWeaver比基线方法生成更准确、更可执行的缝纫模式,同时获得更好的模拟结果。论文GarmentWeaver多模态服装设计推荐理由:GarmentWeaver能从草图和文本生成可执行缝纫模式,比现有方法更准确且兼容性好。原文稍后读已读值得跟进有用关注 GarmentWeaver
09:33shao__meng@shao__meng精选Grok Bot 团队展示了如何用 5 个专业 bot 组建 AI 工程团队,每个 bot 负责特定领域如移动端、基础设施等。该系统每 30 分钟巡检 Notion 任务看板,自动处理 Bug、安全告警和 CI 失败,可同时管理 200+ cloud agent。团队还设置了名为 Jenny 的运营 bot,负责每日沟通和错误根因分析。技巧Grok BotAI 工程师团队智能体2 个信源在谈事件专题推荐理由:Grok Bot 团队分享如何用 5 个专业 bot 组建 AI 工程团队,能同时管理 200+ cloud agent,还包含夜间审计等进阶玩法。原文稍后读已读值得跟进有用关注 Grok Bot
09:19官方账号arXiv cs.LG@Hei Ting, Chan, Chenwei Wu, Xueshen Liu, Boyuan Zheng, Liyue Shen, Jiasi Chen, Z. Morley Mao精选MedCache是一种混合框架,构建时效性患者记忆,将证据组织为重叠专科视图,将查询路由到相关记忆,并自适应调用一个或多个专科医生。该框架在多访问、多专科患者记录基准上表现优异,显著提升推理准确性和记忆效率。研究显示时间有效性比保留更多历史更重要,专科分解记忆可减少上下文但可能隐藏共享证据。MedCache在强单智能体和多智能体基线上表现更好,并能跨模型骨干和数据集泛化。论文MedCache临床智能体多模态推荐理由:MedCache解决了临床智能体如何处理跨时间、跨专科患者记录的难题,比传统方法更准确高效。原文稍后读已读值得跟进有用关注 MedCache