10:43AI Will@FinanceYF5精选73°研究人员发布了一种从零开始预训练的多模态自回归扩散Transformer架构。该架构融合了现代大语言模型和视频模型的优势。它受益于两个领域在架构、算法和系统上的最新进展。这一统一架构能够处理多种模态的数据。AI模型多模态Transformer自回归扩散推荐理由:新发布的架构融合了语言和视频模型优势,从零开始预训练,多模态处理能力强。原文稍后读已读值得跟进有用关注 多模态
09:47官方账号arXiv cs.AI@Yiwen Chen, Guosheng Lin, Chi Zhang精选Code World Model框架结合语言模型的推理和编码能力与视频模型的生成先验,通过编码代理作为世界大脑,推理事件及其后果并生成可执行代码以维持持久的世界状态和执行规则一致的进化。通过代理表示将可执行状态与视觉生成连接,并开发数据管道从游戏和现实世界视频构建对齐的代理观察对。MiniMax-H3在编码代理构建的简单交互式世界中遵循基于代理的时空规范,同时保留丰富的视觉细节和动态。这些结果表明,结合代码进行持久世界进化的潜力与视频模型进行灵活视觉实现,为开放式世界模型提供了一条新路径。论文Code World Model世界模型语言模型1 个信源在谈事件专题推荐理由:Code World Model结合了语言模型和视频模型,通过编码代理实现世界大脑,为开放式世界模型提供新路径,值得了解。原文稍后读已读值得跟进有用关注 Code World Model
11:39官方账号Pika Labs@pika_labsWAN 3.0和Seedance 2.5视频模型在模拟UGC方面表现出色,如意外猫咪闯入等场景。WAN 3.0提供20个参考,增强视觉和音频真实感,30秒生成。Pika API Club上比竞争对手便宜最多35%AI模型视频生成智能体MCP/工具推荐理由:Pika Labs发布了WAN 3.0和Seedance 2.5,这些视频模型在模拟UGC方面表现出色,生成效果令人印象深刻,且价格实惠,是视频制作者的好选择。原文稍后读已读值得跟进有用关注 视频生成
15:53小互@imxiaohuMiniMax推出面向商业视频的AI Agent客户端MiniMax Design,配合H3模型,实现策划、分镜、生成、剪辑全流程;内置专属模板,自动理解意图;H3模型开源,API价格低至0.4元/秒。AI产品MiniMax DesignAI Agent视频创作1 个信源在谈事件专题推荐理由:MiniMax新出的设计工具,用AI Agent就能完成视频全流程,比其他工具便宜多了!原文稍后读已读值得跟进有用关注 MiniMax Design
13:46AI Will@FinanceYF5精选李飞飞和 World Labs 团队指出,当前被统称为「世界模型」的技术实际上包含三种截然不同的方向:视频模型、游戏生成和物理引擎。它们虽然共享同一名称,但在目标、方法和应用上差异巨大。视频模型侧重预测像素序列,游戏生成关注交互式环境构建,物理引擎则强调真实物理规律模拟。这一澄清有助于避免概念混淆,推动各方向更精准的研究与落地。AI模型世界模型视频模型游戏生成推荐理由:做 AI 研究或产品的人经常被「世界模型」这个词搞混——李飞飞帮你拆清楚了,看完能少走弯路,建议点开。原文稍后读已读值得跟进有用关注 世界模型
10:36Ate-a-Pi@svpinoHiggsfield MCP 现已集成到 Manus 平台,使得 Manus 智能体能够调用 Seedance 2.0、Nano Banana Pro、GPT Image 2.0 等前沿图像和视频模型。这意味着用户可以直接利用这些模型为 Meta、Instagram 等平台创建广告内容。这一集成标志着自主内容生成进入新阶段,让 AI 智能体能够独立完成从创意到投放的广告制作流程。AI产品MCP/工具智能体广告生成推荐理由:做广告投放或内容创作的团队,现在可以让 Manus 智能体直接调用顶级图像/视频模型生成广告素材,省去手动切换工具的麻烦,建议试试这个自动化工作流。原文稍后读已读值得跟进有用关注 MCP/工具
08:00官方一手歸藏(guizang.ai)@op7418谷歌最新的视频模型 Gemini Omni 已开始向部分用户推送,标志着该模型从测试阶段进入更广泛可用阶段。Gemini Omni 支持多模态输入,包括视频、图像和文本,能够进行实时视频理解和交互。这一放量意味着更多开发者可以尝试其视频分析能力,如实时场景理解、物体识别和对话式交互。对于 AI 视频应用和实时多模态交互领域,这是一个重要进展。AI产品谷歌Gemini Omni视频模型推荐理由:做视频分析和多模态应用的开发者终于可以上手测试了——Gemini Omni 的实时视频理解能力可能改变视频交互方式,建议有相关需求的团队尽早体验。原文稍后读已读值得跟进有用关注 谷歌
07:59官方一手歸藏(guizang.ai)@op741883°谷歌在 I/O 2026 前夕通过 Sundar Pichai 的推文展示了新视频模型的演示,确认该模型支持视频编辑功能。目前尚不清楚视频编辑与生成是统一模型还是分开实现。该演示引发社区关注,预示着谷歌在视频 AI 领域的新进展。更多细节将在 I/O 2026 上公布。AI产品谷歌视频模型视频编辑推荐理由:视频编辑是 AI 视频生成的关键痛点,做视频创作或 AI 应用的开发者值得关注谷歌的解法。原文稍后读已读值得跟进有用关注 谷歌
07:59爱范儿@张子豪谷歌在最新发布会上推出了 Gemini 3.5 模型、一系列 Agent 产品和视频模型,标志着其 AI 战略的重大升级。Gemini 3.5 在推理和代码生成上显著提升,Agent 产品则让 AI 能自主执行复杂任务。这场发布会展示了谷歌如何用 AI 颠覆自身传统业务,从搜索到云服务全面拥抱智能体。关键细节包括新模型的多模态能力和 Agent 的自主决策功能,对开发者和企业用户影响深远。AI产品Gemini 3.5智能体视频模型推荐理由:谷歌用 AI 重新定义自家产品,做搜索、云服务和 AI 应用的团队值得关注——Gemini 3.5 和 Agent 可能改变你依赖的工具生态,建议点开看看具体怎么落地。原文稍后读已读值得跟进有用关注 Gemini 3.5
00:17AI Will@FinanceYF5Google 发布全新视频模型 Gemini Omni,首个生成结果展示了惊人的文字连贯性。该模型在视频中保持了文字的一致性和可读性,被认为是视频领域的“Nano Banana 时刻”。这一突破可能改变视频生成和编辑的方式,尤其对内容创作者和视频制作团队意义重大。目前该模型尚未正式开放,但已引发广泛关注。AI模型Gemini视频模型文字连贯性推荐理由:做视频生成或内容创作的团队,Gemini Omni 的文字连贯性可能是你一直在等的突破,值得第一时间关注。原文稍后读已读值得跟进有用关注 Gemini