9月3日
14:10
01:12
01:12OpenRouter@OpenRouterAI
Gemini 3.8 Flash新增智能体视频处理功能。用户可在视频部分设置processing参数为"agentic"。模型能自主导航时间轴,而非以固定速率采样每一帧。该功能也适用于早期Gemini Flash模型。
事件专题

推荐理由:OpenRouter宣布Gemini 3.8 Flash支持智能体视频处理,能自主导航时间轴,比固定帧采样更高效。
00:13
9月2日
18:58
10:46
10:46官方账号arXiv cs.AI@Danze Chen, Zeqing Wang, Ziyue Lin, Xingyi Yang, Yeying Jin
精选73°
研究人员提出H3-World框架,将33B参数的MiniMax-H3视频生成器转化为交互式世界模型。该框架通过结构化组合角色和相机指令,实现精确的时间控制,无需专用动作模块。仅需8000个游戏样本和10000步LoRA优化,H3-World在保持高质量生成的同时实现了有效控制。
事件专题

推荐理由:MiniMax团队发布H3-World,让33B视频模型通过语言精确控制角色和相机,训练成本低效果好。
10:34
01:58
9月1日
23:15
23:15官方一手歸藏(guizang.ai)@op7418
精选
Runway发布了Solaris模型,号称首个界面世界模型。该模型能逐帧实时生成交互界面,支持用户点击和拖动操作。用户可以拖动改变物体大小和位置,点击弹出UI选项变换样式。目前仍面临延迟、成本和一致性问题。

推荐理由:Runway的Solaris模型能实时生成可交互的界面视频,拖动树木、壁画等元素会实时变化,开创了视频模型新应用。
16:13
15:13
12:58
12:58官方账号Latent Space (swyx)博客/媒体
Fal公司发布了H3 Max Live模型,实现了实时视频生成。该模型能够以每秒24帧的速度生成视频,比观看速度更快。H3 Max Live在多个基准测试中表现出色,显著提升了视频生成效率。

推荐理由:Fal刚发布的H3 Max Live模型能实时生成视频,比观看速度还快,彻底改变了视频生成方式。
09:12
09:12官方账号arXiv cs.AI@Junxiang Liu, Lin Wang, Haiyu Shi, Hongxu Ma, Xiaoyu Yang, Chunjie Chen, Xiaoxiao Xu, Kaiqiao Zhan, Boao Wang, Shuizhou Shi, Tianyun Zhu, Jie Li, Jiangtong Li
精选73°
CineForge是自我演进的视频制作智能体框架,包含CineForge-Produce和CineForge-Evolve两个组件。该框架在CineScope-Data测试集上,CineScope-Metric评分从4.024提升至4.380。相比三种长视频基线模型,CineForge在ScriptAgent基准上实现稳定提升。在新故事生成中,CineForge减少了37.0%的审查LLM调用次数。
推荐理由:CineForge能自我改进视频制作能力,跨故事积累经验,生成更连贯的长视频故事。
00:42
00:42Google Gemini App@GeminiApp
Google为Gemini的Plus、Pro和Ultra订阅用户 globally 推出场景扩展功能。用户可在工具菜单中选择"创建视频",创建或上传视频后,告诉Gemini"扩展场景"并描述后续内容。该功能目前面向所有付费订阅者开放。
推荐理由:Google给Gemini付费用户加了场景扩展功能,能续写视频内容,比普通视频生成多了连续性创作能力。
8月31日
15:01
8月29日
21:46
21:46量子位@量子位的朋友们
英特尔推出锐炫Pro B70显卡,配备32GB大显存。该显卡专为AI漫剧创作设计,可处理从剧本到成片的完整工作流。在AI视频生成任务中,锐炫Pro B70表现优异,能够流畅运行大型AI模型。
推荐理由:英特尔锐炫Pro B70显卡有32GB大显存,专门为AI漫剧创作设计,能处理从剧本到成片的完整工作流。
17:51
17:51官方账号Decoder@Matthias Bastian
78°
LAION推出Big Video Dataset(BVD),包含800万视频和550万自动描述片段。该数据集总时长达1000万小时,模型训练后性能超越InternVid基准最高2.1个百分点。LAION可依据2024年汉堡法院裁决,为非商业研究收集版权内容。

推荐理由:LAION开源了千万小时视频数据集,训练效果比之前基准高2.1个百分点,非商业研究可合法使用。
00:16
00:12
00:12官方账号Google AI@GoogleAI
73°
Google推出Gemini 3.5 Transcribe,这是其迄今为止最精确的语音转文本模型。Gemini Omni 1.1 Flash版本带来了增强的视频生成和编辑功能。Gemini App新增Live体验,包含Daily Brief、Gemini Spark等功能,并支持Gmail收件箱管理。
事件专题

推荐理由:Google本周发布了Gemini 3.5 Transcribe语音模型和Omni 1.1 Flash,新增视频编辑和Gmail管理功能。
8月28日
23:13
22:13
22:13Philipp Schmid@_philschmid
73°
GoogleDeepMind发布了针对Gemini Omni 1.1 Flash模型的新提示指南。指南包含角色绑定、循环动画、编辑规则、时间脚本编写和场景扩展等5个技巧。时间脚本支持0-3秒、3-6秒等精确时间段的动作编排。场景扩展功能可追加10秒增量,最长可达40秒。
事件专题

推荐理由:Google刚发布了Gemini Omni 1.1 Flash的提示技巧,教你如何用标签绑定角色、编写时间脚本和扩展场景,比官方文档更实用。
21:53
21:53官方账号Decoder@Matthias Bastian
73°
Google的Gemini Omni 1.1 Flash视频模型现在能分析长达10秒的现有素材,而不仅仅是最后一秒,以实现更一致的场景延伸。场景可以以10秒为增量延长至40秒。新的360p草稿模式运行速度提高60%,成本仅为原来的三分之一。

推荐理由:Google升级了Gemini Omni 1.1 Flash视频模型,场景延伸更连贯,还推出了更快的360p草稿模式,成本降低三分之二。