7月31日
11:10
11:10OpenRouter@OpenRouterAI
MiniMax 发布开源权重视频模型 Hailuo H3,已上线 OpenRouter。H3 支持文本、图像、音频和视频四种输入,并输出原生音视频。官方定位包括指令驱动编辑、文字/品牌渲染和视频到视频的动作迁移。H3 主打轻量级,可直接在 OpenRouter 上调用。
推荐理由:开源视频模型 H3 上 OpenRouter 了,能按指令改视频、渲染品牌文字,还能视频到视频迁移动作,直接调用很方便。
10:48
10:48官方一手歸藏(guizang.ai)@op7418
精选
Seedance 2.5已在超创平台开放内测,支持一次生成30秒时长的视频。当前版本最高输出分辨率为720P。其全能参考功能允许一次上传最多50张图片作为生成依据。这些参数让该模型在长视频生成和多图参考方面具备明显优势。

推荐理由:Seedance 2.5内测来了,一次能生成30秒视频,还能传50张图做参考,感兴趣就去超创试试。
03:38
03:38Hailuo AI@Hailuo_AI
JPN GIRL在X上分享了一段使用MiniMax H3模型在Hailuo_AI平台制作的视频,内容涉及角色“パン子ちゃん”。该推文获得1014次浏览,1条回复,8个点赞。MiniMax H3是MiniMax推出的视频生成模型,支持用户快速创建角色动画。
事件专题

推荐理由:看看别人用MiniMax H3做的角色视频,效果挺有趣,能直观感受这个视频生成能力的实际表现。
01:45
01:45Hailuo AI@Hailuo_AI
MiniMax H3 模型成功替换了一个真实商业广告中的产品,所有演员、摄像机移动和阴影均保持原样。该演示由用户 Abdul Shakoor 分享,展示了模型对广告场景的高度还原能力。Hailuo_AI 官方转发了这一案例,引发广泛关注。
事件专题

推荐理由:每个广告公司都应该看看 MiniMax H3 怎么把真实广告里的产品替换掉,演员和镜头完全不变,太强了。
7月30日
11:09
11:09小互@imxiaohu
Magnific 发布了 38 页的全新提示词手册,核心观点是传统关键词式提示已失效。手册提出 AI 已进入推理(Reasoning)与导演对话时代,需要用明确的专业视觉语言指挥前沿模型。该手册针对当前主流图像和视频生成模型提供实用指南。

推荐理由:Magnific 出了本 38 页的提示词手册,教你用导演思维跟 AI 对话,不再堆关键词,适合想用好前沿图像视频模型的人。
7月29日
11:35
11:35官方账号arXiv cs.LG@Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner
论文提出Parallel Decoding Distillation (PDD),一种基于轨迹的蒸馏方法,用于加速扩散模型和流匹配模型的推理。PDD兼容LTX-2.3 Text-to-Video/Audio、Wan 14B Text-to-Video和Qwen-Image Text-to-Image等预训练模型,支持4-8次函数评估。相比依赖变分分数蒸馏(VSD)和对抗损失的方法,PDD训练更简单,避免了模式坍塌,提升了生成视频的多样性。
推荐理由:这篇论文提出PDD方法,能用更少的采样步数生成高质量视频和图像,而且训练比VSD简单多了,适合搞生成加速的研究者看看。
11:10
11:10官方账号arXiv cs.AI@Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos, Saman Zadtootaghaj, Nabajeet Barman
该研究探索了视觉语言模型(VLMs)在基于agent的游戏QA管道中检测几何裁剪异常。自定义探索agent收集视觉数据,自动标注管道提供帧级标签。零样本设置下测试了Gemini、GPT、Qwen、Gemma、Llama和Ministral六种VLM及四种提示变体。Gemini-3.1-Flash在总体准确率和提示鲁棒性上表现最佳,开源模型则对提示设计敏感。当前VLMs更适合作为多阶段QA管道中的高召回候选过滤器。
推荐理由:这篇论文用六种VLM检测游戏里的几何裁剪bug,发现Gemini最稳,开源模型要看怎么问提示词。想了解VLM实际落地坑点的可以看看。
7月25日
13:11
13:11量子位@henry
Vivix推出首个实时互动模型,采用统一流式架构。单卡视频生成速度突破10000 video tokens/s。该模型打通实时多模态生成全链路,支持视频、图像、音频等模态的实时交互。相比传统非实时方案,延迟降低至毫秒级。
推荐理由:Vivix这个新模型单卡就能每秒生成上万视频token,做实时互动视频、多模态聊天特别带劲,比之前那些慢吞吞的方案强多了。
7月24日
22:07
22:07官方账号Runway ML@runwayml
Runway 在 Runway Agent 中引入 Workflows 功能,用户可以通过自然语言描述来构建、运行或编辑基于节点的工作流。该功能旨在帮助用户以规模化方式生成高质量的输出。目前可通过调用 /Workflow 技能试用。
推荐理由:Runway 出了个新玩法:用自然语言就能搭节点工作流,不用拖拽连线了,适合批量做高质量视频输出。
12:22
12:22官方账号arXiv cs.AI@Vedant Shah, Onkar Susladkar, Tushar Prakash, Kiet Nguyen, Tianjio Yu, Adheesh Juvekar, Muntasir Waheed, Ismini Lourentzou
GraphVid是一种基于图结构的图像到视频生成模型,通过交互图实现多对象精准控制。研究团队构建了GraphVid-Bench数据集,包含结构化关系标注。与Motion-I2V相比,GraphVid的FID降低39.9%,FVD降低37.6%,PSNR从9.87提升至15.98,SSIM从0.38提升至0.61。该方法使用更少训练数据和参数,在可控性和质量上均表现更优。
推荐理由:想精确控制视频里多个物体的互动?GraphVid用交互图代替画轨迹,效果比Motion-I2V好很多,FID降了40%。
00:33
00:33官方一手歸藏(guizang.ai)@op7418
81°
Black Forest Labs 发布了 Flux 3 视频生成模型,并开源了 Dev 版本。该模型支持文生视频、图生视频(作为参考或起始帧)、视频参考生成、关键帧控制、音频延长等 8 项功能。用户可申请早期访问,API 将在未来几周内开放,后续提供完整开源版本。
事件专题

推荐理由:Black Forest Labs 开源了 Flux 3,功能超全:文生视频、图生视频、关键帧控制、视频延长,还支持文字动画和智能剪辑,像开源的 Sora。
7月23日
23:57
23:57Justine Moore@venturetwins
81°
Black Forest Labs 推出 FLUX 3,一个统一多模态模型,支持图像、视频、音频和动作预测。其视频生成能力突出,单次提示即可生成最长20秒的多镜头视频,细节逼真。目前 FLUX 3 Video 已开放早期访问。该模型采用统一架构训练,可扩展至机器人动作预测。
事件专题

推荐理由:Black Forest Labs 的 FLUX 3 能用一个提示生成20秒多镜头真实视频,还可以做图像、音频和机器人预测,很值得试试。
20:22
20:22官方一手歸藏(guizang.ai)@op7418
黑森林工作室在预告中透露了新一代模型 FLUX 3。该模型支持图像、视频、音频和动作生成,是一个全模态生成模型。单条视频支持一次生成20秒。根据过往规律,该模型可能开源。
事件专题

推荐理由:黑森林工作室的 FLUX 3 预告来了,全模态还能一次生成20秒视频,可能开源,老用户该关注了。
17:55
17:55官方账号阿里云 Alibaba Cloud@alibaba_cloud
阿里云在WAIC大会期间主办了AI Video Creatorthon视频创作马拉松。首个获奖作品完全由其视频生成模型Happyhorse制作完成。该作品展现出高度一致性和丰富细节,体现了当前AI视频生成工具的能力。

推荐理由:阿里云用自家模型Happyhorse搞了个AI短片创作赛,获奖作品效果稳定细节丰富,值得看看AI视频现在能做到什么程度。
02:15
02:15HeyGen@HeyGen_Official
HeyGen 发布伴侣模式(companion mode),用户可通过该模式让AI代理提出5个视频角度,自动生成故事板并绘制草图。用户每步可审查和调整创意,只有在批准后才进入最终构建阶段。该功能通过 npx hyperframes @latest 命令启动,旨在将视频制作从“下单”变为“执导”。
推荐理由:HeyGen 的伴侣模式让你像导演一样指挥AI,而不是简单下订单。它帮你构思5个角度、画故事板,每一步都让你把关,确保视频符合你的想法。
7月22日
16:46
13:16
13:16向阳乔木@vista8
Yoroll平台创作者使用约250美元积分在2天内将《奥德赛》改编为40分钟可玩的AI故事游戏。游戏支持对话式选择,生成不同剧情走向。相比诺兰2.5亿美元电影制作成本,成本差距达100万倍。游戏包含AI生成的宏大视频画面,适合边玩边学英语。

推荐理由:Yoroll上有人只花250美元就做出了40分钟的AI版《奥德赛》游戏,视频很宏大还能选剧情,成本比诺兰电影便宜一百万倍。
7月21日
22:18
22:18LovartAI@lovart_ai
Lovart 使用 GPT 5.6 SOL 和 Kimi K3 两个模型,通过 Seedance 2.0 渲染同一段视频提示词,产出了风格迥异的两个短片。测试展示了不同模型对相同创意要求的差异化执行效果。两个模型在同一起点下的表现形成了直观对比。
事件专题

推荐理由:想知道 GPT 5.6 SOL 和 Kimi K3 在视频生成上有多大差别?同一个提示词,两个 AI 导演各拍一版,看完你就懂了。
18:19