6月17日
6月16日
17:30
17:30官方账号腾讯混元 Tencent Hunyuan@TencentCloud
精选
腾讯云推出AI驱动的全球体育流媒体解决方案,支持4K优化和亚秒级延迟直播。该方案提供20+语言的AI实时解说和自动集锦生成,降低制作成本。全球部署3200+节点,200 Tbps带宽覆盖70+地区,实现全天候无人值守检测和SSAI精准广告货币化。

推荐理由:腾讯云这个体育流媒体方案挺强的,4K画质亚秒延迟,还能自动用20种语言解说比赛,全球覆盖也广,搞直播的可以看看。
16:34
16:34AI Will@FinanceYF5
83°
NVIDIA 发布了 SANA-Streaming 模型,支持对长达一分钟的视频进行实时编辑。用户可以在视频播放过程中更改服装、背景、风格和场景。该模型无需等待渲染,即可直接看到修改结果。
事件专题

推荐理由:NVIDIA 出了 SANA-Streaming,放视频时就能实时换衣服换背景,一分钟的长视频也能改
6月15日
17:51
17:51官方账号阿里云 Alibaba Cloud@alibaba_cloud
阿里云使用其Qwen和Wan模型创作了一支展示阿联酋文化的AI视频。视频融合了沙漠、阿拉伯书法、传统待客之道和迪拜现代天际线。Qwen是阿里云的大语言模型,Wan是视频生成模型。该视频通过Model Studio平台生成,体现AI连接传统与创新的能力。

推荐理由:阿里云用自家Qwen和Wan生成了一支阿联酋风情视频,把沙漠、书法和摩天楼全串起来了,展示AI视频创作能力。
17:50
17:50官方账号阿里云 Alibaba Cloud@alibaba_cloud
阿里云使用其Qwen和Wan模型创作了一段AI视频,重新演绎墨西哥文化。视频融合了mariachi音乐和Zapotec编织图案等元素。从古老圣地到现代创新中心,展示了AI连接过去与未来的能力。该创作可通过阿里云Model Studio平台体验。

推荐理由:阿里云用Qwen和Wan模型做了一个墨西哥文化AI视频,画面很有创意,展示了模型在艺术创作上的能力。
6月12日
09:25
09:25官方账号arXiv cs.AI@Jiwen Liu, Shujuan Li, Zhixue Fang, Xiaohan Li, Yan Zhou, Zijie Meng, Zhimin Zhang, Yawen Luo, Guoxin Zhang, Yu-Shen Liu, Pengfei Wan
OmniDirector 提出了一种通用相机运动表示方法,将相机参数编码为网格运动视频,从而支持多镜头视频生成。该框架在百万级相机网格-视频对上训练,能够协调角色、动作和相机,提供导演级别的控制。它设计了一种分层提示扩展代理,通过理解信号关系系统描述相机运动和视觉内容,实现不同控制信号的和谐集成。实验表明,OmniDirector 在复杂相机运动克隆任务上表现优异,解决了现有方法依赖配对数据且性能不佳的问题。
推荐理由:做视频生成和相机运动控制的团队终于有了一个无需配对数据就能克隆多镜头相机运动的方案——OmniDirector 用网格运动视频统一了相机表示,直接在百万级数据上训练,效果比依赖合成配对数据的方法好很多,做视频编辑和影视制作的开发者值得关注。
6月10日
6月9日
13:11
13:11官方账号arXiv cs.LG@Wayne King, Zeyue Xue, Yuxuan Bian, Jie Huang, Haoran Li, Yaowei Li, Yaofeng Su, Yuming Li, Haoyu Wang, Shiyi Zhang, Songchun Zhang, Yuwei Niu, Sihan Xu, Junhao Zhuang, Haoyang Huang, Nan Duan
Echo-Memory 是一项针对动作条件世界模型中记忆机制的受控研究。这类模型根据首帧、文本提示和相机动作序列生成多段视频,但其主要失败点往往是记忆而非局部图像合成:当相机离开再返回时,场景或关键物体可能悄然改变。现有记忆设计难以比较,因为增益与骨干网络、训练、检索和评估差异纠缠不清。Echo-Memory 固定了动作到视频的接口,仅改变历史信息的存储和读取方式,在共享的视频扩散骨干、优化器、相机动作表示、采样器和评估流程下,比较了原始上下文、基于压缩的记忆、不同读取路径的空间摘要以及状态空间循环。研究通过三分支协议(回放质量、域内循环重访和开放域返回探测)评估记忆,发现回放保真度不足以作为记住世界的代理指标。主要结论包括:原始上下文是强大的容量基线,能显著提升开放域返回性能;紧凑性不能替代容量;块状状态空间循环是最强的开放域返回机制。
推荐理由:做视频生成或世界模型研究的团队,这篇论文帮你拆解了记忆机制中容量、压缩、读取和循环四个关键维度,看完能直接指导你的模型设计。
6月6日
6月5日
6月4日
16:30
6月3日
16:11
16:11IT之家博客/媒体
字节跳动火山引擎的 MaaS 业务营收目标在 2026 年已上调至 150 亿元,是 2025 年实际营收的 10 倍。其中,视频生成模型 Seedance 2.0 单月营收已超过 10 亿元,且仍在增长,而该模型 API 尚未在海外全量上线。Seedance 2.0 在多项指标上超越海外顶尖视频模型,字节还计划发布质量提升 20% 的 2.1 版本。这一数据表明,字节在 AI 视频生成领域的商业化能力正在快速释放。
事件专题

推荐理由:视频生成模型商业化迎来里程碑——Seedance 2.0 单月营收超 10 亿,说明 AI 视频 API 已从概念走向真金白银。做视频生成、内容创作或云服务的团队值得关注,字节的定价和增长策略可能成为行业风向标。
6月2日