Runway 出了个 Scene Fixer,能把不搭的 AI 片段统一起来,只修有问题的部分,其他帧和音频都不动。
#多模态
千问开源的多模态插件集,用 MCP 把读图、看视频、3D 建模塞进任意 Agent,纯文本 Agent 直接升级,想给 Agent 加眼睛的可以试试。
医学图像分割和语言模型终于打通了,MedPixel一个模型搞定定位加问答,还自带44万样本的数据集,搞医学AI的值得看看。
这篇论文拿彩色方块网格考OpenAI的多模态模型,让它们看图写话再画图,结果画不对,做自动GIS得先解决这问题。
这篇论文搞了个新任务ICQ,让AI对着人像照片在视频里找人、看行为,还放出1377个视频测试集和75K训练集,开源模型里ISYV-Model效果最好。
这篇论文发了个叫 OmniDecVAEs 的框架,能把几十个传感器数据揉在一起,分类和生成都行,参数才 4.1M,比 Transformer 还准。
字节的Seed模型在OpenRouter上线了,一次能喂30张图加10段视频和10段音频,改视频里的东西很方便。
字节 Seedance 2.5 上线 OpenRouter,一次生成 30 秒带声音视频,支持 50 条参考做长叙事。
有人拿云朵照片同时问 Qwen3.8-Max、Claude Opus 5、Kimi K3、GPT 5.6 Sol,画动物轮廓它没输。
Qwen3.8-Max 刚出,有人测了比 Gemini 3.5 Flash 高 8.5 个点,看细节更清楚。
OpenAI 发布了用户报告,说 ChatGPT 有 10 亿人在用,现在大家更多拿它干活,35 岁以上用户涨得最快,图像功能也带动了多媒体使用。
Seedance 2.5 API 来了:30 秒视频直出、50 个素材参考,价格和限时折扣都公布了,做视频生成的可以看。
ElevenLabs 出了新的配音模型 Dubbing v2,能把原声的情感带到别的语言里,做视频本地化的话可以试着用 API 接进自己的流程。
MiniMax官方发了段H3的演示片,角色长相、声音、场景从头到尾都没跑偏,想看多模态一致性效果的可以点开看看。
豆包 App 上线了视频通话,能边看视频边提问,认人、读图表都行,延迟低,比 GPT Live 更自然,不用内测直接玩。
这篇论文把多模态预训练的内部机制拆开了,告诉你模态之间怎么互相影响、什么时候协同、什么时候拖后腿,还有省算力的训练配方,值得看看。