#多模态
亚马逊把 Alexa+ 升级成能帮你订餐叫车买菜的智能管家,还能看图和写东西,和第三方服务直接打通,比以前的语音助手强多了。
阿里云把数据库升级成专门给智能体用的Agentic Database,用多模态记忆和全链路监控,让AI跑得更稳更高效。
想用强化学习训练自己的 Claude Code 智能体?OpenForgeRL 让你在真实 harness 和环境中端到端训练,ClawEval 和 GUI 基准上表现不错,而且开源可用。
这篇论文搞了个VLM-IE3D,让普通视觉语言模型看RGB视频就能学会3D空间感,不用额外3D设备,而且好几个3D任务都做得更好。
想提升音频模型的逻辑推理?这个框架用文本教师蒸馏,在MMSU等基准上效果拔群,比纯音频训练强很多。
Black Forest Labs的Flux 3能生成带声音的视频,最长20秒,性能还略超Seedance 2.0,他们想搞世界模型,值得关注。
有人把Kimi的视觉编码器接到GLM 5.2上,开源了量化权重,让GLM 5.2能看图片了。这种插件式玩法很实用。
Black Forest Labs 开源了 Flux 3,能文生视频、图生视频、视频延长和智能剪辑,功能很全面,还支持多语言和多种视觉风格,值得试试。
做语义分割的可以看看 ConD,训练完一个模型就能同时应付缺 RGB 或缺深度的情况,还能保持全模态精度。简单有效,代码也快开源了。
Poe 上了 Google 最新的 Gemini 3.6 Flash,编码和多模态更强,还有超快且省钱的 Flash-Lite 适合批量任务。
阿里Qwen新能力Rich Content,一张图能嵌套VSCode、Qwen Chat等四层界面,像套娃一样,考验模型对复杂布局的理解。
这篇论文搞了个Appearance Pointers,能让DiT模型精确指定图片不同区域该长什么样,不用重训模型,效果还比那些专门的方法好。
通义新模型Qwen-Image-3.0来了,能一次性画九张信息图甚至整版报纸,支持12国语言和100多种艺术风格,指令上限4.5k token,复杂需求一次搞定。
看看新版 Gemini 在文档理解上表现如何:3.6 Flash 图表降了,3.5 Flash Lite 布局好但表格差,整体视觉变化不大值你关注。
Google新模型Gemini 3.6 Flash来了,编码和多模态更强,还省token,比3.5 Flash少17%输出。
Vercel 把两个新 Gemini 模型加到 AI Gateway 了,开发者可以直接用,省去自己配环境的麻烦,想试试的可以走起。