他们搞了个带记忆的 8B 多模态智能体,20 轮对话检索准确率 91.4%,比 32B 模型还快一半。代码和 demo 都开源了,值得看。
#多模态
这篇论文提的S^2AE让视觉语言模型里稀疏编码的概念更一致,比普通SAE语义对齐涨了6%,还能保持高重建质量。搞多模态可解释性的可以看看。
Meta 新出的 Muse 在 agent 任务上直追 GPT-5.5,还有 1M 上下文和主动记忆管理,跑长任务再也不怕忘事了。
字节新出的 Seedream 5.0 Pro 能一键生成复杂信息图,还能像修图一样精准编辑图像,图文匹配和质感都更强了。
Google 刚公开 Gemma 4 的技术细节,包括 31B 多模态模型和 12B 无编码器版本,还有量化训练和 MTP 新招,搞开源模型的可以看看。
NVIDIA发了个Colab友好教程,教你搭简化版Cosmos 3世界模型,用Omnimodal MoT架构实现跨模态预测,比跑全量模型省资源。
ELSA3D用一个弹性锚定机制把3D理解和生成统一了,三个任务都刷了SOTA,还省了一半算力,想做3D的可以看看这篇
Meta新出的Muse Image和Muse Video,图像生成能精准按指令做,视频还带原生音频,比之前的模型强不少。
中科院的?不是,Wiener Intelligence 这家做数据生成的公司直接把多模态模型发上了 Nature 子刊,医疗预后分析这事儿他们真干出来了。
Weina Intelligence 成了第一个发 Nature 子刊的中国数据生成公司,论文讲多模态深度学习模型做风险分层,挺有意思。
这篇论文搞了个医学VLM模型编辑的测试基准M3Bench,有1.6万多个问题,测了6个模型和4种编辑方法,发现各有各的坑,想搞懂模型编辑在医学领域行不行得通可以看。
LlamaIndex 和 LanceDB 教你怎么用 LiteParse 搞定那些排版混乱的企业 PDF,表格、图片里的信息也能准确被 agent 找到。
字节豆包 Seedance 2.5 要上线体验中心了,能生成 30 秒视频还能同时用 50 个素材编辑,实打实提升视频创作效率。
阿里云在Flink Forward上秀了Paimon 2.0,把流式湖仓升级成多模态数据底座,专为AI工作流扫清数据瓶颈,搞AI数据管线的可以关注。
一篇论文用推理模型做说话人识别,还建了个53万条对话的新基准,短话识别效果比现有方法强不少。
用真实非洲场景测了5个主流VLM,发现Gemini和Qwen在车牌识别上比YOLO+OCR更准,有数据有对比。
Arena开始让大家测Claude Fable 5了,有Battle和Agent两种模式,你还能投票影响排名,快去试试。