mllm·general

MLLM

别名
首次出现
2026-05-22
最近出现
2026-09-03
累计提及
48
§ 01综述

MLLM 近期进展

MLLM(多模态大语言模型)是一种能够处理多种类型数据(如文本、图像、声音等)的机器学习模型。近期,MLLM在多个领域的应用和研究取得了显著进展。

XX 近期进展

  • VBVR-Pro:可扩展且可验证的原生视觉推理套件:该研究提出了一种可扩展且可验证的原生视觉推理套件,旨在提高视觉推理的准确性和效率。
  • ARMDIL:基于MLLM路由的异构集成图像分类:这项研究利用MLLM进行异构集成图像分类,实现了更高的分类精度。
  • 测试时自进化框架提升GUI视觉定位准确率7.4%:通过引入测试时自进化框架,该研究成功提升了GUI视觉定位的准确率。
  • 当前焦点与观察点

    § 02相关报道10 条在档
    1. 01
      文本到图像模型视觉隐喻生成基准研究
      arXiv cs.AI
    2. 02
      VBVR-Pro:可扩展且可验证的原生视觉推理套件
      arXiv cs.AI
    3. 03
      ARMDIL:基于MLLM路由的异构集成图像分类
      arXiv cs.LG
    4. 04
      测试时自进化框架提升GUI视觉定位准确率7.4%
      arXiv cs.AI
    5. 05
      MMDiff:多模态模型特征发现与控制的差分框架
      arXiv cs.AI
    6. 06
      Sci-VBench:科学领域知识密集型视频生成新基准
      arXiv cs.AI
    7. 07
      无幻觉GUI定位:回归无关的布局感知匹配框架
      arXiv cs.AI
    8. 08
      OPD-V:基于模态平衡的视觉在线自蒸馏
      arXiv cs.AI
    9. 09
      解耦语义与视觉:为视觉-文本压缩评测引入ZeroSense基准
      arXiv: DeepSeek
    10. 10
      面向细粒度遗忘:多模态大语言模型的属性级遗忘
      arXiv cs.AI
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/MLLM