mllms·concept

MLLMs

别名
首次出现
2026-05-22
最近出现
2026-09-01
累计提及
100
§ 01综述

markdown

MLLMs 是指多模态大型语言模型,这类技术结合了自然语言处理与大模型能力,在处理多类型数据时展现出独特优势。目前该领域处于快速发展阶段,众多学术机构和研究团队正投入资源推进相关技术突破。

MLLMs 近期进展

多图像物体幻觉基准MIOH发布:最新发布的MIOH为多图像物体幻觉提供了标准化基准,推动MLLMs在图像理解与生成方向的技术迭代。 A Visual Dependence-Aware Framework for MU-CPT:该框架优化了多模态大模型的依赖机制,提升了MLLMs在不同场景下的适应性与稳定性。 SciMIF:理解科学领域的多模态指令遵循:针对科学领域设计的SciMIF拓展了MLLMs的应用边界,使其能更高效处理专业领域多模态信息。

当前焦点与观察点

当前MLLMs发展呈现出多元化趋势,不同研究方向聚焦于提升模型的多模态融合效率与任务适应性。从技术层面看,各研究团队通过创新架构设计,逐步解决多模态数据间的协同问题;同时,行业对MLLMs在实际场景应用的能力验证也在同步推进,为后续商业化落地奠定基础。
§ 02相关报道10 条在档
  1. 01
    多图像物体幻觉基准MIOH发布
    arXiv cs.AI
  2. 02
    A Visual Dependence-Aware Framework for MU-CPT
    arXiv cs.AI
  3. 03
    SciMIF:理解科学领域的多模态指令遵循
    arXiv cs.LG
  4. 04
    Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models
    arXiv cs.AI
  5. 05
    MMCS:多模态代码切换实现对象级对齐的新预训练范式
    arXiv cs.LG
  6. 06
    多模态空间推理的视觉信用审计
    arXiv cs.AI
  7. 07
    TriViewBench:多视图结构推理的受控复杂度基准
    arXiv cs.AI
  8. 08
    AIR:多模态大模型的自适应交错推理与代码
    arXiv: OpenAI
  9. 09
    多角色人格动态切换:视觉语言模型的行为建模研究
    arXiv cs.AI
  10. 10
    ProtoAda:原型引导自适应适配器扩展与几何整合,用于多模态持续指令微调
    arXiv cs.LG
§ 03邻近话题

本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

/topic/MLLMs