vlms·general

VLMs

别名
首次出现
2026-05-22
最近出现
2026-09-02
累计提及
149
§ 01综述

VLMs(视觉语言模型)是能够同时理解和处理图像与文本信息的人工智能系统,正在成为多模态AI领域的研究热点。2024年以来,VLMs在多个专业领域展现出强大的应用潜力,同时也暴露出一些技术局限性。

VLMs 近期进展

  • 2024年7月,研究人员开发了VLM-IE3D模型,实现了隐式与显式几何融合的3D感知视觉语言模型,为三维场景理解提供了新方法。(VLM-IE3D:隐式与显式几何融合的3D感知视觉语言模型)
  • 2024年7月,TCLA方法提出无需训练的类别级逻辑适配技术,用于医学视觉-语言模型,显著提高了医学图像分析的准确性和效率。(TCLA:无需训练的类别级逻辑适配方法用于医学视觉-语言模型)
  • 2024年7月,研究发现VLMs在计数任务中存在内部认知与输出不匹配的问题,模型虽然能够正确计数,但输出结果与实际计数存在偏差。(VLMs计数失败:内部有正确计数但输出不对齐)
  • 2024年6月,EdgeFlow技术通过边缘图增强VLM实现工业流程图到Mermaid代码的转换,无需额外训练即可完成这一复杂任务。(EdgeFlow:边缘图增强VLM实现工业流程图转Mermaid,无需训练)
  • 当前焦点与观察点

    VLMs技术发展呈现出专业化与实用化的双重趋势。一方面,研究人员正致力于提升VLMs在特定领域的专业能力,如医学图像分析、工业流程识别等;另一方面,如何解决VLMs的固有局限性,如计数准确性、空间数值理解等问题,成为当前研究的重要方向。

    2024年5月发布的SPACENUM研究重新审视了VLMs的空间数值理解能力,发现现有模型在处理空间关系和数值计算时仍存在明显不足。(SPACENUM:重新审视VLMs的空间数值理解能力)

    同时,Analysis-by-Proxy方法探索了将VLMs作为条件编码器中的定位信号的可能性,为提升模型的定位准确性提供了新思路。(Analysis-by-Proxy:VLMs作为条件编码器中的定位信号)

    总体来看,VLMs技术在保持快速发展的同时,也面临着准确性和专业性的挑战,未来研究需要在提升基础能力与增强专业应用之间找到平衡点。

    § 02相关报道10 条在档
    1. 01
      BiG-SURE:大模型语义不确定性估计方法
      arXiv cs.AI
    2. 02
      $R^3$: 通过强化学习训练机器人进行自然语言推理
      arXiv cs.AI
    3. 03
      LlamaIndex发布文档提取基准测试
      Jerry Liu
    4. 04
      评估视觉语言模型的时间一致性
      arXiv cs.AI
    5. 05
      Evaluating VLMs for Agent-Driven Geometry Clipping Detection in Game QA
      arXiv cs.AI
    6. 06
      VLM-IE3D:隐式与显式几何融合的3D感知视觉语言模型
      arXiv cs.LG
    7. 07
      TCLA:无需训练的类别级逻辑适配方法用于医学视觉-语言模型
      arXiv cs.AI
    8. 08
      VLMs计数失败:内部有正确计数但输出不对齐
      arXiv cs.LG
    9. 09
      Analysis-by-Proxy:VLMs作为条件编码器中的定位信号
      arXiv cs.AI
    10. 10
      Localized Conformal Prediction用于VLM图像分类的改进方法
      arXiv cs.LG
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/VLMs