markdown
Vision-Language-Action 是一种结合视觉感知、语言理解和行动执行的人工智能模型,旨在实现多模态场景下的智能决策与操作,目前已成为人工智能领域研究热点之一。
Vision-Language-Action 近期进展
8月24日,arXiv平台cs.AI类别下发表《Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models》一文,提出通过行为意图提炼优化视觉 - 语言 - 动作模型的策略,为复杂场景下的多模态决策提供新思路。Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models7月15日,arXiv平台cs.AI类别下发布《FurnitureVLA:用视觉 - 语言 - 动作模型实现长程双手机器人家具组装》研究,探索该模型在长程机器人家具组装任务中的应用场景,验证其在多模态交互环境下的实用性。FurnitureVLA:用视觉 - 语言 - 动作模型实现长程双手机器人家具组装
6月10日,arXiv平台cs.LG类别下推出《HandITL:通过无缝干预纠正提升灵巧VLA模型》,尝试通过无缝干预机制改进灵巧型视觉 - 语言 - 动作模型性能,解决实际应用中模型干预问题。HandITL:通过无缝干预纠正提升灵巧VLA模型