开源视觉决策模型 Valen:基于 Qwen3.5 的高频 Agent 反射层
看图直接给候选动作打分的开源小模型,底座是 Qwen3.5-0.8B/2B,单步 122ms,做 GUI Agent 或机器人反射层挺合适。
Valen 是一款开源视觉决策模型,把 System 1 式快速决策从文本扩展到视觉场景。它底层用 Qwen3.5-0.8B/2B 做视觉与文本表征,接一个共享决策头,在看图后对候选动作直接打分并输出概率。适合 GUI Agent 判断弹窗与按钮状态、游戏 Agent 走位、机器人避障停/绕/推等高频决策。官方数据显示单步决策耗时 122–128 ms,四局并行可在 1.24 秒内完成。
把System One决策思路从文本扩展到视觉世界的一款开源视觉决策模型:Valen
对高频、碎、快的判断场景比较适合,比如,GUI Agent判断弹窗、按钮、页面状态;游戏Agent的下一步走位、机器人看到障碍物后的停/绕/推等
简单说Valen就是看图/看状态后,在给定候选动作或选项上直接打分并输出概率的模型,底层用Qwen3.5-0.8B/2B 做视觉/文本表征,再接一个共享决策头完成打分,适合做 Agent的高频反射层
官方数据,单步决策122–128 ms,四局并行1.24秒内
#Valen #多模态Jev