论文Agent 与开发者14:35VLM-Safe-RL:用 CLIP 信号改进安全强化学习,事故率从 31.6% 降至 19.4%把 CLIP 接进 PPO-Lagrangian 做安全强化学习,MetaDrive Hard 上事故率降了 12 个点,但作者自己发现信号并不能预判碰撞,分析很实在。#VLM-Safe-RL#CLIP#PPO-Lagrangian#强化学习aarXiv cs.LG@Samuel Tetteh, Cody Fleming原文稍后读已读值得跟进有用关注 VLM-Safe-RL