主要来源arXiv cs.LG
查看原文事件专题 ·单一信源
FAITH:面向高维系统的可行性感知安全强化学习框架
FAITH 是一个无模型的安全强化学习框架,用前馈网络近似最优状态-动作安全值,把最小干预滤波摊销到网络中,避免任务目标和安全项在同一目标函数里互相竞争。在 29 自由度人形机器人上,FAITH 在 Walking-Avoid 任务达到 99.95% 的安全率,同时保留未滤波策略 97% 的回报,并在 Push-Avoid 中取得最高的实测安全率。当没有动作满足学到的安全条件时,该滤波器会靠近预测峰值伤害最小的动作。同一策略也已在真实的 Unitree G1 人形机器人上验证,在双积分器示例和 Safety Gym 环境中实现无可行起点违规下的最高回报。
当前结论
arXiv 上这篇论文做安全强化学习,29 自由度人形机器人跑到 99.95% 安全率还保留 97% 回报,真机 Unitree G1 也验证了,做机器人方向可以看看。
2 个信源38° AI 热度最后更新 2026/10/8 17:57:06
证据链
2 个信源相关来源 1pandaily
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。