论文Agent 与开发者10:50安全强化学习统一贝尔曼算子这篇论文提出了一个能同时优化任务性能和安全性的贝尔曼算子,解决了安全强化学习中的权衡问题。#强化学习#贝尔曼算子#安全约束#价值函数aarXiv cs.LG@Nishanth Arun Rao 等 4 人原文稍后读已读值得跟进有用关注 强化学习