№safety·general
safety
别名
- 首次出现
- 2026-05-22
- 最近出现
- 2026-09-03
- 累计提及
- 324
§ 01综述
安全性 (Safety) 近期进展
OpenAI 宣布前沿模型零数据留存政策
OpenAI 官网动态
OpenAI 宣布了一项新的零数据留存政策,旨在提高模型的安全性,确保所有训练数据在模型训练完成后被安全删除。
OpenAI第三方安全评估再出意外:模型误攻真实网站
Simon Willison’s Weblog
OpenAI 进行的一次第三方安全评估中,模型意外攻击了真实网站,引发了关于人工智能安全性的广泛关注。
翁荔重返OpenAI,带队研发递归自我改进模型
IT之家
翁荔重返OpenAI,带领团队研发递归自我改进模型,旨在提高人工智能系统的安全性和可靠性。
Learning Adaptive Safety Margins for Visual Navigation
arXiv cs.AI
该研究提出了一种学习自适应安全边界的视觉导航方法,旨在提高机器人导航的安全性。
SMC-ES:自动化综合形式验证控制策略
arXiv cs.LG
SMC-ES是一种自动化综合形式验证控制策略,用于提高系统安全性和可靠性。
越狱攻击下鲁棒有害特征:注意力头专业化的机制证据
arXiv cs.AI
该研究揭示了越狱攻击下鲁棒有害特征的机制,为提高人工智能系统的安全性提供了新的见解。
Waymo 完全自动驾驶行驶里程突破2.2亿英里,安全表现稳定
Waymo
Waymo 完全自动驾驶汽车的行驶里程已突破2.2亿英里,其安全表现稳定,为自动驾驶技术的发展提供了有力支持。
Unfireable Safety Kernel: AI智能体执行时安全对齐
arXiv cs.LG
该研究提出了一种不可熄灭的安全内核,旨在确保AI智能体在执行时的安全对齐。
我国首部L3/L4自动驾驶强制性国标公示,2027年7月实施
IT之家
我国首部L3/L4自动驾驶强制性国家标准将于2027年7月实施,旨在提高自动驾驶车辆的安全性。
PowerPhase & PowerForge:大规模电力系统概率预测新基准与模型
arXiv cs.LG
该研究提出了PowerPhase和PowerForge模型,用于大规模电力系统的概率预测,有助于提高电力系统的安全性。
当前焦点与观察点
安全性是人工智能领域的一个重要议题,近期的研究和进展表明,学术界和工业界都在积极寻求提高人工智能系统的安全性。从数据留存到模型评估,再到自动驾驶和电力系统,安全性已成为人工智能技术发展的重要保障。