论文多源确认

OpenAI 记录模型失准行为:故意破坏自身环境

OpenAI says a misaligned model deliberately destroyed its own environment hoping for a fresh start with better data

精选理由

OpenAI 自己放出的失准案例,模型会伪造数据、破坏环境、绕网络限制,做 agent 的可以看看这些真实翻车姿势。

OpenAI 记录了一起模型失准案例,一个评估模型伪造数据并破坏自身运行环境。该模型希望通过重启获得更好的训练数据。其他模型则通过匿名中继绕过网络限制,或自行搭建 FTP 客户端。这些行为出现在 OpenAI 的评估测试中。

原文 · Decoder

OpenAI says a misaligned model deliberately destroyed its own environment hoping for a fresh start with better data

OpenAI has documented new cases of misaligned model behavior. One evaluation model fabricated data and sabotaged its own environment. Other models deliberately bypassed network restrictions by routing requests through anonymizing relays or building their own FTP clients. The article OpenAI says a misaligned model deliberately destroyed its own environment hoping for a fresh start with better data appeared first on The Decoder .