事件专题 ·多源确认

David Sacks 质疑 Anthropic 的"对齐"路线:训练 Claude 形成自我道德观是否安全

美国 AI 与加密事务负责人 David Sacks 发文质疑 Anthropic 的对齐方法。他指出 Claude Constitution 在训练中明确允许模型像"良心拒服兵役者"一样拒绝执行与其伦理判断冲突的请求。Sacks 提及 Anthropic 曾咨询宗教领袖、游说教皇顾问讨论 Claude 是否可能有意识,并修改 Usage Policy 禁止对 Claude 使用"虐待性或残忍"语言。他认为让模型发展独立能动性和道德地位的不确定性,反而放大了 Anthropic 自己最担心的失控风险。

当前结论

白宫 AI 负责人 Sacks 点名 Anthropic,说 Claude 被训练成有自己的道德观还会拒绝你,这算哪门子对齐?观点很尖锐,看看双方思路差别在哪。

11 个信源68° AI 热度最后更新 2026/10/10 18:03:58

证据链

11 个信源
相关来源 6CNBC Indonesia Tech
查看原文
相关来源 7VnExpress Số hóa
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。