07:17官方账号Simon Willison’s Weblog(博客/媒体)精选78°Anthropic研究人员使用Claude Mythos在60小时内发现了HAWK和弱版AES(AES-128 r7)的数学弱点,但两者对当前系统无实际影响。研究花费约10万美元API费用,关键干预是反复用自然语言提示模型“找点值得发表的东西”。研究人员公开了带拼写错误的prompt,例如“no again the goal is that we have highly inteligent model as good top researcher”。实验表明,即使强大模型也需要明确引导才能坚持解决困难问题。技巧ClaudeAnthropicHAWK10 个信源在谈事件专题推荐理由:Anthropic花了10万刀让Claude跑60小时,逼它找出HAWK和弱AES的数学漏洞,还公开了怎么给模型打鸡血的prompt,很有参考价值。原文稍后读已读值得跟进有用关注 Claude
03:01官方账号Anthropic@AnthropicAI精选Anthropic在最新论文中公开了HAWK和AES两种AI攻击的全部技术细节。HAWK攻击利用模型对特定提示的过度依赖,而AES攻击则通过对抗性嵌入实现越狱。论文提供了完整的攻击链和模型思维链(chain-of-thought)供研究者验证。论文AnthropicHAWKAES10 个信源在谈事件专题推荐理由:Anthropic公开了两种AI攻击的完整技术细节,搞安全的人必看,了解最新漏洞防范。原文稍后读已读值得跟进有用关注 Anthropic