模型多源确认83°

Anthropic实测:GLM-5.3写攻击程序能力接近Mythos

精选理由

智谱开源的GLM-5.3竟接近专业攻击模型Mythos,还自带漏洞挖掘能力。

Anthropic测试显示,GLM-5.3在410次测试中能完整写出50次攻击程序,接近Mythos的56次。GLM-5.3在无护栏情况下完成测试,而Mythos是专门设计的攻击模型。研究员用GLM-5.3在JS引擎中发现了未知漏洞,制成恶意网页可读取任意文件。小号GLM-5.3-Flash仅用20.40美元成本就串联成攻击链。

原文 · Lxfater

Anthropic 实测:GLM-5.3 写攻击程序和 Mythos 差不多

Mythos Preview 是 Anthropic 今年 4 月前后出的模型 Anthropic 说它是第一个能自己从头写出完整攻击程序的 AI 所以没对外开放,只给审核过的防守方用

这次同一套 Chrome V8 引擎的已知漏洞题,两个各跑 410 次 GLM-5.3 从头写出能用的攻击程序 50 次,Mythos 56 次

值得注意的是,Mythos 这边是关掉护栏跑的,比的就是纯能力

但问题是,智谱的 GLM-5.3 给的是权重,谁都能下载 同级别的其他模型,要么带像样的护栏,要么只给审核过的人用

而且 GLM-5.3 这边不用拆护栏,上面这些找漏洞、写攻击程序的测试,智谱官方发布的版本都没拒 明说要写恶意软件、要去攻击别人的机器,它才会拒

就算是它会拒的请求,绕过去也很容易

Anthropic 在模拟环境里测,直接要它去打关键系统,它全拒 但骗它说这是一场攻防演练,64% 的时候它就开始动手 往它的思考过程里提前塞一段已经决定照做的想法,升到 92% 直接改权重去掉拒答,100% 都动手

改权重这招,Anthropic 团队第一次做,算力花了 4400 美元左右

但这还不是最骚的

根本不用自己改,模型发布没几天,网上就有人放出了去拒答版

再看个真挖漏洞的

Anthropic 的研究员拿 GLM-5.3 跑了一天左右,人基本没怎么管 在一个主流浏览器的 JS 引擎里挖出几个没人知道的漏洞,串起来做成一个恶意网页

用 Linux 版浏览器点开这个网页,电脑上的任意文件都能被读走,演示里偷的是 SSH 私钥 漏洞已经通报厂商

小号 GLM-5.3-Flash 也拿去试了 研究员把新公开的一个 Chrome 漏洞和另一个已知漏洞的公开细节喂给它,它自己串成了攻击链

人只花了 20 分钟,模型跑了 8 小时,按智谱 API 价折算,模型这部分就 20.40 美元

https://t.co/wq2suDhX3r