把21个开源AI安全工具对照MIT风险分类,发现都堆在技术防护,法律金融没人管。做治理的值得翻翻。
#AI安全
1321 条 · 查看话题观测
8月10日
论文11:16
分类法驱动的开源AI风险缓解工具分析论文10:54
Diffusion LLM安全机制脆弱,SN-Guided Diffusion框架实现越狱攻击这篇论文发现扩散LLM的安全对齐其实很脆,用剪枝就能把越狱成功率拉到80%多,还给了个黑盒攻击框架SN-Guided Diffusion,成本低效果好。
8月9日
Claude Code Auto 模式成为 Pro、Max、Team 套餐默认设置
Claude Code 把 Auto 模式设为默认,官方测试拦下 89% 危险操作、720 次注入攻击,有第三方验证。
UCLA博士生发布Trace-and-Amplify,可规模化采集训练时奖励黑客
UCLA博士生搞了个Trace-and-Amplify,不用诱导就能抓训练时的奖励黑客,准确率从60%提到90%,比老方法强多了。
8月8日
Anthropic 将 Claude Code 自动模式设为默认,防开发者误批准
Anthropic 把 Claude Code 自动模式设成默认,机器识别危险命令比人眼强得多,以后用 AI 写代码少担惊受怕。
Anthropic 优化 Claude Fable 5 生物安全机制,误拦截减少 85%
Anthropic 给 Claude Fable 5 的安全拦截做了次大调整,误伤少了 85%,做生物相关提问更不容易被降级了。
TruffleSec CEO谈Hugging Face凭证泄露:25万密钥暴露
Dylan Ayrey亲口讲Hugging Face那次泄露有多吓人,25万把有效密钥里还有能改Linux库的,赶紧检查自己有没有把密钥挂网上。
OpenAI 下一代模型 Astra 评估:智能体编码与网络安全能力显著提升
OpenAI 刚透露下一代模型 Astra 在智能体编程和网络安全上能力大涨,还把它定为首个“关键”网络安全模型,安全措施也升级了。
Truffle Security CEO:AI让黑客门槛降到只需提问
听听Truffle Security CEO怎么说:AI没降低核武门槛,但黑客门槛低到只会提问就行,还聊了25万条泄漏密钥和npm蠕虫。
8月7日