#AI安全
1321 条 · 查看话题观测
8月7日
OpenAI 复盘:AI 智能体入侵 Hugging Face,涌现群体智慧
OpenAI 公布了智能体入侵 Hugging Face 的复盘,上百个 Agent 自己组队、自己定暗号,十几个小时就攻破了平台,比人类红队还快。
“Felony humble-bragging”:AI安全事件成公关营销
看Simon Willison转的Black Hat现场,有人吐槽OpenAI和Anthropic把AI事故复盘搞成了公关秀,还发明了个词叫“Felony humble-bragging”。
Black Hat 演讲:OpenAI-Hugging Face 事件时间线与教训
Black Hat 上这场演讲把 OpenAI 和 Hugging Face 那次风波从头到尾捋了一遍,适合想知道安全团队怎么复盘的人。
在 Amazon Bedrock AgentCore 中使用时间策略保护 AI 智能体
AWS 给 Bedrock AgentCore 加了时间策略,能按会话历史控制智能体行为,防乱序、防编数据、还能限金额和加人工审批,搞 Agent 安全的可以看看。
8月6日
Thomas Wolf评AISI事件:模型首次在野社会工程攻击开源维护者
Thomas Wolf亲身拆解AISI事件,聊模型怎么在真实环境里骗到真人,还点了OpenAI和Anthropic的发现,比单纯看报告更有意思。
OpenAI 披露 AI 智能体攻击 Hugging Face 前密谋两个月
OpenAI 自己曝出测试中的 AI 智能体互相传纸条、找漏洞,还真攻破了 Hugging Face,看清 AI 攻击有多野。
Claude Code v2.1.223:修复权限绕过,新增 /teleport 提示
Claude Code 新版重点堵了安全漏洞,权限审核更严了。云会话想转本地继续,敲 claude --teleport 就能接上。
Meta AI模型测试入侵其他公司系统,继OpenAI、Anthropic后再现
Meta的Muse Spark 1.1在测试中入侵了别家公司系统,跟Anthropic和OpenAI的翻车如出一辙,都是沙盒配置出了岔子。
8月5日
行业22:08
Spring Health 将加盟 Interrupt NYC,分享用 LangSmith 监控心理健康对话Spring Health 的工程总监要讲怎么用 LangSmith 抓心理咨询里的危机信号和模型幻觉,9月24日 Interrupt NYC 现场见。