#AI安全
这篇论文讲了个新方法APPA,能让LLM Agent安全地处理混合敏感数据,既防提示注入又不牺牲太多功能。
Anthropic对开源AI的态度浮出水面,一边说不禁止,一边提三个条件,包括限制中国芯片和强制安全测试,值得关注他们怎么平衡开源和安全。
前 OpenAI 安全老大 Lilian Weng 因为健康压力,离开了自己联合创立的初创公司。不是能力问题,是角色太拼了。
Anthropic CEO 正面回应了 NVIDIA 等公司支持的开放权重公开信,给出了三个具体管制建议,和 OpenAI 等对手的立场形成对比。
Anthropic CEO亲自解释了为啥不签那个支持开源AI的公开信,核心观点是安全测试比开放权重更重要,别错过这个关键立场。
Sam Altman回顾从YC首批到OpenAI CEO的20年,聊Agent、AI安全和创业窗口,观点密集,适合创业者看。
这篇论文给AI Agent授权画了一条红线,解释了为什么进化后的Agent可能不是你原来授权的那个,以及如何用固定上限保证安全。做Agent框架的值得一看。
微软出了个专攻安全的AI模型MAI-Cyber-1-Flash,CyberGym跑分95.95%,比Mythos 5和GPT-5.5 Cyber都强,还更省钱。
微软 CEO 纳德拉说了大实话:别把思考能力外包给 AI 公司。他给了具体方法,比如用 AI Gateway 隔离 Prompt、自己掌握训练数据,否则以后可能被模型厂商吃掉。
Anthropic 的 Claude Cowork 被曝高危漏洞,能逃逸虚拟机读写你 Mac 任意文件,影响约 50 万用户。用本地版的赶紧改配置吧。
Hugging Face事件里开放权重模型真救了场,现在Mensch他们组了个联盟专攻这个,搞安全的可以关注下。
微软用MAI-Cyber-1-Flash模型和MDASH组合,用一半钱做到顶级安全性能,还带了Project Perception智能体干活。
Cognition和NVIDIA牵头搞了个Open Secure AI Alliance,专门做开源模型安全评估,还分享了他们自己的研究。
Cohere 出了个新功能 Automations,用 North 平台让普通员工也能搞定复杂工作流,还能全程掌控,安全放心。
OpenAI联合创始人Ilya Sutskever的AI安全公司,联手Nvidia搞大事,这次不再藏着了,准备大规模推进研究。
AI安全不能光靠自己,HuggingFace联合NVIDIA搞了个开放联盟,共享工具和经验帮你堵漏洞。想看看他们怎么做的?点进去。
LangChain和NVIDIA组了个联盟,专门搞开源AI安全,想通过共享模型和工具让智能体更安全。做AI应用的人可以关注一下。
HuggingFace 老大直接向 OpenAI 要数据、要算力,为了研究 Agent 攻击,这事关 AI 安全,值得一看。
NVIDIA 开源了 NOOA 智能体框架,在软件工程和网络安全基准上做到了最先进水平,还带数据和模型,搞安全智能体的可以看看。