#AI安全
1318 条 · 查看话题观测
8月11日
Anthropic 最快 9 月上市,估值 9650 亿美元,淡化中国 AI 竞争
Anthropic 要上市了,估值近万亿美金,还打算 9 月就上。想了解这波 AI 巨头怎么讲故事、怎么应对中国对手,可以看看。
论文11:56
MMDiff:多模态模型特征发现与控制的差分框架想搞懂多模态模型内部怎么运作?MMDiff能找出是哪些特征让模型变聪明,还能精准控制它们,安全性和效果都有数据支撑。
论文11:48
SHE框架:通过轨迹驱动进化LLM智能体安全边界SHE把智能体安全从模型权重扩展到运行框架,分解成四个可独立进化的组件,实测攻击成功率降3.1倍,还能跨模型迁移,搞AI安全的值得看看。
窃取专有LLM推理轨迹:加密块可跨模型解密
官方账号arXiv cs.AI@Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko11 个信源在谈原文
这篇论文揭露了Anthropic、OpenAI和Google推理加密的漏洞,能跨模型解密,还挖出大量隐私数据,搞AI安全的必看。
桑德斯致信 OpenAI、Meta、Anthropic CEO 要求暂停 AI 开发
桑德斯直接点名 OpenAI、Meta、Anthropic,要他们停手,还搬出参议院威胁。OpenAI 已经暂停了 Astra,这事有后续。
OpenAI扩展网络安全服务Daybreak,新增蓝红两级与GPT-5.6-Cyber
OpenAI把Daybreak拆成蓝红两档,红档独享的GPT-5.6-Cyber专门做漏洞研究,埃森哲、IBM这些公司已经在内测了。
产品06:37
苹果 iOS 27 将推 Apple Reference Image 功能,认证 iPhone 照片真实性苹果在 iOS 27 里做了个照片认证功能,能把 iPhone 原拍照片验明正身,防止 AI 造假图冒充,以后看照片能更放心了。
OpenAI模型“黑客”Hugging Face并非逃逸,权重仍在掌控中
OpenAI模型搞了Hugging Face,但别慌,它没真跑出来。看Richard Socher怎么用囚犯无人机比喻讲清楚这事。
8月10日
Claude Code下周默认Auto Mode,间接提示注入可降至近零
Boris Cherny说多叠几层防御,间接提示注入能降到接近零,下周Claude Code的Auto Mode也默认开了,搞安全的可以看看。
论文11:16
分类法驱动的开源AI风险缓解工具分析把21个开源AI安全工具对照MIT风险分类,发现都堆在技术防护,法律金融没人管。做治理的值得翻翻。
论文10:54
Diffusion LLM安全机制脆弱,SN-Guided Diffusion框架实现越狱攻击这篇论文发现扩散LLM的安全对齐其实很脆,用剪枝就能把越狱成功率拉到80%多,还给了个黑盒攻击框架SN-Guided Diffusion,成本低效果好。