8月18日
15:27
15:27官方账号arXiv cs.AI@Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao, Chi Guo, Keyan Guo, Hongxin Hu
该研究提出状态语义注入攻击,针对LLM驱动的具身代理。攻击者通过操纵环境状态描述,使代理执行恶意动作。实验在多个具身代理框架上验证,成功率超过80%。该攻击暴露了状态表示的安全漏洞。
推荐理由:这篇论文揭示了具身代理的新攻击面,搞机器人安全的值得看看。
10:28
10:28官方一手arXiv: DeepSeek@Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo
Tencent 发布论文,用 AI-Infra-Guard(A.I.G)对 DeepSeek Harness(DSH)进行间接提示注入评估。实验包含 14,560 次受控执行,覆盖 16 个间接内容渠道、35 个载荷目标和 12 种攻击方法。最强攻击成功率在文本模式下为 17.0%(伪造完成攻击,LLMJudge 判定),文件模式下隐藏 Unicode 攻击达 25.5%(RuleJudge 判定),技能渠道为 16.0%。研究还对比了 RuleJudge 与 LLMJudge 的判定差异,并给出了缓解建议。代码已开源。
事件专题

推荐理由:腾讯用 A.I.G 把 DeepSeek Harness 翻来覆去测了 1.4 万多次,隐藏 Unicode 攻击成功率能到 25.5%。想自查提示注入的可以看看这个框架。
10:05
10:05官方账号arXiv cs.AI@Benjamin Icard, Elouan Vuichard, Louis Lefebvre, Lila Sainero, Thomas Girault, Alice Breton, Tanguy Launay, Gauvain Bourgne, Morgane Casanova, Guillaume Gadek, Victor Klötzer, Michel Le Nouy, Guillaume Gravier, Jean-Gabriel Ganascia, Paul Égré
论文发布名为 PROPAGIA 的法语宣传语料库,包含 2,646 篇文章,来自 2025 年 VIGINUM 和 INSIKT GROUP 披露的 Storm-1516/CopyCop 活动。与同期人类写作的主流媒体语料 SIPA 相比,PROPAGIA 在模糊性、主观性和负面性上显著更高,引用来源更少。分析发现 84 个 PROPAGIA 网站中有 50 个存在提示词指令泄漏,其中包括一份逐字的十点编辑规范。基于改写检测的分析支持 INSIKT GROUP 将活动归因于 Llama 3 系列模型,但也暗示 Mistral 系列模型的参与。
推荐理由:这篇论文还原了AI宣传的生成流程,从50个网站翻出提示词指令,还发现背后用了Llama 3和Mistral模型。
09:23
09:23Aravind Srinivas@AravSrinivas
精选
Perplexity 的 Computer 功能为每个连接器工具提供 Allow、Always Ask、Deny 三种权限设置。用户可批准单个操作,或允许该工具在线程后续中自动执行。循环任务会沿用线程已批准的权限。该功能已面向所有 Computer 用户在 Web 端上线。
推荐理由:Perplexity 给智能体加了个安全阀,每个连接器都能单独设成询问或禁用,不想让 AI 擅自动手时能随时拦住。
04:03
8月17日
21:08
20:11
20:11官方账号Decoder@Maximilian Schreiner
Anthropic为Claude引入文本水印,使AI生成内容可被检测。批评者怀疑该水印会影响Claude的词汇选择。律师们因Anthropic的举措面临新的透明度问题。
事件专题

推荐理由:Anthropic给Claude输出加了水印,用来识别AI写的文字。但有人担心这会影响Claude的用词,想探究竟可以读这篇。
8月16日
15:41
15:41官方账号Decoder@Matthias Bastian
Anthropic在安全报告中披露,其生物与化学武器风险过滤系统近一年未生效。在此期间,约5万名外部反馈承包商与模型进行了约1.33亿次未过滤交互。该过滤器用于检测和阻止危险生物及化学信息相关请求。报告未说明过滤器失效的具体原因及修复时间。
事件专题

推荐理由:Anthropic自己承认,防生物武器滥用的过滤器居然趴窝了近一年,5万人跑了1.33亿次没过滤的对话,这事你不想知道吗?
03:06
8月15日
16:41
16:41官方账号Decoder@Tomislav Bezmalinović
精选
美国康涅狄格州一名原告在法庭文件中嵌入隐形提示词注入,用白色背景上的3点白色字体试图操纵潜在的AI审查系统。法官Spader将此举比作暗中干扰陪审团,并撤销了该原告的电子提交权限。法院强调康涅狄格州目前并未使用AI审查文件,但仅凭意图已足以构成制裁依据。

推荐理由:有人把提示词注入用到了法庭上,被法官当场识破还吊销了电子提交权限。这案例提醒你,AI安全不是闹着玩的。
06:15
06:15官方一手Anthropic: Newsroom资讯
Anthropic 于 8 月 14 日发布公告,讲解 Claude 文本水印的工作原理。文中解释了水印如何嵌入到 AI 生成的文本中,并介绍了相应的检测方法。该机制旨在帮助识别 AI 生成内容。
事件专题

推荐理由:Anthropic 官方亲自讲 Claude 水印怎么运作,想知道 AI 文本怎么留记号,看这篇就懂。
05:50
05:50官方账号Decoder@Matthias Bastian
71°
Anthropic即将发布水印检测API,允许第三方验证文本是否由Claude生成。该技术基于Google的SynthID方法,通过调整词选择过程中的随机性来嵌入水印,且不影响文本质量。官方指出该方法在事实密集文本、代码和重度改写场景下存在局限。
事件专题

推荐理由:Anthropic要开放水印检测接口了,以后第三方工具能直接查一段文字是不是Claude写的,用的是谷歌SynthID那套思路,但碰到改写过或代码类的文本可能就不灵。
02:56
02:56官方账号Anthropic@AnthropicAI
Anthropic 依据负责任扩展政策发布第二份风险报告,报告已上线 anthropic.com/aug-2026-risk 页面。报告详细说明其系统的风险类型以及 Anthropic 的应对准备程度。目前该推文获得 63 条评论、26 次转发和 298 个赞。
事件专题

推荐理由:Anthropic发了第二份风险报告,讲自家系统风险和应对准备。想了解前沿模型安全底细的可以点开看看,比官方新闻更技术。
01:30
01:30官方一手歸藏(guizang.ai)@op7418
75°
智谱为 GLM-5.3 开源发布撰文,主张网络防御能力不应只属于少数大型机构。文中强调开源维护者、独立开发者和小型团队也需要这些工具,GLM-5.3 则大幅强化了网络安全任务能力。该发布由 Z.ai 推进。
事件专题

推荐理由:智谱马上要开源 GLM-5.3,这次重点补强网络安全任务,还专门说防御能力不该被大机构垄断,中小团队和独立开发者也能用上。