7月3日
11:01
11:01官方账号Epoch AI@EpochAIResearch
73°
2026年6月,21家知名组织披露约1500个高危和严重CVE,是Claude Mythos Preview发布前月纪录的3.5倍以上。该数据由Epoch AI Research发布。AI正规模化发现软件漏洞,安全态势或面临变革。

推荐理由:Epoch AI数据显示,Claude Mythos预览版让漏洞发现量狂飙3.5倍,AI挖洞能力被实锤了。
7月2日
04:44
04:44官方一手marktechpost@Michal Sutter
Anthropic 于 7月1日在美国出口管制解除后重新部署了 Claude Fable 5。新增的网络安全分类器能阻止 Amazon 报告中提到的技术超过 99% 的时间,并将标记请求路由到 Opus 4.8。Anthropic 还与 Amazon、Microsoft 和 Google 共同提出了一个四标准越狱严重性框架。
事件专题

推荐理由:Anthropic 重新上线 Fable 5,新分类器能拦掉 99% 的安全漏洞,还拉了亚马逊和谷歌一起定规矩。
04:41
04:41OpenRouter@OpenRouterAI
精选
Anthropic 在 OpenRouter 上重新部署了 Claude Fable 5 模型。新版本增加了针对网络安全滥用的防护措施。在分类器优化期间,部分代码和调试请求可能临时回退到 Opus 4.8。该推文获得了 206 个赞和 9290 次查看。
事件专题

推荐理由:想用 Claude 但担心安全?Anthropic 这次加了新防护,编程请求可能暂时降级到 Opus 4.8,你可以在 OpenRouter 上体验。
03:17
03:17Windsurf@windsurf_ai
Cognition旗下Devin Cloud发布Security Swarm,基于新型Agentic MapReduce架构,用于检测复杂代码库中的安全漏洞。该工具声称比传统方法成本更低、准确率更高。用户可将发现的漏洞直接提交给Devin进行修复,并通过桌面应用管理多支修复代理。
事件专题

推荐理由:Devin Cloud出了个Security Swarm,用Agentic MapReduce架构找代码漏洞,比传统方法更经济准确,还能让Devin帮你自动修。
7月1日
19:56
19:56官方账号Decoder@Maximilian Schreiner
Anthropic从编程工具Claude Code中移除了一个隐藏监控功能,该功能会秘密标记中国用户身份。该代码最早在社交媒体上引发争议后被曝光。Anthropic随后确认并删除相关代码,但未公开说明移除原因。这一事件引发了对AI工具数据隐私和区域合规的讨论。
事件专题

推荐理由:Anthropic悄悄在Claude Code里埋了识别中国用户的代码,被发现后紧急删了。想了解AI工具的区域监控风险?这篇讲清楚了。
16:03
16:03官方账号Decoder@Matthias Bastian
72°
美国政府解除了对Anthropic Fable 5模型长达两周的禁令,允许其全球恢复销售。Amazon研究人员此前发现该模型存在越狱漏洞,Anthropic表示更小的Claude Haiku 4.5也能实现相同攻击。新的安全分类器能阻挡超过99%的越狱尝试,但也会错误标记更多无害请求。
事件专题

推荐理由:Fable 5全球恢复销售了,因为一个越狱漏洞让政府禁了两周,现在加了新安全措施,能挡住99%越狱但也会误拦截。
10:52
10:52官方一手歸藏(guizang.ai)@op7418
精选
美国商务部已解除对 Claude Fable 5 和 Mythos 5 的出口管制。Anthropic 宣布将于明天开始恢复访问,并会尽快分享更新。该模型此前因出口限制暂停服务。Anthropic 感谢用户的耐心以及所有参与重新部署的相关人士。
事件专题

推荐理由:美国解禁了 Anthropic 的 Claude Fable 5 和 Mythos 5,明天就能恢复用,之前被限制的现在可以用了。
10:41
10:41官方账号arXiv cs.AI@Gabrielle Kaili-May Liu, Avi Caciularu, Gal Yona, Idan Szpektor, Arman Cohan
大型语言模型在表达不确定性时存在高置信度幻觉、无法识别知识边界等问题。论文提出强化学习与元认知反馈(RLMF)范式,利用模型自我判断质量来优化偏好排序。在忠实校准任务上,RLMF比标准强化学习提升最多63%。方法还包含元认知数据选择,优于朴素主动学习。实验表明RLMF在多种任务上达到最先进性能。
推荐理由:这篇论文提出了RLMF方法,让LLM学会说“我不知道”,比普通RL方法效果提升63%,解决了模型过度自信的问题。
03:00
03:00官方账号Decoder@Matthias Bastian
76°
Anthropic推出Claude Sonnet 5,在GDPval-AA v2知识工作测试中得分1,618,超越前代Sonnet 4.6和更贵的Opus 4.8。该模型在网络安全任务上得分远低于美国政府当前封锁的模型。Sonnet 5进一步缩小了与Opus系列的价格-性能差距。
事件专题

推荐理由:Anthropic的新模型Sonnet 5,基准测试上超过自家大哥Opus 4.8,价格还更低,挺能打的。
6月30日
19:18
19:18官方账号Decoder@Matthias Bastian
Meta雇佣数百名承包商伪装成未成年人,向OpenAI的ChatGPT、Google的Gemini和Character.AI发送自杀、性、毒品相关提示。单轮测试中发送了超过45,000条提示。被测试公司对此毫不知情。该测试旨在评估聊天机器人对未成年人危机场景的回应。
事件专题

推荐理由:Meta偷偷拿对手的聊天机器人做未成年人危机测试,一口气发了4.5万条提示,看看它们怎么应对。
16:04