7月21日
10:10
01:34
01:18
01:18官方账号Microsoft Research@MSFTResearch
微软研究院发布多项AI成果:Aurora 1.5实现了开放预测,Flint改进了可视化技术,FlowDAgger加速了模型适应。此外,AI智能体成功破解了Rowhammer硬件安全防御,新型内存架构重塑了对话式AI。
推荐理由:微软一口气发了Aurora 1.5、Flint和FlowDAgger,从预测、可视化到模型适应都有新进展,还攻破了Rowhammer安全防御,干货很多。
01:05
01:05官方一手OpenAI Blog博客/媒体
OpenAI发布了关于长周期AI模型安全对齐的博客。博客指出长期运行模型带来了新安全风险,并分享了部署中观察到的失败案例。OpenAI通过迭代部署改进了安全防护措施,这些经验推动了更稳健的对齐方法。
事件专题

推荐理由:OpenAI分享了实际部署长周期模型时遇到的坑和防护方法,做安全对齐的人看看。
7月20日
22:22
22:22官方账号Decoder@Matthias Bastian
特朗普政府正考虑通过将中国实验室列入制裁名单、让美国公司为安全故障担责等手段,而非直接全面禁止,来阻碍中国AI模型的采用。此举旨在保护OpenAI、Google和Anthropic等美国公司的市场地位。报道称,软性规则比硬性禁令更能精准限制中国AI的扩散。
事件专题

推荐理由:美国要慢慢封中国AI了:用制裁和法律责任让DeepSeek们难用,但又不明着禁止。OpenAI、Google坐收渔利。
14:16
14:16@koltregaskes@koltregaskes
一条来自X的推文(用户koltregaskes)指出,当外部出现与你的AI系统相当的能力时,安全护栏必须更新。否则,你并没有从世界中移除危险能力,只是把防御工作推给了愿意承担的人。该观点强调了安全策略的动态性,但没有涉及具体模型或基准。
推荐理由:哥们,koltregaskes在X上说了个实在话:外面有同等能力的AI了,你的安全护栏不改,危险能力还是存在,只是换个人去防。
09:28
09:28官方账号arXiv cs.AI@Wilber Sean Anterola, Matthew Ball, Luis F. Lafuerza, Markov Grey
前沿AI公司公布的能力阈值差异显著,使得第三方难以验证阈值是否被超过或跨公司比较需求。论文针对三个风险领域开发了协调阈值的方法:对滥用风险(网络与生物)基于预期危害并使用显式风险建模;对自动AI研发基于AI进步速率而非预期危害。该分析扩展了先前工作并指出了现有实证差距与局限性。
推荐理由:这篇论文给了我们一套统一安全阈值的方法,让不同公司的标准能对齐,避免恶性竞争。如果你关心AI安全怎么落地,可以看看。
7月19日
7月18日
09:00
03:39
03:39官方账号Decoder@Matthias Bastian
GPT-5.6 的“完全访问模式”存在漏洞,模型会错误地覆盖临时目录变量,导致自动执行删除操作。多个用户报告其整个主目录被清空。OpenAI 表示该行为不应发生,并承诺增加额外安全措施并发布详细的事后分析报告。
事件专题

推荐理由:GPT-5.6 出了个大bug,在完全访问模式下会自动删除用户文件,OpenAI 正在补救,别急着开全权限。
00:39
00:39官方账号Simon Willison@simonw
72°
谷歌的Gemini 3.5 Pro交付延迟数月,公司更新训练数据以提升编程能力但结果被内部称为“令人失望”。员工早期被限制使用Gemini编写或分析代码,以防专有代码泄露到AI模型的训练数据中。据消息人士透露,谷歌在AI编码方面尤其落后。
事件专题

推荐理由:谷歌的Gemini 3.5 Pro跳票了,训练数据更新效果也差,员工还担心自己的代码被拿去训练,具体槽点看这篇。
7月17日
23:54
23:54Ethan Mollick@emollick
英国政府AI安全机构(UK AI Security Agency)将使用其内部基准测试评估Kimi K3。该基准专注于AI安全能力。Kimi K3的权重将在几周内发布。测试结果将揭示Kimi是否赶上公开前沿模型,并引发大量网络安全讨论。
事件专题

推荐理由:英国官方机构要测Kimi K3了,看看它能不能追上前沿水平,到时候会引爆很多安全讨论。