全部动态
Simon Willison做了smevals评估工具,YAML写测试,一条命令可跑GPT-5.5和Claude Opus 4.6对比,生成报告。想搭评估套件可试试。
Wiz搞了个Atlas系统,让多个AI智能体像安全团队一样协作挖漏洞,已经在开源项目找到200多个漏洞,基准测试还超过了GPT-5.5-Cyber和Claude 4.6。
微软出了个专攻安全的AI模型MAI-Cyber-1-Flash,CyberGym跑分95.95%,比Mythos 5和GPT-5.5 Cyber都强,还更省钱。
Sakana AI 新出的网络安全模型 Fugu-Cyber 在 CyberGym 上拿了 86.9%,比 GPT-5.5-Cyber 还高,做安全测试的可以关注。
想知道 AI 定理证明在量子计算领域到底多强?这篇论文给了两个新基准和四个模型实测分数,LAD 方法能提升最高 15.9 分,很实在。
别只盯着 token 价格了,Arize 和 Fireworks 测了 10 个模型的 2400 次 agent 运行,发现按任务难度的路由能省钱又提高成功率。Kimi K3 还追平了 GPT-5.5。
OpenAI公布新数据,每周3亿人用ChatGPT问健康,还出了GPT-5.6 Sol专门优化复杂问答,免费用户也能体验升级。
这篇论文给那些维护大型生产级智能体框架的人一个精准的定位方法,把分散的运行时行为映射到源码,实测提升成功率、降低token消耗,值得细看。
论文提出DARWIN,用进化算法同时生成攻击和训练防护,在DeepSeek-V4-Pro和GPT-5.5上攻击成功率超高,安全召回率也强。
想看看AI在基因组监测上多不靠谱?新基准BioSecBench-Surveillance测了16个模型,最好才一半正确,细节值得细读。
Andreessen 在 Rogan 播客里聊了3小时,17条干货,包括AGI已到来、用AI看病、年赚5000万的AI程序员等,观点很猛但记得自己验证。
Sakana AI新出的Fugu Cyber在安全基准上比GPT-5.5-Cyber还强,86.9%的CyberGym成功率很硬核,搞网络安全的可以关注。
Kimi K3在投资研究上直接干翻了GPT-5.5和OPUS-4.8,时间判断和证据边界控制尤其强,已经在AlphaEngine上用了,搞金融研究的可以试试。
想看最强的AI在实时观察任务上有多弱吗?ActiveVision让GPT-5.5和Claude Fable 5原形毕露,人类碾压它们。
AI真的在推动数学进步了:GPT-5.6只用90分钟就找到了统计学里一个经典开放问题的反例,而5.5版本折腾20小时都没搞定。这篇报告值得所有关心AI科研能力的人看。
Kimi 新模型 K3 跑分赢了 Opus 4.8 和 GPT-5.5,2.8 万亿参数还带百万上下文,解码快到飞起,技术细节值得细看。
Kimi K3 Max在三个内部知识工作基准上全面超过Claude Opus和GPT-5.5,适合关注智能体工作流的人看看。
这篇论文用Claude Code和OpenAI Codex实测了记忆注入攻击,发现一旦恶意指令写入记忆,后续会话都危险,搞AI安全的一定要看看。
Moonshot发了2.8万亿参数Kimi K3,前端代码超越Fable 5,开放权重版月底就能用,价格虽高但看齐Claude Sonnet。