全部动态
EpochAI 让 GPT-5.6 Sol 直播打《Slay the Spire》,周四有解说,看看 AI 怎么玩策略游戏,挺新鲜的。
用GPT-5.6 Sol Ultra挖漏洞,10小时发现WordPress高危漏洞,成本才25美元,太强了。
谷歌出了Gemini 3.6 Flash,日常模型更强了,编码和推理升级,还省了最多65%的token。另外还有个更快的3.5 Flash-Light,Gemini 4也在训练了,可以关注。
想看看AI在基因组监测上多不靠谱?新基准BioSecBench-Surveillance测了16个模型,最好才一半正确,细节值得细读。
想低成本做浏览器自动化?Gemini 3.6 Flash 性价比炸裂,BU 基准 68% 比 GPT-5 还高,只比最贵的 Opus 差一点但便宜很多。
Google DeepMind新模型Gemini 3.6 Flash在浏览器自动化上性能接近Opus 4.8但价格便宜很多,还顺带发布了安全模型。
Sakana AI新出的Fugu Cyber在安全基准上比GPT-5.5-Cyber还强,86.9%的CyberGym成功率很硬核,搞网络安全的可以关注。
Kimi K3在投资研究上直接干翻了GPT-5.5和OPUS-4.8,时间判断和证据边界控制尤其强,已经在AlphaEngine上用了,搞金融研究的可以试试。
想看最强的AI在实时观察任务上有多弱吗?ActiveVision让GPT-5.5和Claude Fable 5原形毕露,人类碾压它们。
这周模型圈太热闹了,DeepSeek V4、GLM 5.2 刚发,Kimi K3 和 Qwen 3.8 又来了,还有 Claude 和 GPT 对标,开源 SOTA 随时变天。
中国开源模型Kimi K3编码能力比Claude和GPT还强,价格却便宜好几倍,做长上下文编程选它准没错。
SpaceXAI 的 Grok 4.5 用 $0.31 就干到一流水平,比 Claude 便宜 9 倍,token 还省 6 倍,省钱党可以关注。
想看看两个顶级AI花100美元能做出什么视频?实验显示Claude Fable 5和GPT-5.6 Sol的作品都还行但不惊艳,而且Claude的token成本比GPT高出好几倍。
OpenAI的GPT-5.6 Sol在网络安全靶场拿了第一,还能直接帮团队修真实漏洞,试试Codex Security吧。
Kimi 新模型 K3 跑分赢了 Opus 4.8 和 GPT-5.5,2.8 万亿参数还带百万上下文,解码快到飞起,技术细节值得细看。
Kimi K3 Max在三个内部知识工作基准上全面超过Claude Opus和GPT-5.5,适合关注智能体工作流的人看看。
Kimi-K3刚在代码前端评测中干翻Claude Fable 5,76%胜率,6个领域第一,权重还开源,绝对值得关注。