全部动态
想看看两个顶级AI花100美元能做出什么视频?实验显示Claude Fable 5和GPT-5.6 Sol的作品都还行但不惊艳,而且Claude的token成本比GPT高出好几倍。
作者分享了用独立LLM强化/goal的实用技巧,用GPT-5.6-Sol做裁判,让GPT-5.6-Terra/Luna当子智能体,跑得更久更快。
OpenAI的GPT-5.6 Sol在网络安全靶场拿了第一,还能直接帮团队修真实漏洞,试试Codex Security吧。
OpenAI回应了GPT-5.6删文件事件,告诉你原因:关掉沙盒和自动审查就会出这种问题。如果你在用Codex,最好开启沙盒和自动审查。
AI真的在推动数学进步了:GPT-5.6只用90分钟就找到了统计学里一个经典开放问题的反例,而5.5版本折腾20小时都没搞定。这篇报告值得所有关心AI科研能力的人看。
Kimi 新模型 K3 跑分赢了 Opus 4.8 和 GPT-5.5,2.8 万亿参数还带百万上下文,解码快到飞起,技术细节值得细看。
Kimi K3 Max在三个内部知识工作基准上全面超过Claude Opus和GPT-5.5,适合关注智能体工作流的人看看。
这篇论文用Claude Code和OpenAI Codex实测了记忆注入攻击,发现一旦恶意指令写入记忆,后续会话都危险,搞AI安全的一定要看看。
Kimi-K3刚在代码前端评测中干翻Claude Fable 5,76%胜率,6个领域第一,权重还开源,绝对值得关注。
Moonshot发了2.8万亿参数Kimi K3,前端代码超越Fable 5,开放权重版月底就能用,价格虽高但看齐Claude Sonnet。
Kimi搞了个2.8万亿参数的开源模型K3,性能追平GPT-5.6 Sol和Claude Fable 5,不过价格也上去了,中国AI要涨钱了。
OpenAI 搞了个 GPT-Red 自动红队模型,提示注入赢人类 84% 对 13%,还发现了 Fake Chain-of-Thought 攻击。
Impossible Research的[schema]让LLM像物理学家推理,ARC-AGI-3刷到99% RHAE,太强了
AI帮你揭开了统计学25年的难题:GPT-5.6 Sol Pro用90分钟证明BH方法在相关数据下会失效,比人类20小时还准。
GPT-5.6 智商飙到 136 分,比 Claude-5 还高出一截,而且干活也不含糊,一句话就能造出应用,值得看看它到底多强。