全部动态

AI 相关资讯全量信息流 · 46 条
5月21日
5月19日
论文中美对照多源确认精选10:26
Mythos漏洞复现基准测试:GPT-5.5仅5/18成功

这个实验戳破了AI漏洞发现能力的泡沫——即使给定了目标文件,顶级模型复现已知漏洞的成功率也极低。做AI安全评估或漏洞研究的团队,看完会重新审视benchmark的可靠性。

事件专题
arXiv: Anthropic@Isaac David, Arthur Gervais11 个信源在谈原文
5月15日
论文精选10:11
Autoresearch 框架 Automat 自动设计材料科学描述符,超越 Magpie 基线

材料科学家和 AI for Science 研究者终于有了一个能自动设计描述符的框架——Automat 用 GPT 智能体替代了繁琐的手动特征工程,在带隙和居里温度预测上直接超越经典 Magpie 基线,做材料信息学的团队值得一试。

arXiv: OpenAI@Matteo Cobelli, Stefano Sanvito原文
5月13日
论文精选70°19:12
三机制框架:LLM 如何处理训练知识与上下文冲突

这个框架解决了 LLM 行为研究中一个长期矛盾的谜题——为什么有的实验说模型死记硬背,有的说模型灵活跟随。做 LLM 评测或 prompt 工程的人,看完能更精准地预测模型在知识冲突场景下的行为,建议直接读原文的机制划分部分。

arXiv: DeepSeek@Pruthvinath Jeripity Venkata原文
5月12日