全部动态

AI 相关资讯全量信息流 · 54 条
6月1日
5月29日
5月28日
论文精选11:36
SpatialBench-Long:评估AI在空间生物学中的长程推理能力

空间生物学研究者终于有了衡量AI科学推理能力的硬核基准——SpatialBench-Long 要求智能体从复杂空间数据中推导真实结论,而非简单跑流程。做生物信息学或AI for Science的团队,值得看看当前模型的表现差距在哪里。

arXiv: OpenAI@Ian Diks 等 4 人原文
5月27日
5月26日
5月25日
5月21日
5月19日
论文中美对照多源确认精选10:26
Mythos漏洞复现基准测试:GPT-5.5仅5/18成功

这个实验戳破了AI漏洞发现能力的泡沫——即使给定了目标文件,顶级模型复现已知漏洞的成功率也极低。做AI安全评估或漏洞研究的团队,看完会重新审视benchmark的可靠性。

事件专题
arXiv: Anthropic@Isaac David, Arthur Gervais11 个信源在谈原文
5月15日
论文精选10:11
Autoresearch 框架 Automat 自动设计材料科学描述符,超越 Magpie 基线

材料科学家和 AI for Science 研究者终于有了一个能自动设计描述符的框架——Automat 用 GPT 智能体替代了繁琐的手动特征工程,在带隙和居里温度预测上直接超越经典 Magpie 基线,做材料信息学的团队值得一试。

arXiv: OpenAI@Matteo Cobelli, Stefano Sanvito原文
5月13日
论文精选70°19:12
三机制框架:LLM 如何处理训练知识与上下文冲突

这个框架解决了 LLM 行为研究中一个长期矛盾的谜题——为什么有的实验说模型死记硬背,有的说模型灵活跟随。做 LLM 评测或 prompt 工程的人,看完能更精准地预测模型在知识冲突场景下的行为,建议直接读原文的机制划分部分。

arXiv: DeepSeek@Pruthvinath Jeripity Venkata原文
5月12日