全部动态
AI 相关资讯全量信息流 · 170 条
5月19日
5月17日
5月15日
Autoresearch 框架 Automat 自动设计材料科学描述符,超越 Magpie 基线
材料科学家和 AI for Science 研究者终于有了一个能自动设计描述符的框架——Automat 用 GPT 智能体替代了繁琐的手动特征工程,在带隙和居里温度预测上直接超越经典 Magpie 基线,做材料信息学的团队值得一试。
5月14日
5月13日
论文21:36
CSP Allow-list Experiment:沙箱 iframe 动态允许域实验做安全或前端开发的团队会感兴趣——这个实验让 CSP 允许列表动态化,既保持安全又减少用户被拦在门外的挫败感,值得点开看实现细节。
三机制框架:LLM 如何处理训练知识与上下文冲突
这个框架解决了 LLM 行为研究中一个长期矛盾的谜题——为什么有的实验说模型死记硬背,有的说模型灵活跟随。做 LLM 评测或 prompt 工程的人,看完能更精准地预测模型在知识冲突场景下的行为,建议直接读原文的机制划分部分。
LLM社会科学测量校准问题:GPT-5-mini等模型置信度偏差严重
做社会科学量化分析的团队终于有了校准LLM输出的实操方案——软标签蒸馏能显著降低置信度偏差,建议做文本编码和实证研究的点开看看具体方法。
ExploitGym:AI智能体能否将安全漏洞转化为真实攻击?
安全研究员和红队成员终于有了评估 AI 攻击能力的标准化工具——ExploitGym 覆盖真实漏洞和防御场景,做渗透测试或 AI 安全评估的团队可以直接拿来用。
5月12日
论文19:11
Pi-Serini:BM25+前沿LLM在深度搜索中超越稠密检索该研究挑战了稠密检索在深度搜索中不可或缺的假设,为构建轻量、高效、不依赖外挂向量库的搜索代理提供了新思路,值得关注推理模型与经典检索技术的结合。