这篇论文用四个主流模型实测了伪科学评估,发现Grok的Fast版本评分奇高,而且同一个模型API和Web结果差十几倍。看完你就知道模型答案多不可靠,值得所有AI用户看看。
全部动态
想知道 AI 定理证明在量子计算领域到底多强?这篇论文给了两个新基准和四个模型实测分数,LAD 方法能提升最高 15.9 分,很实在。
这篇论文发现了一个反直觉的安全漏洞:把危险目标藏起来经过中介传递,反而让模型更容易执行它。对做LLM部署或安全审查的人很重要。
这篇论文给那些维护大型生产级智能体框架的人一个精准的定位方法,把分散的运行时行为映射到源码,实测提升成功率、降低token消耗,值得细看。
这是篇讲多智能体LLM安全漏洞的论文,提出ChannelGuard,不额外调用LLM,在Agent间加门控,能防住工具投毒和指令注入,而且实验用了三个不同模型后端,结果很实在。
这篇论文展示了如何在华为Ascend芯片上高效后训练万亿参数模型,并且通过运筹学专用微调,在特定任务上超越了GPT-5.4-Mini。
论文提出DARWIN,用进化算法同时生成攻击和训练防护,在DeepSeek-V4-Pro和GPT-5.5上攻击成功率超高,安全召回率也强。
AI真的在推动数学进步了:GPT-5.6只用90分钟就找到了统计学里一个经典开放问题的反例,而5.5版本折腾20小时都没搞定。这篇报告值得所有关心AI科研能力的人看。
这篇论文用Claude Code和OpenAI Codex实测了记忆注入攻击,发现一旦恶意指令写入记忆,后续会话都危险,搞AI安全的一定要看看。
AI帮你揭开了统计学25年的难题:GPT-5.6 Sol Pro用90分钟证明BH方法在相关数据下会失效,比人类20小时还准。
这篇论文不是教你怎么用AI写邮件,而是用真实实验数据告诉你:AI改写邮件语气不会直接提高回复率,但会让读邮件的人感觉更积极,从而更愿意打开和回复。
这篇论文提出沙漏推理,让GPT-5.5和Gemini 3.1 Pro在ARC-AGI、ChipBench等基准上大幅提升,不是靠新模型,而是靠精巧的推理结构设计,值得搞推理的人看看。
这篇论文很有意思,告诉你Claude Fable 5在医学难题上不是不会答,而是经常拒绝回答。一旦它愿意回答,准确率反而是最高的。如果你想了解模型的安全边界和真实能力,值得看看。
这篇论文用实验数据告诉你,大模型评政策时会看谁站台——同一政策挂美国旗得分高,挂中国旗得分低。GPT-5、Claude Sonnet、Gemini、DeepSeek表现各异,值得关注。
这篇论文拿多个模型种群跑了几万局游戏,发现换一条规则,事故率能差 58 个百分点,而且匿名化也挡不住针对性消除。做多智能体安全的一定要看。
这篇研究告诉你,红外视觉语言模型有多脆弱——一个 QR 风格的边角补丁就能让 OpenAI CLIP 准确率从 98.67% 跌到 0.70%,还能黑盒攻击其它模型。搞安全或对抗训练的值得一看。
Refploit能自动修复代码智能体生成漏洞利用时出错的部分,用DeepSeek-V4-Flash在143个Java漏洞上做到80.2%成功率,比PoCGen和GPT-5.4驱动的Codex都强。搞漏洞研究的人可以关注。
想了解GPT-5 mini、Gemini 3 Flash、DeepSeek Chat谁更适合Scrum考试?这篇论文用993道真题实测了准确率和稳定性,还分析了典型错误原因。
编程Agent技能选不好?这篇论文用自回归解码一次搞定技能组合和顺序,在SkillsBench上直接涨了18到23个点,比传统检索还省token。
想搞形式化验证代码生成?这篇论文的 AxDafny 用验证器做迭代修复,把 Dafny 编程题的验证成功拉到 92.7%,比之前的最好方法还高 6.5 个百分点。
这篇论文的方法很实在,用多模态搜索加整体判断,在ARC-AGI-2上做到了72.9%,比GPT-5.2 Pro高了将近19个点,代码还开源了。
这篇论文提出一个叫AutoTrainess的智能体,能自己跑模型训练流程,不用人盯着。在PostTrainBench上比纯命令行强,还能帮DeepSeek-V4涨分。
如果你对多语言OCR或印地语文本识别感兴趣,这篇论文揭示了主流模型在天城体上的真实差距,尤其是GPT-5.5表现不如开源Qwen3-VL-8B。
Nature Medicine那篇论文把模型考倒了,但作者直接把考卷开源了。后来GPT-5.5 Pro重新考,分数涨了10%!
动物福利问题有了AI专属的代理基准TAC,实测Claude Opus 4.7刚过一半,加个提示词能暴增60%,暴露了模型在实际行动中的盲区。