全部动态
用贝叶斯方法修LLM当裁判时的废话偏好和位置偏差,实测召回从0.5拉到接近1,比直接投票靠谱多了。
这篇论文真正解决了AI审计“光列风险但不教你怎么测”的痛点,用GPT-4实测PII泄露,给了一个可复现的评分样例。分类法开源了,想搞审计的可以直接用。
这篇论文搞了个标准协议EPC,专门用来测LLM代理系统里评估器偏好怎么耦合的,还附带了GPT-4o、Qwen、DeepSeek等8个评估器的大规模实测数据,方便你复现和对比。
IBM 搞了个专门测 AI 代理迁移 Java 框架的基准,看看现有模型能不能搞定企业级代码迁移,结果发现连 GPT-4 都挺费劲。
想看看 AI 在真实电脑操作上能走多远?OSWorld2.0 拿 100 个长任务测智能体,GPT-4o 都只拿到 15% 成功率,差距一目了然。
这篇论文实打实比较了GPT-4o、Mistral和DSIT-Taxonomies在提取基金提案实体上的能力,Mistral准确率90.5%碾压对手,做科研数据挖掘的可以看看。
零样本GPT-4o当教育顾问爱多管闲事?实测误报率43%,换成Decision Transformer或XGBoost就能准到几乎零误报。
想了解多智能体LLM之间怎么互相影响输出?这篇论文给出了可量化框架CAF,还拿DeepSeek和GPT-4o-mini做了实验,能看到图像条件会放大耦合效应。
OpenAI 的 GPT-5.6 Sol Preview 悄悄在 Cursor 里测试,上下文直接拉到 1M,能一口气吞整本小说了。
这篇论文让AI玩三方狼人杀,发现GPT-4.1狼人总犯傻投票出Jester,而DeepSeek学会了装可疑又不露馅。想看看AI怎么玩心眼?读它。
Epoch AI 搞了个新基准 MirrorCode,让 AI 连续写几天代码,最强模型能干人类几周的活,想看看 AI 编程天花板在哪可以关注。
想看看你用的LLM在多工具长流程场景下到底多靠谱?PlanBench-XL用上千个工具设计了真实任务链,测出来主流模型成功率不到40%,值得一测。