全部动态

AI 相关资讯全量信息流 · 68 条
6月9日
论文多源确认精选72°09:40
Scaffold 选择影响 GAIA 准确率高达 28 个百分点:模型能力评估需谨慎

做 AI 模型评测或选型的人必须看——这篇研究用严格对照实验证明,你看到的模型能力分数可能更多反映的是 scaffold 设计而非模型本身,建议重新审视自己的评估流程。

事件专题
arXiv: Anthropic@Jason Starace11 个信源在谈原文
6月7日
6月6日
6月5日
6月4日
5月30日
5月29日
5月27日
5月21日
5月20日
5月19日
论文中美对照多源确认精选76°12:55
Deep Research Agent 评测基准:管理咨询任务中 Claude、o3、Gemini 表现均不佳

管理咨询团队和依赖AI做深度分析的开发者会震惊——三个最先进的DRA在专家级任务中通过率不到22%,且各有致命短板。想避免被AI的自信输出误导,建议仔细看这篇评测的失败模式分析。

事件专题
arXiv: OpenAI@Tanmay Asthana 等 3 人11 个信源在谈原文
5月17日
5月16日
5月15日
5月14日
5月11日