06:48Claude@claudeaiClaude模型在Terminal-Bench-Science 0.1测试中得分为52.6%,是Fable 5的两倍多。在Terminal-Bench 4.0测试中,Claude得分为55.8%,而Fable 5为42.0%。这些成绩表明Claude在科学任务和综合能力方面表现优异。AI模型ClaudeFable 5Terminal-Bench-Science6 个信源在谈事件专题推荐理由:Claude在两项重要基准测试中大幅领先Fable 5,科学任务得分翻倍,综合能力提升13.8%。原文稍后读已读值得跟进有用关注 Claude
04:38官方一手marktechpost@Asif Razzaq73°Anthropic发布了Claude Fable 5.1和Claude Mythos 5.1两个版本模型。Fable 5.1在Terminal-Bench-Science 0.1基准测试中得分为52.6%,较Fable 5的24.7%有显著提升。新模型支持1M token上下文窗口,缓存读取成本降低75%至每百万token 0.25美元。Fable 5.1已开放API访问,而Mythos 5.1仍限制在Glasswing项目内的经过审核的组织使用。AI模型ClaudeFableMythos10 个信源在谈事件专题推荐理由:Anthropic推出Claude 5.1双版本,科学基准分翻倍,缓存成本降75%,API有重大变更原文稍后读已读值得跟进有用关注 Claude
04:29官方账号Decoder@Matthias Bastian73°Anthropic推出Claude Fable 5.1和Mythos 5.1,这是其迄今为止最强大的AI模型。Fable 5.1在Terminal-Bench-Science基准测试中的得分比前代提升一倍,智能体编码能力提高30%。长程自主运行且包含大量工具调用的场景下,成本降低最高达45%。AI模型ClaudeFable 5.1Anthropic10 个信源在谈事件专题推荐理由:Anthropic新发布的Fable 5.1模型在科学基准测试中翻倍得分,编码能力提升30%,同时成本降低45%。原文稍后读已读值得跟进有用关注 Claude
21:28Stanford AI Lab@StanfordAILabTerminal-Bench-Science是一个评估AI代理在科研工作流表现的基准测试。该基准由斯坦福大学领导,v0.1版本包含70个任务。Claude Opus 5仅能解决约30%的任务。这是Terminal-Bench团队与全球科研机构科学领域专家共同开发的成果。AI模型Terminal-Bench-ScienceClaude科研基准推荐理由:斯坦福发布了科研AI代理基准Terminal-Bench-Science,Claude Opus 5仅完成30%,看看你的模型表现如何。原文稍后读已读值得跟进有用关注 Terminal-Bench-Science