主要来源Artificial Analysis
查看原文事件专题 ·多源确认
Claude Opus 5.5 登顶 Artificial Analysis 编程智能体指数,但单任务成本更高
Anthropic 的 Claude Opus 5.5 在 Artificial Analysis Coding Agent Index 拿到 66 分,排名第一,比 Opus 5(60 分)高 6 分,比 Claude Fable 5.1(62 分)高 4 分。三项评测全部提升:Terminal-Bench 4.0 从 54.5% 升到 63.1%,DeepSWE v1.1 从 62.5% 升到 68.4%,SWE-Atlas-QnA 从 62.1% 升到 66.4%。价格降到每百万 tokens 输入 $4、输出 $20(Opus 5 为 $5/$25),缓存读取从 $0.50 降到 $0.20。但单任务成本从 $10.79 涨到 $13.04,因为每个任务消耗约 1560 万 tokens,输出 tokens 约为 Opus 5 的 2.4 倍。
当前结论
Anthropic 的 Opus 5.5 在编程智能体评测拿第一,三项基准都涨了,价格还降了 20%,不过每任务要烧 13 美元 tokens,用前算算账。
11 个信源83° AI 热度最后更新 2026/9/24 01:24:22
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。