CursorBench

product · 首次出现 2026-05-23 · 最近出现 2026-09-22 · 累计提及 46

综述

CursorBench是Cursor公司开发的AI编程模型性能基准测试系统。2024年,CursorBench 4.0版本发布,替代了原有的公开基准评测模型,成为评估AI编程能力的重要标准。该基准测试通过token和step等指标,全面衡量AI模型在编程任务中的表现。

CursorBench 近期进展

  • 2024年7月,Claude Opus 5.5在CursorBench评测中登顶,展现了卓越的编程能力。Claude Opus 5.5 上线 Cursor,登顶 CursorBench
  • CursorBench 4.0数据显示,Gemini 3.8 Flash在token和step指标上表现突出,展现了高效的处理能力。CursorBench 4.0 数据显示 Gemini 3.8 Flash 在 token 和 step 上表现突出
  • Kimi K3在CursorBench上得分接近前沿水平,同时支持零数据保留功能,为用户提供隐私保护。Kimi K3 已上线 Cursor,CursorBench 得分接近前沿
  • SpaceXAI发布的编程模型Grok 4.7支持百万词元输入,价格从2美元起,在Cursor平台上进行了测试。SpaceXAI 发布编程模型 Grok 4.7:百万词元输入 2 美元起
  • 当前焦点与观察点

    CursorBench作为AI编程能力评测标准,正逐渐成为行业重要参考。数据显示,6%的用户选择Anthropic Fable 5模型,价格因素显著影响用户支出决策。Anthropic Fable 5 模型占比6%,价格差距影响支出

    值得注意的是,Claude Opus 5虽然智能接近Fable 5,但价格减半,性价比优势明显。Claude Opus 5 发布,智能接近 Fable 5 价格减半

    随着AI编程模型竞争加剧,CursorBench的评测结果直接影响用户选择和模型发展方向,预计未来将有更多模型针对该基准进行优化。

    相关报道

    10 条在档