主要来源shao__meng
查看原文事件专题 ·多源确认
Claude Code 新增 /build-eval 和 /hillclimb 命令,评测设计流程开源
Anthropic 的 RLanceMartin 在博客中把评测设计和爬山优化产品化为 Claude Code 的两个命令:/claude-api build-eval 和 /claude-api hillclimb,对应 Skills 开源在 claude-api skill 仓库。评测方面强调任务要镜像生产、评分器要先用程序化验证再用 LLM-as-judge,且裁判不能是被测模型。爬山方面核心是防过拟合:训练集升但测试集平就回滚,并禁止把失败案例内容直接粘贴进 prompt。两个案例给出了具体数字:客服成本优化从 74.4% 决策准确率、4.6 美分/单,降到 90.5% 准确率、约五分之一成本;claude-api skill 自身从 66% 提到约 88%。
当前结论
Anthropic 把评测设计和爬山优化直接做成 Claude Code 命令了,还开源了 Skills,两条防过拟合纪律和客服降本 80% 的案例都挺实在。
11 个信源61° AI 热度最后更新 2026/9/29 02:36:47
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。