产品精选

LangChain 实测 Jev 当智能体评估裁判:比 Claude 便宜 83 倍

We tested Jev against GPT-5.6 Luna, GPT-5.6 Terra, and Claude Sonnet 4.6 as agent-eval judges. ✅ Je...

精选理由

LangChain 实测 Jev 当智能体评估裁判:单次 0.44 秒、整轮 0.34 美元,比 Claude 便宜 83 倍。

LangChain 把 Jev 与 GPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6 同场测试智能体评估(agent-eval)裁判角色。Jev 每次判定都与人类评审一致,方差最多低 913 倍。速度上 Jev 单次判定 0.44 秒,三个 LLM 为 2.16-2.83 秒。完整跑一轮的成本 Jev 为 0.34 美元,Claude Sonnet 4.6 为 28.17 美元,相差约 83 倍。

原文 · LangChain

We tested Jev against GPT-5.6 Luna, GPT-5.6 Terra, and Claude Sonnet 4.6 as agent-eval judges. ✅ Je...

We tested Jev against GPT-5.6 Luna, GPT-5.6 Terra, and Claude Sonnet 4.6 as agent-eval judges. ✅ Jev matched a human reviewer on every call, with up to 913x lower variance, at 0.44s per call vs 2.16-2.83s for the LLMs. ✅ Cost for the full run: $0.34 with Jev. $28.17 with Claude Sonnet 4.6. 💬 0 🔄 1 ❤️ 5 👀 729 📊 1 ⚡