主要来源DAIR.AI
查看原文事件专题 ·多源确认
JEV 论文:廉价评审级联可省约 43% 评测成本
TypeSafe AI 发布 Jev-as-a-Judge 论文,介绍只输出判定结果和标签概率、不含推理文本的决策型评审模型 JEV。在 510 个保留偏好对上,把 JEV 的置信判定留下、不确定案例升级给 GPT-6 Astra 的级联方案,保留了 GPT-6 约 99% 的准确率,费用约为其 57%。JEV 单价为每千次判定 0.044 美元、中位延迟 0.152 秒,比 GPT-6 的 12.182 美元和 1.885 秒便宜约 277 倍。在 RewardBench 上 JEV 拿到 92.2%(GPT-6 为 93.5%),HaluEval 上为 87.5%(GPT-6 为 86.7%),但 JudgeBench 上差距扩大到 78.6% 对 93.1%。作者提醒升级阈值并非对所有备用模型通用,建议在自己的数据上重新设定。
当前结论
一篇讲怎么省评测钱的论文:便宜的 JEV 先判断,拿不准的才丢给 GPT-6,成本砍掉四成多,准确率几乎不掉。
11 个信源73° AI 热度最后更新 2026/9/24 15:40:02
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。