事件专题 ·官方一手

研究实测 JEV 与 LLM 在七项政治学复现任务中的准确率与成本

arXiv 论文对比了 TypeSafe 推出的 System One 类模型 JEV 与 GPT-6 Luna、Qwen3.8-27B 在七个政治学文本复现任务上的表现。结果显示 JEV 的准确率接近两个 LLM,但按 OpenAI 批处理价格计算并无成本优势。单次提问时 JEV 的概率校准优于 GPT-6 Luna 的 token 概率,但不稳定地优于 Qwen3.8-27B。论文结论是除非研究者特别需要速度,JEV 的明显优势只剩解析选择概率更方便。

当前结论

想用模型标注文本的研究者可以看看:JEV 号称便宜快,实测发现便宜不成立,校准也只赢了一半。

11 个信源31° AI 热度最后更新 2026/10/5 16:22:03

证据链

11 个信源
相关来源 2Simon Willison’s Weblog
查看原文
相关来源 4Clement Delangue
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。