论文14:34Jev 1.13 医疗基准评测:准确率逊于 GPT-6 Sol 但校准更佳有人拿非生成式模型 Jev 1.13 和 GPT-6 Sol 在四个医疗基准上跑了对比,便宜快十倍但复杂病例上差 20 多个百分点,概率校准数据挺有意思。#Jev#GPT-6 Sol#MetaMedQA#PubMedQAaarXiv cs.LG@Alfredo Madrid-García, Beatriz Merino-Barbancho原文稍后读已读值得跟进有用关注 Jev