论文精选
npj Digital Medicine 论文:用大模型当裁判评估临床生成式 AI
Large language models as judges for clinical generative AI evaluation
精选理由
医疗 AI 输出质量很难逐条人工评审,这篇 npj Digital Medicine 论文讨论用大模型当裁判自动打分,做医疗评估的可以看看思路。
《npj Digital Medicine》于2026年9月25日在线发表一篇关于临床生成式 AI 评估的研究,主题为 LLM-as-a-judge 方法。论文探讨将大语言模型用作自动裁判,对医疗场景中的生成式 AI 输出进行评估。该方法面向临床评估任务,替代部分人工评审环节。
原文 · npj Digital Medicine
Large language models as judges for clinical generative AI evaluation
npj Digital Medicine, Published online: 25 September 2026; doi:10.1038/s41746-026-03248-3 Large language models as judges for clinical generative AI evaluation