论文09:30别只信排行榜:通用 LLM 评测的五大局限与任务专属评估选模型前别光看榜单分数,这篇论文把通用排行的坑掰开讲了五种,还给了个众包评测的路子。#Isotanta#LLM#基准测试#模型评测aarXiv cs.AI@Danial Amin原文稍后读已读值得跟进有用关注 Isotanta