论文Agent 与开发者09:23研究评估预训练模型对 AI 生成教育题目的布鲁姆分类效果想做 AI 出题自动质检的可以看看:论文实测了 LLM、BERT、传统 ML 在布鲁姆分类上的 OOD 表现,LLM 拿到 0.79 的 F1,还给了几个低成本补救手段。#Bloom Classifier#LLM#BERT#教育评估1 个信源在谈事件专题aarXiv cs.AI@Michael Lawrence Castanares 等 3 人2 个信源在谈原文稍后读已读值得跟进有用关注 Bloom Classifier