8月31日
09:32
09:32官方账号arXiv cs.AI@Hefan Zhang, Bingquan Zhang, Ming Cheng, Saeed Hassanpour, Weicheng Ma, Soroush Vosoughi
精选
研究分析了8个分类任务、2个生成任务和30个模型的语言自信与内部自信差异。分类任务中,语言自信与基于logits的自信在关联性、幅度一致性和校准性三个维度上经常不一致。生成任务中,语言自信无法有效跟踪基于语义熵的不确定性。指令微调模型通常报告更高自信,但自信差距更大且校准更差。
推荐理由:8个分类任务+30个模型研究显示,LLM说的自信程度和实际内部自信经常不一致
7月1日
6月25日
09:45
6月19日