11:39官方账号arXiv cs.LG@Benjamin Turtel, Paul Wilczewski, Kris Skotheim, Ville A. Satopää, Philip E. Tetlock该研究比较了五种不同的评分规则作为二元预测训练目标。Brier训练的模型在Brier分数和AUC-ROC指标上表现最佳,而log训练的模型在log分数和校准误差上最优。不同评分规则下的模型在偏差、信息和噪声组合上存在差异,即使总体性能相近。论文LLM评分规则预测模型推荐理由:这篇论文分析了不同评分规则对LLM预测行为的影响,帮你理解如何选择合适的训练目标。原文稍后读已读值得跟进有用关注 LLM
12:37官方账号arXiv cs.LG@Jef Jonkers, Glenn Van Wallendael, Luc Duchateau, Sofie Van Hoecke精选该论文提出了一种针对右删失生存数据的概率预测评分框架。传统评分规则(如CRPS、Brier分数)在事件时间仅部分观测时无法直接应用。作者通过将预测分布映射到删失机制下的观测数据分布,再应用标准评分规则,得到了局部化和边缘化的删失版本评分。该框架统一了删失似然和IPCW准则,并证明了在条件独立删失下评分的适当性。实验表明,该方法能正确排序预测模型,而基于插值的加权评分可能出现排序反转。论文生存分析右删失数据概率预测推荐理由:生存分析中右删失数据是常态,这篇论文为概率预测的评估提供了理论严谨的评分框架。做生存建模、临床试验或可靠性分析的团队,可以直接用这些评分来训练和评估模型,避免传统方法的偏差。原文稍后读已读值得跟进有用关注 生存分析