09:09官方账号arXiv cs.AI@Yi Yu, Bo Wang, Chong Feng, Ge Shi, Xia Liu, Ziyi Yang, Xuewen Shi精选73°SUP-MIMIC 是一个基于 MIMIC-IV-v3.1 的多任务框架,包含基础评估(BA)、诊断发散任务(DDT)和诊断收敛任务(DCT)。DDT 评估模型对表型相似病例的"一对多"区分能力,DCT 评估模型对不同病理通路的"多对一"诊断模式识别能力。研究显示,最先进 LLM 在 DDT 和 DCT 上的性能显著下降,暴露了模型对统计捷径的系统性依赖。论文SUP-MIMICLLMsMIMIC-IV-v3.1推荐理由:SUP-MIMIC 基准测试揭示了 LLM 在临床诊断推理中的缺陷,特别是对矛盾证据的处理能力不足。原文稍后读已读值得跟进有用关注 SUP-MIMIC
11:13官方账号arXiv cs.AI@Rui Yang, Weihao Xuan, Yi Lin, Zhuhan Bao, Jonathan Chong Kai Liew, Matthew Yu Heng Wong, Nicolás Lescano, Nikita R. Paripati, Emily Ling-Lin Pai, Jiarui Liu, Heli Qi, Heng-Jui Chang, Benny Kai Guo Loo, Huitao Li, Kunyu Yu, Yufan Wang, Chuan Hong, Shijian Lu, Douglas Teodoro, Naoto Yokoya, Ross Koppel, Mona Diab, Hua Xu, David W. Bates, Nan Liu, Yifan PengClinMM-Bench是迄今最大的多轮多模态临床诊断评估基准,包含1089个真实临床案例和3760张医学图像,覆盖8个专科。研究使用两级评估框架,对15个代表性多模态大模型进行诊断准确性和推理质量评测。结果显示,专有模型总体准确率最高,但完全正确诊断的比例仍很低。错误分析识别出信息整合失败、知识映射错误、感知错误、过早闭合和视觉幻觉五种典型失败模式。论文ClinMM-Bench多模态大模型临床诊断推荐理由:临床诊断AI评估有新基准了!1089个真实案例、3760张影像,15个模型测试下来发现,再好的模型完全正确诊断率也不高,而且容易犯信息整合错误和视觉幻觉。原文稍后读已读值得跟进有用关注 ClinMM-Bench
14:48官方账号arXiv cs.LG@Aashna P. Shah, Michelle M. Li, Yash Lal, Seffi Cohen, Liat F. Antwarg, Morgan Sanchez, James A. Diao, Chirag J. Patel, Ben Y. Reis, Ran D. Balicer, Noa Dagan, Arjun K. Manrai精选血液生物标志物是临床诊断的关键,但传统参考区间基于固定人群,忽略了个体间稳定变异,可能掩盖偏离基线的异常。研究者利用北美、中东和东亚超过160万人的近20亿条纵向实验室数据发现,纯个性化参考区间会将高达68%的测量值标记为异常,且与不良临床结局无关。为此,他们提出NORMA,一个基于条件Transformer的框架,通过结合患者历史数据和人群正常变异生成参考区间。NORMA在预测死亡率、急性肾损伤和慢性疾病等结局上精度更高,优于纯个性化或纯人群方法。模型、代码和交互界面已公开,旨在推动实验室检测的个性化解释。论文血液生物标志物个性化参考区间条件Transformer推荐理由:NORMA解决了实验室检测中过度个性化导致的假阳性问题,做临床诊断或健康监测的医生、研究者可以直接用这个开源模型来提升异常检测的准确性。原文稍后读已读值得跟进有用关注 血液生物标志物