09:08官方账号arXiv cs.LG@Zi-Jian Cheng, Zi-Yi Jia, Zhi Zhou, Yu-Feng Li, Lan-Zhe Guo精选73°SymboLLM-FE结合符号回归与大型语言模型,在6个真实数据集和4个Kaggle竞赛中表现优于现有AutoFE方法。该模型通过符号回归提取与目标强相关的数学公式,再利用LLM的丰富先验知识进行优化,确保特征可解释性。SymboLLM-FE采用基于统计先验的LLM优化机制,仅需个位数次的LLM调用即可解决传统AutoFE的可解释性差和迭代次数多的问题。论文SymboLLM-FE符号回归特征工程推荐理由:SymboLLM-FE用符号回归+少量LLM调用,解决了表格数据特征工程的可解释性和效率问题,比现有方法更实用。原文稍后读已读值得跟进有用关注 SymboLLM-FE
12:36官方账号arXiv cs.LG@Soorya Ram Shimgekar, Michelle Hu, Dorisa Shehi, Daniel Kang, Roy Ka-Wei Lee, Koustuv Saha, Christian Poellabauer, Christopher Lee, Sajeev Singh, Piyum Zonooz, Navin Kumar, Zeeshan Ahmed, Priyadarshini Kachroo电子病历特征工程占数据科学家39%-45%工作量,心衰领域尤其棘手。研究者提出Nimblemind多智能体系统(nMAS),在500份模拟患者记录、9张EHR源表上生成132个结构化特征和70个评分聚合特征。加入聚合特征后,HFrEF分型的held-out AUROC从0.895升至0.963,HFpEF从0.870升至0.910。独立LLM对证据支撑与方法学评分为最高分的81.5%。论文nMAS心力衰竭电子病历推荐理由:心衰数据特征工程又慢又容易出错,nMAS自动管线把HFrEF的AUROC拉到0.963,还能审计特征来源。原文稍后读已读值得跟进有用关注 nMAS
12:25官方账号arXiv cs.LG@Ruman Wang, Hangting YeScaFE将临床知识从大语言模型转移到确定性的可执行特征程序,而非直接让模型诊断图像。在来自三家医院的600张照片上,ScaFE达到81.0%的站点宏平衡准确率,比最强基线BiomedCLIP高出10.0个百分点。仅用10%的开发数据时,ScaFE保持72.0%的平衡准确率,仍领先11.8个百分点。迭代修复将可执行程序率从66.7%提升到95.0%,91.7%的最终特征有验证证据。该方法表明LLM知识能通过本地可审计的特征程序支持跨医院的医学图像分类。论文ScaFELLMBiomedCLIP推荐理由:这篇论文发了个叫ScaFE的方法,让LLM写图像特征程序来分类疤痕,照片不用出本地,比BiomedCLIP高10个点,数据少也够用。原文稍后读已读值得跟进有用关注 ScaFE