10:18官方账号arXiv cs.AI@Aditya Bhattacharjee, Christos Plachouras, Sungkyun Chang, Emmanouil Benetos该报告介绍了针对AES AIMLA 2025挑战的声效查询方法,通过语音模仿实现。采用两种微调策略,一是冻结预训练CED编码器的对比学习,二是用MobileNetV3编码器的联合对比三元组学习。该报告更新后补充了挑战后公开的详细信息。论文CED encoderMobileNetV3AIMLA 2025推荐理由:你同事那篇声效查询微调方案,用语音模仿来操作,和之前方法比效果不同,值得看看。原文稍后读已读值得跟进有用关注 CED encoder
09:18官方账号arXiv cs.LG@Yi Xu, Cheng Chen, Mufan CaoOrthKD提出一种选择性信任知识蒸馏框架,针对强CNN教师(EfficientNet-B3,0.876 QWK)与弱Transformer教师(Swin-Base,0.830 QWK)的互补性,仅从强教师转移完整监督,从弱教师提取特征,并强制学生投影正交化。在132049张视网膜图像上,5.4M参数的MobileNetV3学生模型在EyePACS上达到0.885 QWK,零样本Messidor-2性能从0.507提升至0.728 QWK,同时具备强转诊AUC和校准能力。该方法在资源受限设备上实现了实用的DR筛查。论文OrthKDEfficientNet-B3Swin-Base推荐理由:论文提出OrthKD蒸馏方法,用异构教师知识教轻量模型,DR筛查准确率从0.507涨到0.728,适合边缘部署。原文稍后读已读值得跟进有用关注 OrthKD