9月2日
09:33
09:33官方一手arXiv: DeepSeek@Huimin Wang, Zhengyi Zhao, Yutian Zhao
精选73°
ClinTraceBench 包含 385 个来自 MIMIC-IV 的验证对话,采用九项任务分类和 L0-L4 确定性验证。研究评估了八种历史表示策略,包括检索、压缩方案和智能体记忆系统,在 6,271 个问题上进行了 200,672 次预测。研究发现压缩策略在多访视趋势和跨患者比较上存在聚合损失,盲法与全上下文方法差距达 29.8-62.7 个百分点。
推荐理由:斯坦福团队发布临床推理基准,测试八种历史表示策略,发现压缩导致关系损失,小模型 Haiku 在全上下文下超越大模型 Sonnet。
8月25日
10:41
10:41官方账号arXiv cs.AI@Naman Garg, Sarika Jain, George Fazekas
Semiintelligencn团队针对ACM RecSys 2026 TalkPlayData挑战赛提出多模态个性化对话音乐推荐系统,采用三阶段流程:多模态检索、轻量级重排序和GPT-4o-mini个性化响应生成。优化RRF权重提高MRR+19.5%,提交系统在Blind B测试中得分0.3213。
推荐理由:Semiintelligencn团队提出的多模态音乐推荐系统,结合了多种技术和模型,优化了推荐效果,值得一试。