09:09官方账号arXiv cs.LG@Yotam Eshel, Guy Hadad, Guy Feigenblat, Yuri M. Brovman, Matt Gearhart, Bracha ShapiraDeepAffinity利用小型语言模型预测用户对产品品牌、尺寸、颜色等方面的长期偏好。该模型通过结构化提示和专用预测头进行微调,在基准测试中优于标准生成式微调方法。研究显示通用开源大模型缺乏任务特定调优时表现不佳,难以捕捉细微行为模式。该系统已在大型跨国电商平台提升推荐质量。论文DeepAffinitySLMs电商推荐推荐理由:DeepAffinity用小模型预测电商用户长期偏好,比大模型更精准,已落地提升推荐效果。原文稍后读已读值得跟进有用关注 DeepAffinity
02:24lmarena.ai@lmarena_ai精选AutoEval团队训练了一个奖励模型,专门应对偏好漂移、模型差异细微、平局投票以及长上下文依赖交互等挑战。评估采用时间留出法:用历史投票训练,测试后续发布的模型。早期评分与实时排名的排名相关性超过0.98。该文本奖励模型预测人类偏好的准确率比前沿LLM裁判高8-10%,可作为人类投票积累前的早期排行榜信号。AI模型AutoEval奖励模型偏好预测推荐理由:Chai团队搞了个AutoEval奖励模型,预测人类偏好比GPT-4之类还准8-10%,新模型刷榜前先看它评分,省得等人类投票。原文稍后读已读值得跟进有用关注 AutoEval