09:09官方账号arXiv cs.LG@Yotam Eshel, Guy Hadad, Guy Feigenblat, Yuri M. Brovman, Matt Gearhart, Bracha ShapiraDeepAffinity利用小型语言模型预测用户对产品品牌、尺寸、颜色等方面的长期偏好。该模型通过结构化提示和专用预测头进行微调,在基准测试中优于标准生成式微调方法。研究显示通用开源大模型缺乏任务特定调优时表现不佳,难以捕捉细微行为模式。该系统已在大型跨国电商平台提升推荐质量。论文DeepAffinitySLMs电商推荐推荐理由:DeepAffinity用小模型预测电商用户长期偏好,比大模型更精准,已落地提升推荐效果。原文稍后读已读值得跟进有用关注 DeepAffinity
11:40官方账号arXiv cs.LG@Emma Ceccherini, Daniel Lawson, Anjulika Salhan研究分析了SBERT和DeBERTa预训练模型的嵌入几何结构,发现财务语料库的句子嵌入空间由与供应商身份强相关的局部各向同性簇组成。在单个GPU上微调的SBERT在发票分类任务上达到0.96的准确率,优于零样本LLM和供应商身份基线。对于这一重要泛化问题,SBERT仅需约100个客户特定发票即可达到0.9的F1分数,表明内部SLM实施方案具有良好前景。论文SBERTDeBERTa发票分类推荐理由:研究显示小型语言模型通过嵌入几何分析,在发票分类上超越大模型,仅需少量样本就能达到高准确率。原文稍后读已读值得跟进有用关注 SBERT
11:15官方账号arXiv cs.LG@Jianru Shen精选该研究评估了11个指令微调模型在ARC-Challenge和TruthfulQA上的25,168次预测,参数规模从0.5B到14B。理论证明严格单调校准可保持风险覆盖前沿和错误检测AUROC,而温度缩放无法校准置信度恒高于准确率的模型。Clopper-Pearson方法可将200题校准集转化为有限样本风险证书。实证显示8/22个模型-任务对逼近温度缩放不可行下限,Platt缩放将ECE降至0.02。20%风险预算下仅3个模型-任务对获得认证自主权,10%预算下为零,并修复了TruthfulQA多项选择的答案顺序伪影。论文ARC-ChallengeTruthfulQA不确定性校准推荐理由:这篇论文测了11个小模型,发现温度缩放有校准不了的边界,用200道题就能算风险上限,20%风险预算下只有3个敢放手用。原文稍后读已读值得跟进有用关注 ARC-Challenge