11:24官方账号arXiv cs.AI@Jing Huang, Jihong Zhang, Hua-Hua Chang针对大规模评估中内容冗余问题,提出基于LLM的AISA框架,通过结构分解和语义相关性实现相似性度量。心理测量验证表明,LLM指标与传统文本指标相比,更符合结构无关性局部依赖指标,并产生更一致的参数分组。应用在计算机自适应测试中,LLM相似性约束提高了估计稳定性和减少了偏差,优于传统指标。论文LLM内容相似性分析AISA框架推荐理由:这篇论文提出了一种新的双维度LLM框架,可以更有效地分析大规模评估中的内容冗余问题,对于内容筛选和自适应测试有重要意义。原文稍后读已读值得跟进有用关注 LLM
09:45官方账号arXiv cs.LG@Kevin Lee, Benjamin Letham, Zhiyuan Jerry Lin, Elodie Samson, Eric Onofrey, Poppy Zhang, Shawndra Hill, Eytan Bakshy该研究提出一种离线到在线的广告创意优化流程,利用生成模型产出候选创意,并通过基于历史A/B测试数据训练的预测模型在推理时进行排序筛选。最终测试集在在线自适应实验(50臂)中验证,最佳创意比人类作者创意提升45.1%互动率,另两个实验分别提升46.7%和36.2%。尽管预测模型无法直接选出最优创意,但能有效引导生成模型产出强候选,再通过自适应实验高效评估。论文生成模型自适应测试A/B测试推荐理由:这篇论文教你用历史A/B数据+生成模型筛选创意,50臂实验最高提升45%,比人类写的强很多。原文稍后读已读值得跟进有用关注 生成模型