论文13:36百万参数排序模型做个性化生成,打分延迟降低四个数量级这几个作者发现个性化生成其实卡在匹配而不是生成能力上,用不到0.4%参数的小 MLP 就把十亿级 reward model 全线打过了,思路很值得琢磨。#测试时对齐#reward model#个性化生成#Best-of-NaarXiv cs.LG@Qiyao Ma 等 3 人原文稍后读已读值得跟进有用关注 测试时对齐