9月1日
10:48
10:48官方账号arXiv cs.LG@Boryeong Cho, Sumyeong Ahn, Se-Young Yun
精选73°
PLC-DPO方法通过将每对训练信号路由为清洁、翻转或平局情况,优化偏好学习。该方法在57个数据集-模型-基准测试单元中,平均胜率达60.5%,超过DPO方法的55.5%。注入噪声测试和人类分歧分析表明,该方法能稳定区分翻转与弱方向性偏好对。
推荐理由:研究人员提出PLC-DPO,能校正噪声偏好数据,在57个测试单元中胜率超DPO 5个百分点。
7月29日
11:35
11:35Fireworks AI@FireworksAI_HQ
精选
Fireworks为DeepSeek V4 Flash新增微调能力,支持监督微调、偏好调优和组合偏好优化。用户可通过训练API进行强化学习,面向编码代理和高吞吐量生产场景。企业现可联系Fireworks(fireworks.ai/contact-traini…)使用该功能。
事件专题

推荐理由:Fireworks给DeepSeek V4 Flash加了全套微调,监督、偏好、RL都能用,专为编码场景设计,快去试试。