论文Agent 与开发者09:37用引用量作为奖励信号训练 LLM 生成高影响力科研想法这帮人拿 10 万篇 CS 论文的引用量当奖励,训练 LLM 生成更可能被高引用的科研点子,还专门设计了防作弊的评估办法,思路挺有意思。#强化学习#奖励模型#科研想法生成#微调aarXiv cs.AI@Shubham Kale 等 3 人原文稍后读已读值得跟进有用关注 强化学习