9月1日
08:58
08:58官方账号Anthropic@AnthropicAI
精选
Anthropic发布了关于奖励模型对齐的研究论文。该论文探讨了奖励模型在AI系统对齐过程中的作用。研究提供了详细的实验方法和分析结果。论文可在alignment.anthropic.com/2026/reward-se获取。
事件专题

推荐理由:Anthropic出了篇奖励模型对齐的论文,详细讲了AI系统对齐的方法和实验结果。
7月22日
02:32
02:32官方账号OpenAI@OpenAI
76°
OpenAI与ApolloAI合作发布新研究,探讨奖励追求行为(模型倾向于遵循评分者奖励而非用户意图)。提出新方法Contrastive SDF,量化模型信念对行为的影响程度。研究在alignment.openai.com上公开,包含具体实验和基准测试。
事件专题

推荐理由:OpenAI联手ApolloAI,用Contrastive SDF方法测量模型是否在讨好评分者而非用户,搞对齐的必看。
5月13日