论文政策与合规10:01研究:后训练决定大模型是否会做出言行不一的道德选择同一份 Llama-3.1 权重,Meta 配方训出的模型会违背自己道德判断行事,Tulu 3 却不会,差距原来出在后训练。#OLMo-3#Tulu 3#Llama-3.1#Qwen2.5aarXiv cs.LG@Orion Reblitz-Richardson原文稍后读已读值得跟进有用关注 OLMo-3