主要来源arXiv: OpenAI
查看原文事件专题 ·官方一手
arXiv 研究:LLM 智能体的群体偏袒源于观察到的规范而非标签本身
一项 arXiv 研究测试了 15 个 OpenAI 模型和 3 个 Claude 模型,在约 4,400 个虚拟社会、330 万次模型调用中观察群体偏袒行为。结果显示,当分配点数没有代价时才会出现明显的群体标签效应;一旦智能体可以保留点数,该效应在所有模型上消失。在有利害冲突时,交互历史成为偏袒的主要来源,13/15 个模型上历史效应显著,11 个模型上达到 3.5-8 分(满分 10 分)。当智能体所属群体被设定为偏袒对方时,偏袒会反转;较强模型会更看重个人记录而非群体标签。
当前结论
测了 18 个模型、330 万次调用,发现 LLM 偏袒自己人不是看标签,而是看别人怎么做,挺有意思的结论。
11 个信源38° AI 热度最后更新 2026/10/7 23:46:37
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。