事件专题 ·官方一手

arXiv 研究:LLM 智能体的群体偏袒源于观察到的规范而非标签本身

一项 arXiv 研究测试了 15 个 OpenAI 模型和 3 个 Claude 模型,在约 4,400 个虚拟社会、330 万次模型调用中观察群体偏袒行为。结果显示,当分配点数没有代价时才会出现明显的群体标签效应;一旦智能体可以保留点数,该效应在所有模型上消失。在有利害冲突时,交互历史成为偏袒的主要来源,13/15 个模型上历史效应显著,11 个模型上达到 3.5-8 分(满分 10 分)。当智能体所属群体被设定为偏袒对方时,偏袒会反转;较强模型会更看重个人记录而非群体标签。

当前结论

测了 18 个模型、330 万次调用,发现 LLM 偏袒自己人不是看标签,而是看别人怎么做,挺有意思的结论。

11 个信源38° AI 热度最后更新 2026/10/7 23:46:37

证据链

11 个信源
相关来源 5Simon Willison’s Weblog
查看原文
相关来源 10掘金本周最热
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。