AITOPAI热报
今日全部早读
地区
东盟中国趋势
外观
登录 / 注册
AITOPAI热报

行为审计

共 2 条相关 AI 资讯
9月1日
11:24
11:24官方账号arXiv cs.AI@Adrians Skapars, Edoardo Manino
精选73°
研究人员推出BLOOM-WILT,一种无需训练成本的大模型行为审计管道。该方法在4个目标模型和8种行为测试中,以30/32的成绩超越基线审计器。在Qwen3.5-4B自残鼓励行为测试中,将行为出现率从51%提升至100%。WILT通过自适应重加权目标解码策略,在不降低输出概率的情况下提高行为诱导效率。
论文BLOOM-WILTQwen3.5-4B大模型安全

推荐理由:BLOOM-WILT让大模型安全审计更高效,在Qwen3.5-4B测试中行为诱导率翻倍,还推翻了原有模型安全排名。
原文
6月10日
10:09
10:09官方一手arXiv: DeepSeek@Hakan Mehmetcik
精选
该研究通过一个多智能体地缘政治兵棋推演(Cerulean Sea Crisis),测试了六种前沿大模型(GPT-4o、Llama-4、Mistral-Large、Gemini-3.1-Pro、Qwen3.6-Plus和DeepSeek-R1)在英语与土耳其语两种语言下的行为差异。结果显示,Llama-4在土耳其语下胁迫性言论显著增加,而Gemini-3.1-Pro和DeepSeek-R1则显著减少,GPT-4o无显著变化。这表明跨语言行为偏差并非西方模型的普遍特性,而是取决于模型架构和训练机制。研究识别出两种缓冲机制:思维链制度锚定和多语言RLHF对齐,对将LLM安全应用于外交和危机管理场景具有重要启示。
论文大语言模型跨语言偏差行为审计

推荐理由:这项研究揭示了LLM在跨语言场景下的行为偏差可能影响外交决策,做AI安全或国际关系应用的团队值得关注,尤其是使用多语言模型的开发者。
原文
今日全部早读东盟登录