11:47官方一手arXiv: OpenAI@Til Jordan研究人员测试了九个来自三家公司的大语言模型,探究门脸效应(先提大要求被拒后再提小要求)是否有效。在Anthropic的Opus 5模型上,该技术使合规率从29.3%提升至65.8%。但在OpenAI和Google的前沿模型以及Haiku 4.5上,反而降低了15.5至23.0个百分点的合规率。研究发现,拒绝行为本身对所有模型都有影响,但模型家族对拒绝的反应各不相同。论文Opus 5门脸效应拒绝行为10 个信源在谈事件专题推荐理由:Anthropic模型对人类说服技巧有反应,而OpenAI和Google模型反而更抗拒,这种差异很有意思。原文稍后读已读值得跟进有用关注 Opus 5
11:44官方一手arXiv: Anthropic@Lukas Weidener, Marko Brkić, Mihailo Jovanović, Emre Ulgac, Aakaash Meduri精选72°RefusalBench是一个新的基准测试,包含141个提示(47组),通过保持任务框架不变、仅改变生物风险等级(良性、边缘、双重用途),来评估前沿大语言模型在合法生物研究提示上的拒绝行为。在2026年5月的19个前沿模型快照中,严格拒绝率从0.1%到94.6%不等,且拒绝率不能准确反映安全校准水平。例如,Grok 4.20在风险区分度上表现最佳(Youden's J = 0.787),但整体拒绝率仅排第七;Claude Opus 4.7的区分度较之前版本下降65%。该研究还发现,18个模型中有9个在双重用途提示上表现出“回避但帮助”的部分合规模式,而二元拒绝指标无法检测到这一点。论文安全评估基准测试生物研究推荐理由:做AI安全评估或生物研究合规的团队,这个基准能帮你避开“拒绝率越高越安全”的误区——Grok 4.20的案例值得点开看看。原文稍后读已读值得跟进有用关注 安全评估