主要来源elvis
查看原文事件专题 ·多源确认
NVIDIA 研究:给多模态模型加工具会削弱拒绝有害请求的能力
NVIDIA 一篇被 NeurIPS 2026 接收的论文测试发现,多模态模型接入工具后拒绝有害请求的能力普遍下降,相对降幅最高达 68.7%,平均 17.7%。测试覆盖 Claude Opus 4.6 和 4.7、Gemini Agentic Vision、Qwen3.5-122B-A10B 等模型,基准包括 MM-SafetyBench、HoliSafe 和 VLSBench。作者归因于两点:工具输出填满上下文后掩盖了原始请求的有害意图,模型注意力也转向描述工具返回结果而非做安全判断。在最终回答前重新插入原始请求和图片可以恢复部分拒绝能力。只做纯聊天场景安全评估的团队可能会高估智能体的安全性。
当前结论
NVIDIA 这篇论文发现 Claude、Gemini、Qwen 这些模型一旦接上工具,挡有害请求的能力就掉最多近七成,做智能体安全评测的得看看。
11 个信源41° AI 热度最后更新 2026/10/8 03:00:24
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。