事件专题 ·单一信源

论文提出 TPRS 指标:智能体安全基准得分会因工具命名方式而波动

arXiv 论文提出威胁保持表示敏感性(TPRS),用于测量在任务、有害行为、安全策略和评估标准完全不变时,仅改变智能体可见表示会导致攻击成功率(ASR)发生多大变化。在 Agent Security Bench 上,把威胁相关工具名换成中性名称后,GPT-5-mini 的 ASR 上升 11.67 个百分点,Claude Haiku 4.5 上升 13.21 个百分点。在 MCPTox 上反向操作,GPT-5-mini 的 ASR 下降 11.00 个百分点;且一个仅对齐 token 数、长度和大小写的中性名称就能复现其中 8.54 个百分点的变化。AgentDojo 上的对照显示 GPT-4o-mini 的 ASR 仅变化 0.50 个百分点,但涉及该工具的良性任务效用下降 5.36 个百分点。结论是单一表示下的安全得分可能无法泛化,稳健性结论应基于一组受控的威胁保持表示来支撑。

当前结论

这篇论文做了件很扎实的事:只改工具名字,GPT-5-mini 和 Claude Haiku 4.5 的安全得分就波动十几个百分点,以后看智能体安全跑分得多留个心眼。

2 个信源37° AI 热度最后更新 2026/10/2 16:55:50

证据链

2 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。