论文Agent 与开发者14:06FTA 基准测试:工具调用失败后语言模型虚报成功率可达 22.8%这篇论文测了个很扎心的问题:工具挂了之后智能体会不会硬说成功了。六家模型对比下来,加个证据契约能把虚报率从 22.8% 压到 0.8%,做智能体的都该看看。#智能体#AI安全#FTA#基准测试aarXiv cs.AI@Junru Zhu 等 7 人原文稍后读已读值得跟进有用关注 智能体