09:55官方账号arXiv cs.AI@Jia-Hao Ji, Sijie Li, Jiabei Cheng, Zixi She, Jin-Tai Yu, Zhiyuan Yuan研究多智能体系统中候选供应和答案选择对LLM判断价值的影响,分析15,336个问题,发现正确答案常在候选中,但系统仍可能报告错误答案。通过结合答案频率和判断者的评估,将准确率从63.82%提升至70.82-70.95%,主要通过挽救被常见错误压倒的正确答案。论文多智能体系统LLM判断答案选择推荐理由:这篇论文分析了多智能体系统中LLM判断的价值,揭示了候选供应和答案选择的重要性,值得一读。原文稍后读已读值得跟进有用关注 多智能体系统
10:12官方账号arXiv cs.AI@Chenglin Yang精选AgentTrust 提出了一种针对AI智能体动作的信任层,能根据威胁类型(词法或语义)决定是否允许、警告、阻止或升级操作。词法威胁可通过确定性规则处理,而语义威胁(如表面相似但意图不同的动作)则依赖LLM判断。该系统通过自学习机制,在语义攻击为主的语料上,将规则准确率从48%提升至83.6-85.2%,且误报率极低。AgentTrust v2 采用双存储系统:对词法威胁蒸馏出确定性规则以降低成本,对语义威胁使用带验证的RAG记忆,将语义准确率提升13个百分点。在45000个动作的端到端回放中,LLM调用率从50%降至44%,准确率从71%升至80%,且未误阻任何良性动作。论文智能体安全/信任LLM判断推荐理由:AI智能体安全是当前最棘手的工程问题之一,AgentTrust 用自进化信任层解决了规则无法覆盖语义攻击的痛点,做智能体安全或自动化运维的团队可以直接参考其架构设计。原文稍后读已读值得跟进有用关注 智能体