07:48官方一手marktechpost@Asif RazzaqKeenable AI 开源了 NEEDLE 基准测试工具,每小时重建一次查询集。该基准专门解决搜索 API 读取答案键的问题。测试对象包括具有获取工具的搜索智能体。基准测试防止模型直接下载公共数据集跳过检索过程。论文NEEDLEKeenable AI搜索基准推荐理由:Keenable AI 发布了 NEEDLE 基准,每小时更新查询集,防止搜索模型作弊跳过检索步骤。原文稍后读已读值得跟进有用关注 NEEDLE
21:51elvis@omarsar0Keenable的NEEDLE基准测试发现,Brave、You和Parallel三个搜索引擎在错误结果上有70-90%的重叠度。对于智能体而言,只有当底层索引真正独立时,结合多个提供商才能提高覆盖率。搜索API的界面可能不同,但返回的错误结果可能高度一致。论文NEEDLEBraveYou推荐理由:Keenable的NEEDLE基准测试显示不同搜索引擎错误结果高度重叠,这对智能体组合提供商有重要启示。原文稍后读已读值得跟进有用关注 NEEDLE