9月3日
9月1日
07:48
07:48官方一手marktechpost@Asif Razzaq
Keenable AI 开源了 NEEDLE 基准测试工具,每小时重建一次查询集。该基准专门解决搜索 API 读取答案键的问题。测试对象包括具有获取工具的搜索智能体。基准测试防止模型直接下载公共数据集跳过检索过程。
推荐理由:Keenable AI 发布了 NEEDLE 基准,每小时更新查询集,防止搜索模型作弊跳过检索步骤。
8月27日
01:25
6月4日
04:44
04:44官方账号LangChain@LangChainAI
LangSmith Engine 能够自动发现并突出显示系统中的问题,而不是让它们隐藏在追踪记录中。ListenLabs 的 Ollie Elmgren 分享了该工具如何改变其团队评估智能体的方式。该引擎通过自动化问题检测,帮助团队更高效地识别和解决系统性问题,从而提升智能体的可靠性和性能。
推荐理由:做 AI 智能体评估的团队终于不用手动翻 trace 找 bug 了——LangSmith Engine 自动暴露系统性问题,ListenLabs 已经用上了,建议做 agent 开发的团队点开看看。