技巧

AI Agent 评估多数团队从搭平台、接 LLM judge、看分数开始

AI Agent 评估,多数团队从搭平台、接 LLM judge、看分数开始 @HamelHusain 与 @sh_reya 在教了 700+ 工程师之后给出的答案是反的:先手动读 100 条真实 ...

精选理由

教了700+工程师的Hamel Husain和sh_reya说,评估AI Agent要先手动读100条真实trace找失败模式,而不是先搭平台接LLM judge看分数。

AI Agent 评估多数团队从搭平台、接 LLM judge、看分数开始 @HamelHusain 与 @sh_reya 在教了 700+ 工程师之后给出的答案是反的:先手动读 100 条真实 trace,找到失败模式,评估器才会长出来 评估的本质是理解系统在哪里影响了用户,这一步没有自动化捷径

图片来源 · shao__meng
原文 · shao__meng

AI Agent 评估,多数团队从搭平台、接 LLM judge、看分数开始 @HamelHusain 与 @sh_reya 在教了 700+ 工程师之后给出的答案是反的:先手动读 100 条真实 ...

AI Agent 评估,多数团队从搭平台、接 LLM judge、看分数开始 @HamelHusain 与 @sh_reya 在教了 700+ 工程师之后给出的答案是反的:先手动读 100 条真实 trace,找到失败模式,评估器才会长出来 评估的本质是理解系统在哪里影响了用户,这一步没有自动化捷径 x.com/i/article/2101… 💬 1 🔄 0 ❤️ 3 👀 391 📊 2 ⚡