Hamel Husain是AI评估领域的重要专家,专注于AI团队评估工作流和AI Agent评估(evals)方法论。近期他与Shreya Shankar合作推出了一系列关于AI评估的进阶指南和技能包,为行业提供了系统化的评估框架。
HamelHusain 近期进展
当前焦点与观察点
AI Agent评估多数团队从搭平台、接LLM judge、看分数开始,但Hamel Husain的工作表明,评估应该更注重发现失败案例,而非仅仅关注分数。他提出的AI产品工程优化优先级手册指出,应该先修检索与Context,再修Systems,微调放最后,这一方法论正在影响越来越多团队的AI开发流程。AI Agent 评估多数团队从搭平台、接 LLM judge、看分数开始