17:45官方账号LangChain@LangChainAI精选LangChain的Viv在AI Engineer World Fair上分享持续改进智能体的方法论。他认为智能体会遵循Evals中编码的行为,因此高质量Evals来自大规模挖掘生产数据。他还提出了用开源模型搭配Harness与PostTrain的“三明治”配方来定制智能体系统。演讲强调不存在通用模型或通用Harness,针对具体任务优化模型与框架组合效果更好。技巧LangChain智能体数据挖掘推荐理由:LangChain的Viv分享了一套改进智能体的实战思路,核心是用生产数据挖Evals,还给了Harness-PostTrain的开源模型配方。原文稍后读已读值得跟进有用关注 LangChain
17:57官方一手marktechpost@Michal SutterSupabase开源了Apache-2.0许可的基准框架supabase/evals。该框架让Claude Code、Codex和OpenCode在容器化环境中执行真实Supabase任务,例如构建schema、调试Edge Functions、修复RLS策略。评分结合确定性检查与LLM-as-a-judge。AI模型SupabaseEvalsClaude Code1 个信源在谈事件专题推荐理由:Supabase开源Evals,用真实任务评估Claude Code等编码智能体,比普通基准更实战原文稍后读已读值得跟进有用关注 Supabase
03:09Lenny Rachitsky@lennysan72°Anthropic 研究产品主管 Dianne Penn 在访谈中提出“Evals 是新的 PRD”这一观点。她于 2023 年加入 Anthropic,作为首位技术 PM,参与了从 Claude 2 到 Mythos 的每个 Claude 模型发布。访谈涵盖 AI 研究角色如何运作、前沿模型安全措施(如 35:18 处)、以及如何构建有效的评估体系。Lenny Rachitsky 主持讨论,还涉及 AI 时代招聘、产品经理角色演变等话题。行业AnthropicClaudeEvals10 个信源在谈事件专题推荐理由:Anthropic 的产品主管亲自聊他们怎么做模型评估,说 Evals 就像新版产品需求文档,对做 AI 产品和模型的朋友很有启发。原文稍后读已读值得跟进有用关注 Anthropic