01:48Harrison Chase@hwchase17精选Deep Research Agent是一个基于LangChain Deep Agents构建的研究智能体,采用搜索优先架构。该智能体实时规划研究,将工作分解为小步骤,搜索网络资源,检索结果来自Liner平台。每个最终答案中的声明都有检索结果来源支持,完整报告可保存为Markdown文件。技巧Deep AgentsLangChain研究智能体推荐理由:Sumanth用LangChain Deep Agents做了个研究智能体,能搜索、推理并生成带引用的报告,比普通搜索API更智能。原文稍后读已读值得跟进有用关注 Deep Agents
19:11官方账号arXiv cs.LG@Gaotang Li, Bhavana Dalvi Mishra, Zifeng Wang, Jun Yan, Yanfei Chen, Chun-Liang Li, Long T. Le, Rujun Han, George Lee, Hanghang Tong, Chen-Yu Lee, Tomas PfisterRubricEM 是一种新型强化学习框架,用于训练深度研究智能体(如规划、搜索、证据评估和长报告合成的系统)。该框架引入了基于评分标准的策略分解和自省元策略进化,通过将研究轨迹分段并与自生成评分标准关联,利用阶段评分提供密集语义反馈。RubricEM-8B 模型在四个长研究基准上表现出色,性能接近专有深度研究系统。论文强化学习智能体研究智能体推荐理由:该工作为奖励不可验证的长期任务提供了结构化强化学习新思路,通过评分标准统一策略执行、评判反馈和智能体记忆,对复杂研究智能体训练具有实践指导意义。原文稍后读已读值得跟进有用关注 强化学习