8月26日
10:15
09:48
09:48elvis@omarsar0
精选
A paper discusses the impact of harnesses on agent benchmark scores, revealing significant variance caused by harness configurations. The study compares three frontier models across 100 tasks, showing harness-induced variance is 7.8x larger than model-induced variance. The authors propose a Harness Card for structured disclosure. Paper available at arxiv.org/abs/2605.23950.

推荐理由:This paper reveals the hidden influence of harnesses on AI model scores, offering a new perspective on leaderboard comparisons. It's a must-read for those interested in understanding the true performance of AI models.
06:50
06:44
05:34
05:34Guillermo Rauch@rauchg
精选
构建智能体最困难的问题是安全连接服务与数据。Vercel Connect 现已正式发布,提供安全访问 Slack、Linear、GitHub 等超过 100 个服务。支持短期、范围有限的访问令牌,令牌和触发器可观察性,基于角色的访问控制和审计跟踪。
事件专题

推荐理由:Vercel 推出 Connect,为智能体提供安全连接服务与数据,支持 Slack、Linear、GitHub 等服务,比传统方法更安全、更便捷。
05:01
05:01官方一手@OpenAIDevs@OpenAIDevs
精选
WebMCP是一个实验性开放标准,允许网页应用暴露工具,智能体可以直接在页面上使用这些工具以更快、更可靠地完成任务。查看我们的WebMCP演示展示:developers.openai.com/showcase?view=…
事件专题

推荐理由:OpenAI发布了WebMCP,这是一个实验性开放标准,能让智能体直接使用网页工具,比传统方式更高效。来看看这个演示展示吧!
04:59
03:39
03:39官方账号LangChain@LangChainAI
精选
LangChain的LangSmith Engine在关键内部基准测试中提供超过2倍的性能。已帮助客户识别数万个问题,现在提供更准确的检测、聚类和修复、支持SaaS和自托管部署、降低分析模式成本、与Slack和Linear集成、自动关闭陈旧问题。
事件专题

推荐理由:LangChain的LangSmith Engine大幅提升性能,帮助快速识别和修复智能体开发中的问题,是智能体开发者的得力助手。
03:38
03:38官方账号LangChain@LangChainAI
Join The Learning Loop in SF on September 2nd to hear from experts on continual learning, intelligence ownership, and team-based system improvement. Enjoy food, drinks, and activities after the talks. Limited spots available. Register now!

推荐理由:想了解持续学习和团队系统改进的专家分享,还有美食和娱乐活动,这个活动不容错过!
03:08
03:08官方一手AWS Machine Learning Blog@Hang Zuo
精选
Amazon OpenSearch Service新增MCP Apps功能,提供与AI智能体文本响应的交互式可视化。通过本地运行的单一MCP服务器,智能体可在一次对话中从警报追踪到日志再到根本原因,并在IDE内验证每一步,无需离开开发环境。
推荐理由:亚马逊发布OpenSearch Service新功能,MCP Apps让智能体分析更直观,提升开发效率,值得一试!
02:48
02:06
02:05
01:09
01:00
00:49
00:11
00:09
8月25日
23:45
23:38
23:36
23:34
22:10
20:04
16:14
15:48
15:14
15:03
15:03IT之家博客/媒体
精选72°
英伟达使用 DeepSeek-v4-PRO 1.6T 模型在 Vera Rubin 服务器上测试,每兆瓦吞吐量达到 GB300 的 30 倍,每百万 Token 成本仅为 GB300 NVL72 的 35 分之一,大幅提升智能体运行效率。
事件专题

推荐理由:英伟达 DeepSeek-V4-PRO 模型在 Vera Rubin 服务器上表现出色,吞吐量大幅提升,值得关注。
14:48
14:48小互@imxiaohu
78°
Anthropic 发布 AI 原生 SDLC 实施指南,涵盖 Plan、Design、Build、Test、Deploy、Maintain 六个阶段,指导如何将 Agent 接入软件开发生命周期。指南基于 Anthropic Applied AI 团队实践及客户项目经验。
事件专题

推荐理由:Anthropic 发布了 AI 原生 SDLC 实施指南,详细介绍了如何将 Agent 集成到软件开发生命周期中,对于想要优化开发流程的人来说是个实用资源。
14:13
13:36
11:54
11:48