9月1日
21:45
21:45Richard Socher@RichardSocher
73°
Braintrust研究评估了1,329个时事问题,对比4个模型在14种条件下的表现。搜索功能将模型间差距从47.9分缩小至5.6分。检索增益随事件时间衰减,近期事件约45分,最旧事件约24分。5次以上搜索的得分反而下降19-49%。
推荐理由:Braintrust研究显示,搜索功能能让不同模型表现趋同,但搜索次数过多反而会降低准确率。
8月16日
02:59
02:59Latent.Space@latentspacepod
精选
Alex Krentsel 与 a16z 的 Martin Casado、Braintrust 的 Ankur Goyal 等人合作推出开源智能体 Exo。它能重写自身代码,学习新环境、调整策略,甚至优化成本并玩游戏。Latent Space 播客发布视频对 Exo 的哲学与架构进行深入解析。作者此前对 OpenClaw 的系统拆解也受到关注。
事件专题

推荐理由:Exo 是个能改自己代码的开源 agent,还有 a16z 和 Braintrust 的人参与,想搞懂系统级 agent 架构的可以看看这个视频。
8月10日
02:29
02:29官方一手marktechpost@Asif Razzaq
这是一篇2026年的LLM可观测性平台对比评测。文章覆盖了Langfuse、LangSmith、Braintrust、Arize等多个主流平台。评测维度包括追踪深度、评估能力、生产监控和定价模式。文章通过对比这些维度,帮助开发者根据需求选择合适平台。
推荐理由:想给LLM应用做监控评估?这篇把Langfuse、LangSmith、Braintrust、Arize的追踪深度、评估、生产监控和定价都对比了,直接照着选。