9月1日
04:13
04:13Harrison Chase@hwchase17
Harness工程已成为AI工程师最重要的技能之一,仅次于模型评估。目前市场上缺乏同时提供评估和工具开发解决方案的公司。AI工程师需要掌握评估模型性能和构建有效工具链的双重能力。
推荐理由:Harness工程正成为AI工程师必备技能,市场急需同时提供评估和工具开发解决方案的公司。
8月27日
22:05
01:53
01:53lmarena.ai@lmarena_ai
78°
Agent Arena在数百万真实世界、长期目标型任务上对模型进行评估,Claude Opus 5在代码任务中排名第一。GitHub集成提升编码能力,支持深度仓库集成,让用户在浏览器中完成编码任务。

推荐理由:Agent Arena更新了模型评估功能,Claude Opus 5在代码任务中表现出色,GitHub集成让编码更便捷。
8月26日
07:53
07:53官方一手marktechpost@Asif Razzaq
Liquid AI发布开源平台Pipette,用于在边缘设备上基准测试基础模型,与Artificial Analysis合作,独立验证方法。Pipette将设备上的行为作为评估标准,报告在服务器级、全精度条件下的模型卡片质量,这些数字很少能预测模型在手机上的表现。
推荐理由:Liquid AI发布了Pipette,这是一个开源的基准测试套件,可以综合评估设备模型、量化、运行时和硬件,对于想要了解模型在边缘设备上表现的人来说是个好工具。
8月24日
8月19日
8月13日
18:08
17:45
17:45OpenRouter@OpenRouterAI
OpenRouter 在推特上为旗下模型评估工具 Ori Eval 征求开发者反馈,可私信 @jjacky。该工具的目标是帮开发者从 openrouter.ai/ori/eval 页面找到当前最合适的模型。目前这条推文已有 294 次查看,但暂无评论和转发。
推荐理由:OpenRouter 想继续打磨 Ori Eval,所以跑来问开发者要啥。你要是为选模型发愁,可以去他们的评估页试试。
8月2日
09:19
09:19Gary Marcus@GaryMarcus
Anthropic技术员工Jess Yan表示,模型与harness无法分离,分离就会损失性能。她认为测试模型时必须搭配harness进行,且会选择Anthropic自建的harness。Gary Marcus转发该言论,称这是神经符号AI的胜利。
事件专题

推荐理由:Gary Marcus转发Anthropic员工的话:模型和harness拆不开,测试必须连着一起测。神经符号AI派觉得这是胜利。
8月1日
07:21
07:21官方账号Simon Willison@simonw
精选
Simon Willison 与 Prime Radiant 合作推出新工具 smevals,用于在命令行运行针对模型、测试框架和提示词的小型评估套件。用户可通过 'uvx smevals docs' 命令直接体验。相关博客文章已在 primeradiant.com 发布,介绍了工具的设计思路。
推荐理由:smevals 是 Simon 和 Prime Radiant 做的小工具,专门跑模型和提示词的评估,一条命令就能用,适合快速看效果。
7月31日
02:23
7月28日
7月25日
04:55
04:55AI Engineer@aiDotEngineer
Arize AI 的 CPO Aparna Dhinakaran 和 CEO Jason Lopatecki 主持 AI x Evals Track 直播。Google DeepMind 的 Philipp Schmid、Character.ai 的 Maor Bril 等嘉宾参与讨论模型评估最佳实践。Snorkel AI、Uber、SonderMind 等公司也分享案例。
事件专题

推荐理由:想学模型评估怎么做?这个直播请了 Arize AI、Google DeepMind、Character.ai 的人,干货管够。
7月22日
04:19
04:19官方一手OpenAI Blog博客/媒体
OpenAI和Hugging Face联合分析了一起针对AI模型评估流程的安全事件。事件暴露了攻击者具备高级网络能力,可能涉及恶意模型或数据。两家公司分享了早期调查结果和防御经验,旨在提升社区对模型评估流程的安全防护意识。
事件专题

推荐理由:OpenAI和Hugging Face合作复盘模型评估时的安全漏洞,看看他们发现了什么高级攻击手段,对搞AI安全的有用。