7月25日
04:55
04:55AI Engineer@aiDotEngineer
Arize AI 的 CPO Aparna Dhinakaran 和 CEO Jason Lopatecki 主持 AI x Evals Track 直播。Google DeepMind 的 Philipp Schmid、Character.ai 的 Maor Bril 等嘉宾参与讨论模型评估最佳实践。Snorkel AI、Uber、SonderMind 等公司也分享案例。
事件专题

推荐理由:想学模型评估怎么做?这个直播请了 Arize AI、Google DeepMind、Character.ai 的人,干货管够。
7月24日
04:24
04:24Fireworks AI@FireworksAI_HQ
71°
Arize AI 与 Fireworks AI 联合对 10 个模型进行了 2400 次 agent 运行基准测试,包括 Kimi K3。结果显示,Kimi K3 在整体表现上接近 GPT-5.5。不同模型在不同任务类型上各有优势,按任务难度路由可同时优化成本和覆盖率。重试和静默故障显著改变了经济性。开发者应关注每次成功任务的成本而非 token 价格。
事件专题

推荐理由:别只盯着 token 价格了,Arize 和 Fireworks 测了 10 个模型的 2400 次 agent 运行,发现按任务难度的路由能省钱又提高成功率。Kimi K3 还追平了 GPT-5.5。