03:20Fireworks AI@FireworksAI_HQFireworks AI与Arize AI联合举办的网络研讨会将于30分钟后开始,主题为'GPT-5.5、Kimi K3和另外8个模型:AI工作的真实成本'。活动将对比10款模型在成功完成任务时的成本表现。会后设有公开问答环节,由Fireworks AI的AI教育主管@Prof_OZ与Arize AI团队参与。下一场研讨会定于8月6日举行。AI模型Fireworks AIArize AIGPT-5.510 个信源在谈事件专题推荐理由:马上有一场AI模型成本对比直播,看GPT-5.5和Kimi K3等10个模型谁完成任务更省钱,还能直接提问。原文稍后读已读值得跟进有用关注 Fireworks AI
04:55AI Engineer@aiDotEngineerArize AI 的 CPO Aparna Dhinakaran 和 CEO Jason Lopatecki 主持 AI x Evals Track 直播。Google DeepMind 的 Philipp Schmid、Character.ai 的 Maor Bril 等嘉宾参与讨论模型评估最佳实践。Snorkel AI、Uber、SonderMind 等公司也分享案例。行业Arize AIGoogle DeepMindCharacter.ai2 个信源在谈事件专题推荐理由:想学模型评估怎么做?这个直播请了 Arize AI、Google DeepMind、Character.ai 的人,干货管够。原文稍后读已读值得跟进有用关注 Arize AI
04:24Fireworks AI@FireworksAI_HQ71°Arize AI 与 Fireworks AI 联合对 10 个模型进行了 2400 次 agent 运行基准测试,包括 Kimi K3。结果显示,Kimi K3 在整体表现上接近 GPT-5.5。不同模型在不同任务类型上各有优势,按任务难度路由可同时优化成本和覆盖率。重试和静默故障显著改变了经济性。开发者应关注每次成功任务的成本而非 token 价格。行业Fireworks AIArize AIKimi K310 个信源在谈事件专题推荐理由:别只盯着 token 价格了,Arize 和 Fireworks 测了 10 个模型的 2400 次 agent 运行,发现按任务难度的路由能省钱又提高成功率。Kimi K3 还追平了 GPT-5.5。原文稍后读已读值得跟进有用关注 Fireworks AI