全部动态

AI 相关资讯全量信息流 · 193 条
6月19日
6月18日
6月17日
6月16日
6月14日
6月13日
6月12日
模型中美对照多源确认精选73°04:05
GPT-5.5 (xHigh) 在 Agent Arena 排名第二,仅次于 Claude Fable 5

做智能体开发和 AI 评测的团队值得关注——GPT-5.5 在用户满意度和故障恢复上反超 Claude,说明 OpenAI 在实用场景上有了实质提升,建议直接去 Agent Arena 跑跑自己的任务。

事件专题
lmarena.ai@lmarena_ai11 个信源在谈原文
6月11日
模型精选15:11
Mitchell Hashimoto 实测 Fable:慢且贵,但特定任务表现惊人

Mitchell Hashimoto 的实测揭示了 Fable 模型的真实表现:它并非全能,但在特定优化任务上能带来数量级提升。做高性能计算或深度优化的开发者,可以看看他如何用 Fable 将微秒级操作压到纳秒级,以及是否值得为此付出时间和成本。

AI Will@FinanceYF5原文
6月10日
6月9日
模型Agent 与开发者多源确认精选76°10:03
Cognition 推出 FrontierCode:将 Coding 评估标准从可用提升到可合并,Claude Opus 4.8 领先

FrontierCode 把 AI 编程评估从“能跑就行”升级到“能合并”,做代码质量评估或 AI 编程工具的团队可以直接参考这套标准,看看自己的模型在真实维护者眼中能拿几分。

事件专题
shao__meng@shao__meng4 个信源在谈原文
6月8日
6月6日
Agent Arena 发布真实世界智能体排行榜,GPT-5.5 High 领先

做智能体开发和评测的团队终于有了一个贴近真实工作场景的排行榜——Agent Arena 用 30 万+ 任务和 200 万+ 工具调用数据,告诉你哪个模型在写代码、做研究、处理文档时真正靠谱,值得点开看看你的模型排第几。

事件专题
rohanpaul_ai@rohanpaul_ai2 个信源在谈原文