8月20日
02:41
02:41lmarena.ai@lmarena_ai
Agent Arena推出的Pareto前沿平台上,Claude Opus 5(High)在真实代理任务中表现领先,提升+12.34%;该平台对比了各模型成本与性能,@OpenAI的GPT 5.5(High)表现突出,提升+7.75%;参与对比的多款知名模型包括Kimi K3(Max)和Groq 4.5等,帮助用户了解不同模型差异。
事件专题

推荐理由:Agent Arena发布了Pareto前沿平台,能查各模型做真实任务里的表现,像 Claude 和 GPT 这些对比后就知道哪个更划算。
7月11日
04:41
04:41Aravind Srinivas@AravSrinivas
Computer Harness 宣布支持 Fable、Sol、Opus、Grok、GLM + advisor、Sonnet 和 GPT 5.5 作为 orchestrator 模型。同时集成多个小型 LLM 和多模态模型作为子智能体。该平台自称是最易上手的智能体编排系统,并计划未来添加本地运行时。
推荐理由:想用 GPT 5.5、Opus、Grok 等模型组合编排智能体?Computer Harness 一平台搞定,上手超简单。
7月9日
05:57
05:57Thomas Wolf@Thom_Wolf
精选
Matei Zaharia指出,在LLM推理中,使用简单的Pi harness(来自@badlogicgames)在Opus和GPT 5.5上达到了与LLM供应商提供的harness相同的成功率,但成本降低了一半。这种成本优势主要归因于更小的输入规模。该发现揭示了harness设计对性价比的巨大影响。
推荐理由:你知道吗?换个简单的工具就能把成本砍半,效果还不打折!Pi harness让Opus和GPT 5.5的推理省钱又高效,值得一试。
7月8日
17:04
08:49
7月3日
10:04
10:04Viking@vikingmute
精选
Mitchell Hashimoto分享了使用Fable xhigh作为规划/架构师、GPT 5.5 xhigh作为编码员、再让Fable xhigh审查的工作流。每次规划和审查成本仅需几美元,远低于通常的50美元以上。另有用户尝试廉价方案:GPT5.5规划+DeepSeek V4 Pro编码+composer2.5/GPT5.5交叉审查。GPT 5.5 xhigh收费比Fable便宜且速度很快。
事件专题

推荐理由:Mitchell Hashimoto分享的核心方案:Fable xhigh规划+GPT 5.5 xhigh编码+Fable xhigh审查,成本低至几美元。想省钱的可以用DeepSeek V4 Pro代替编码步骤。
7月1日
22:18
22:18Aadit Sheth@aaditsh
精选73°
Anthropic 恢复 Fable 5 访问,同时推出新模型 Sonnet 5,定价每百万 tokens 2 美元。该价格不到 GPT 5.5 的一半。此前 Fable 5 因出口管制被禁 18 天,期间开发者转向其他模型。Anthropic 希望低价新模型能吸引用户回归。
事件专题

推荐理由:Anthropic 把 Sonnet 5 定价降到 $2/百万 tokens,比 GPT 5.5 便宜一半多,开发者有理由回来了。
16:50
6月30日
15:14
15:14官方账号arXiv cs.LG@Mohit Raghavendra, Anisha Gunjal, Aakash Sabharwal, Yunzhong He
SWE-Interact是一个新测试平台,用于评估编码代理在多轮交互、用户驱动的软件工程任务中的表现。现有SWE基准(如SWE-bench)通常预先提供完整需求,而SWE-Interact通过用户模拟器逐步揭示需求、提供反馈和约束。在单轮任务中,最强模型(如Opus 4.8和GPT 5.5)解决率约50%,但在SWE-Interact多轮任务中仅解决约25%。该基准测量了模型在交互目标发现和迭代细化中的正交能力。
事件专题

推荐理由:想知道编程智能体在真实对话开发中能撑多久吗?SWE-Interact测试了Opus 4.8和GPT 5.5在模糊需求下逐步迭代的能力,结果比单轮任务差一半。
6月27日
12:21
12:21官方账号Nous Research@NousResearch
精选
NousResearch发布Hermes Agent,通过暴露MoA预设作为虚拟模型,提供超越公共前沿的能力。在即将发布的基准测试上,Hermes Agent比Opus 4.8高8%,比GPT 5.5高11%。该模型目前被限制访问,仅授予少数人。

推荐理由:Hermes Agent的MoA虚拟模型比Opus 4.8和GPT 5.5都强,分别高8%和11%,不过目前只能少数人用。
6月19日
12:42
12:42Fireworks AI@FireworksAI_HQ
Jeremy Howard在X平台上称赞Zai_org的GLM 5.2模型,称其至少与Opus 4.8和GPT 5.5一样优秀。他指出该模型速度极快、成本低廉且回答不冗长,在处理长上下文时表现非常出色。Howard表示从未见过如此优秀的开源权重模型。
事件专题

推荐理由:想试试媲美顶级闭源模型的开源模型吗?GLM 5.2又快又便宜,长上下文超强,看看Jeremy Howard怎么夸的。
6月12日
13:31
13:31swyx (AI Engineer)@swyx
Mythos 正式上线,其 FrontierCode 被认定为下一代编程基准。在 FC Diamond 测试中,Opus 4.8 和 GPT 5.5 在随努力扩展方面表现不佳。Mythos/Fable 的后训练方法首次将测试时计算应用于解决超长任务,相当于数十小时人类工作、每任务数百美元。该功能现已在 Cognition 和 Devin 中可用,仅需 1.4x ACUs。
事件专题

推荐理由:Mythos 的 FrontierCode 基准揭示了当前顶级模型在长任务上的扩展瓶颈,做 AI 编程评估或开发长流程自动化的团队值得关注,可以直接在 Devin 中体验。
6月10日
22:20
22:20berryxia@berryxia
一条推文对比了 Fable 5、Opus 4.8、Gemini 3.1 Pro 和 GPT 5.5 四款模型,指出只有 Google 还在使用去年的模型。这反映了当前 AI 模型迭代速度的差异,Google 的 Gemini 3.1 Pro 相对落后于其他厂商的新模型。
事件专题

推荐理由:关注模型迭代节奏的开发者可以快速了解各厂商最新进展,Google 用户会意识到其模型可能落后了。
6月4日
6月2日
14:15
14:15AI Will@FinanceYF5
Greg Isenberg 认为 Claude Opus 4.8 相比 GPT 5.5 没有显著提升,模型发布已进入类似 iPhone 的微调迭代阶段。他指出,基准测试与用户感受脱节,真正的价值在于模型周边的工具创新,如 Claude Code 的动态工作流和 Codex 的桌面应用。他预测 6 个月内用户将不再关心具体模型,就像不关心 Uber 的引擎一样。
事件专题

推荐理由:模型同质化趋势下,真正改变开发效率的是工具链创新——做 AI 应用或自动化流程的团队,建议关注 Claude Code 动态工作流和 Codex 桌面应用,而非纠结模型版本号。