7月1日
11:23
10:27
07:16
6月30日
15:14
15:14官方账号arXiv cs.LG@Mohit Raghavendra, Anisha Gunjal, Aakash Sabharwal, Yunzhong He
SWE-Interact是一个新测试平台,用于评估编码代理在多轮交互、用户驱动的软件工程任务中的表现。现有SWE基准(如SWE-bench)通常预先提供完整需求,而SWE-Interact通过用户模拟器逐步揭示需求、提供反馈和约束。在单轮任务中,最强模型(如Opus 4.8和GPT 5.5)解决率约50%,但在SWE-Interact多轮任务中仅解决约25%。该基准测量了模型在交互目标发现和迭代细化中的正交能力。
事件专题

推荐理由:想知道编程智能体在真实对话开发中能撑多久吗?SWE-Interact测试了Opus 4.8和GPT 5.5在模糊需求下逐步迭代的能力,结果比单轮任务差一半。
6月25日
14:45
6月23日
20:18
6月19日
18:39
18:39官方账号Together AI@togethercompute
Together Compute 测试了闭源和开源模型构建小型可玩游戏的能力。结果显示,开源模型成本更低、速度更快,生成游戏质量接近闭源模型。例如,Opus 4.8 成本是 MiniMax M3 的 15 倍,GPT-5.5 是 Nemotron Ultra 的 10 倍,而 Kimi K2.7 Code 比 Opus 4.8 便宜 7 倍。
事件专题

推荐理由:Together Compute 实测:闭源模型贵几倍,开源做小游戏又快又便宜,质量还接近,想省钱就选开源。
12:42
12:42Fireworks AI@FireworksAI_HQ
Jeremy Howard在X平台上称赞Zai_org的GLM 5.2模型,称其至少与Opus 4.8和GPT 5.5一样优秀。他指出该模型速度极快、成本低廉且回答不冗长,在处理长上下文时表现非常出色。Howard表示从未见过如此优秀的开源权重模型。
事件专题

推荐理由:想试试媲美顶级闭源模型的开源模型吗?GLM 5.2又快又便宜,长上下文超强,看看Jeremy Howard怎么夸的。
6月17日
23:32
23:32Guillermo Rauch@rauchg
Vercel CEO指出,在模型竞争加剧的当下,ai-sdk比以往更重要。开源模型GLM 5.2在Next.js Evals中击败了Opus 4.8。同时Vercel推出eve.dev,提供构建和部署智能体的实用解决方案,类比React与Next.js的关系。
事件专题

推荐理由:Vercel发了eve.dev,帮你快速搞Agent;还有GLM 5.2在Next.js评测里赢了Opus 4.8,开源再进一步。
6月13日
6月12日
13:31
13:31swyx (AI Engineer)@swyx
Mythos 正式上线,其 FrontierCode 被认定为下一代编程基准。在 FC Diamond 测试中,Opus 4.8 和 GPT 5.5 在随努力扩展方面表现不佳。Mythos/Fable 的后训练方法首次将测试时计算应用于解决超长任务,相当于数十小时人类工作、每任务数百美元。该功能现已在 Cognition 和 Devin 中可用,仅需 1.4x ACUs。
事件专题

推荐理由:Mythos 的 FrontierCode 基准揭示了当前顶级模型在长任务上的扩展瓶颈,做 AI 编程评估或开发长流程自动化的团队值得关注,可以直接在 Devin 中体验。
6月11日
03:45
03:45OpenRouter@OpenRouterAI
OpenRouter 数据显示,模型 Fable 的使用量已达到 Opus 4.8 的两倍。尽管两者每日 token 使用量相同,但 Fable 的价格是 Opus 4.8 的两倍。这表明用户愿意为 Fable 支付更高费用,可能因其性能或特定优势。该趋势反映了 AI 模型市场对高质量付费模型的接受度提升。
事件专题

推荐理由:Fable 在相同 token 消耗下价格翻倍却使用量翻倍,说明用户认可其价值。做模型选型或 API 调用的开发者值得关注这一市场信号。
6月10日
22:20
22:20berryxia@berryxia
一条推文对比了 Fable 5、Opus 4.8、Gemini 3.1 Pro 和 GPT 5.5 四款模型,指出只有 Google 还在使用去年的模型。这反映了当前 AI 模型迭代速度的差异,Google 的 Gemini 3.1 Pro 相对落后于其他厂商的新模型。
事件专题

推荐理由:关注模型迭代节奏的开发者可以快速了解各厂商最新进展,Google 用户会意识到其模型可能落后了。
6月8日
6月5日
02:16
02:16宝玉@dotey
博主建议用户根据自身条件选择2-3个最聪明的AI模型使用,而非追求数量。他认为单一模型不够稳定和全面,例如GPT-5.5不如Opus 4.8稳定,写作时甚至需要退回Opus 4.6。翻译任务他偏好Gemini 3.1 Pro,画图则选GPT Image 2。即使Opus 4.8表现不错,复杂任务也会让GPT-5.5同时出方案对比。他强调Token贵的省时间,时间比Token更宝贵。
事件专题

推荐理由:这条建议直击AI用户选模型的痛点——不是越多越好,而是选对2-3个最聪明的。经常用AI做复杂任务的开发者或创作者,看完会重新思考自己的模型组合,省下时间比省Token更划算。
6月4日
6月3日
6月2日
10:40
10:40宝玉@dotey
博主提出不要指望单一模型在所有场景最强,应像渣男一样组合使用多个模型。Opus 4.8在写作上不如GPT-5.5,但在UI设计、系统设计和计划方面表现更优。建议先用Claude Design设计UI,再分别交给GPT-5.5和Opus 4.8实现对比。每个模型有独特特性,需针对性调优提示词。
事件专题

推荐理由:这条建议解决了AI模型选择焦虑——不用纠结哪个最好,组合用才是王道。做UI设计、系统架构的开发者可以立刻试试Claude Design+GPT-5.5/Opus 4.8的搭配,效果立竿见影。