02:07官方账号Anthropic@AnthropicAI精选Anthropic 让 Sonnet 5 对 Opus 4.8 的早期检查点进行后训练。经过训练后,该模型的安全分数接近完整对齐训练的 Opus 4.8 水平。这是测试模型能否对其更强大的继任者的首次尝试。AI模型Sonnet 5Opus 4.8Anthropic5 个信源在谈事件专题推荐理由:Anthropic 让 Sonnet 5 训练 Opus 4.8,安全分数接近原版,模型自我对齐有新进展。原文稍后读已读值得跟进有用关注 Sonnet 5
03:38官方账号Decoder@Matthias BastianDeepseek推出V4-Flash-Vision-Exp,一个实验性多模态模型,为V4-Flash的文本能力添加图像理解。在公司自己的多模态智能体基准测试中,其性能接近Opus 4.8,有时甚至超越它。AI模型Deepseek多模态视觉模型推荐理由:Deepseek新推出的V4-Flash-Vision-Exp模型,将图像理解能力与文本处理结合,在多模态智能体基准测试中表现优异,与Opus 4.8不相上下,值得一试。原文稍后读已读值得跟进有用关注 Deepseek
17:43orange.ai@oran_geDeepSeek V4 Pro 0813正式版发布。从评测指标看,该模型有两项指标超越Fable,多项指标超越Opus 4.8。Fable仍被认为是难以逾越的高山,但V4 Pro的推理成本比Fable便宜约100倍。官方强调这是涨价前的价格,后续可能调整。AI模型DeepSeekV4 ProFable推荐理由:DeepSeek出了V4 Pro 0813,多项跑分超过Opus 4.8,比Fable便宜100倍,想省钱又想要性能的可以看看。原文稍后读已读值得跟进有用关注 DeepSeek
18:04shao__meng@shao__mengCursor 团队发布 Router 两周后,Auto Intelligence 与 Auto Balance 两档路由配置均获提升。Auto Intelligence 的用户满意度超过 Fable 级别,成本降低 68%,其中上线后又额外下降 18%。Auto Balance 表现优于 Opus 4.8,成本降低 41%,满意度提升 3%。Cursor 还公开了 4 种模型的属性与使用方案对比表。AI产品CursorCursor Router模型路由6 个信源在谈事件专题推荐理由:Cursor 路由发布两周,Auto Intelligence 成本砍掉 68%,还公开了 4 种模型的调度思路,管 AI 预算的可以抄作业。原文稍后读已读值得跟进有用关注 Cursor
05:38elvis@omarsar0精选AgentRadio提出线程、消息、等待提及三种原语,用异步消息传递取代阶段式交接。在SWE-Atlas QnA基准上,单个Claude Code agent(Opus 4.6)解决32.3%任务,四个通过AgentRadio协作的agent解决62.1%,超过单个Opus 4.8的57.2%。按难度分层分析显示增益随任务难度增长,说明收益主要来自中途修正而非并行。论文见arxiv.org/abs/2607.28430。论文AgentRadioClaude CodeOpus 4.8推荐理由:这篇把4个Claude Code用AgentRadio串起来,SWE-Atlas上干到62.1%,比单跑Opus 4.8还高。搞多智能体协作的值得看看。原文稍后读已读值得跟进有用关注 AgentRadio
11:19shao__meng@shao__meng85°Anthropic 发布 Claude Opus 5,声称其智能接近 Fable 5,价格仅为 Fable 5 的一半,且与 Opus 4.8 保持同价(input $5/M tokens,output $25/M tokens)。在基准测试中,Opus 5 在 Frontier-Bench v0.1 上达到新 SOTA,比 Opus 4.8 性能提升超过一倍;在 ARC-AGI-3 上得分是第二名模型的 3 倍。在计算机使用任务 OSWorld 2.0 中,Opus 5 以仅三分之一成本超越 Fable 5 的最佳成绩。新的快速模式提供 2.5 倍速度但价格翻倍;API 自动 fallback 功能可将被安全分类器拦截的请求降级到其他模型。AI模型Claude Opus 5AnthropicOpus 4.810 个信源在谈事件专题推荐理由:Anthropic 发了 Opus 5,智能接近 Fable 5 但价格砍半,编码和推理效率超强,日常用很划算。原文稍后读已读值得跟进有用关注 Claude Opus 5
08:13orange.ai@oran_ge评价称Opus 5的智能水平略微超过降智后的Fable 5,且价格保持为Fable 5的一半。OpenAI的开源模型已超过旧版Opus 4.8。Opus 4系列在引领上半年后逐渐退场。评论认为在开源巨浪下,这些模型都将成为浪花。AI模型Opus 5Fable 5Opus 4.810 个信源在谈事件专题推荐理由:Opus 5干过了降智版的Fable 5,价格还便宜一半,开源模型也追上来了,值得关注这波模型更迭。原文稍后读已读值得跟进有用关注 Opus 5
02:12Claude@claudeaiClaudeAI在推文中对比了Opus 5与Opus 4.8在网络安全任务上的表现,称Opus 5更强。但Opus 5在开发漏洞利用方面仍大幅落后于Mythos 5。其安全措施旨在帮助开发者识别和修复软件漏洞,同时阻止高风险用途。AI模型ClaudeAIOpus 5Opus 4.810 个信源在谈事件专题推荐理由:ClaudeAI刚说Opus 5比Opus 4.8更擅长网络安全,但别指望它能搞漏洞利用,那还得看Mythos 5。原文稍后读已读值得跟进有用关注 ClaudeAI
01:53官方一手歸藏(guizang.ai)@op7418Claude Opus 5 已发布,定价与 Opus 4.8 相同。在多项基准测试中,Opus 5 成绩大幅优于 Opus 4.8,并且多数测评成绩高于 Fable 5。官方称其智能接近 Fable 5,但价格为 Fable 5 的一半。用户反馈该模型可用性明显提升。AI模型Claude Opus 5Opus 4.8Fable 510 个信源在谈事件专题推荐理由:Opus 5 性能强于 4.8,价格不变,还接近 Fable 5 但便宜一半,值得升级。原文稍后读已读值得跟进有用关注 Claude Opus 5
12:58Aravind Srinivas@AravSrinivas精选Perplexity CEO Arav Srinivas宣布,Perplexity Computer中新的协调模型基于GLM 5.2调整,性能接近前沿,但成本仅为Opus的0.344倍。该模型已成为该平台使用量第二大的协调模型,仅次于Opus 4.8。公司计划在获取更多算力后,通过积分提高使用上限,并推出后续训练更新版本。AI模型GLM 5.2Opus 4.8Perplexity Computer1 个信源在谈事件专题推荐理由:Perplexity把GLM 5.2调成自家Computer的协调模型,性能接近Opus但只花三成多成本,现在用的人已经排第二了。原文稍后读已读值得跟进有用关注 GLM 5.2
12:30官方账号arXiv cs.AI@Harmon Bhasin, Kevin Flyangolts, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Amanda Darling, Joshua Stallings, David Stern, Shawn Higdon, Claire Duvallet, Bryan Tegomoh, Kenny Workman新基准BioSecBench-Surveillance包含100个评估任务,覆盖7个类别,从分类到基因工程检测。16个模型-工具组合在3962次尝试中,最佳配置Opus 4.8 with PI仅达50.2%准确率,与GPT-5.5 with Codex并列。Opus 4.7 with PI为49.6%,Sonnet 4.6 with PI为48.6%。即使调用正确工作流,错误仍源于参考序列、阈值、过滤器等选择失误。该基准为衡量下次疫情爆发时AI代理的可信度提供了标准。AI模型BioSecBench-SurveillanceOpus 4.8GPT-5.51 个信源在谈事件专题推荐理由:想看看AI在基因组监测上多不靠谱?新基准BioSecBench-Surveillance测了16个模型,最好才一半正确,细节值得细读。原文稍后读已读值得跟进有用关注 BioSecBench-Surveillance
17:13宝玉@dotey经验分享用Claude Design生成可交互高保真原型替代传统产品文档。原型包含模拟数据,比文档更直观。在开发BaoCut时,没有维护设计文档,而是用原型来确认功能修改。工作流为:先提需求让Opus 4.8出原型稿,反复打磨后再让AI实现代码,还原度可达9成以上。技巧Claude DesignOpus 4.8高保真原型2 个信源在谈事件专题推荐理由:试试用Claude Design出高保真原型替代文档,改起来快,AI还原度还高,开发效率能提升不少。原文稍后读已读值得跟进有用关注 Claude Design
13:49AI Will@FinanceYF5精选71°Kimi K3 发布,参数规模达 2.8 万亿,支持 100 万 token 上下文和原生多模态。采用 Kimi Delta Attention 机制,百万 token 上下文中解码速度提升 6.3 倍。Attention Residuals 使训练效率提升约 25%,额外成本低于 2%。在 Online Exp、DECK-Bench、Finance-Bench 三项内部跑分中全面超过 Opus 4.8 和 GPT-5.5。该模型面向长周期 Agentic Coding 和自我进化工作流。AI模型Kimi K3Opus 4.8GPT-5.510 个信源在谈事件专题推荐理由:Kimi 新模型 K3 跑分赢了 Opus 4.8 和 GPT-5.5,2.8 万亿参数还带百万上下文,解码快到飞起,技术细节值得细看。原文稍后读已读值得跟进有用关注 Kimi K3
22:34techcrunch@Dominic-Madori Davis据 FT 报道,Moonshot 即将推出的 Kimi 3(Kimi K3)将成为中国最大的开源 AI 模型,参数量在 2 万亿到 3 万亿之间。该模型的目标是缩小与 Anthropic 的 Opus 4.8 在性能上的差距。Kimi 3 的参数量远超国内其他开源模型,有望提升推理和生成能力。若实现预期表现,它将成为中国开源模型在高端竞争中的重要里程碑。AI模型MoonshotKimi 3Opus 4.810 个信源在谈事件专题推荐理由:Moonshot 要发一个参数量 2-3 万亿的开源模型,目标直指 Anthropic Opus 4.8,而且是国内最大的开源模型,值得关注。原文稍后读已读值得跟进有用关注 Moonshot
14:48宝玉@dotey精选宝玉分享了开发 BaoCut App 的循环工作流:先用 baoyu-design skill 配合 Claude Code 内置浏览器和 Opus 4.8 模型设计原型。原型打磨后在同一会话内让 Claude Code 基于新 UI 实现功能,Fable 5 能将设计稿几乎 1:1 还原。测试通过后使用 Codex 的 CloudFlare Plugin 直接发布更新到 CF。Opus 4.8 设计能力优于 GPT 5.6 Sol,但 GPT 5.6 Sol 在非 UI 部分表现好。技巧BaoCutClaude Code编程助手4 个信源在谈事件专题推荐理由:宝玉公开了 BaoCut 的开发流程,教你用 Claude Code、Opus 4.8、Fable 5 和 Codex 分工协作,从原型到发布一步到位。原文稍后读已读值得跟进有用关注 BaoCut
06:09官方账号Simon Willison’s Weblog(博客/媒体)Simon Willison查看了Datasette开源项目的GitHub代码提交频率图,发现近期出现巨大峰值。该峰值与Opus 4.8、GPT-5.5、Fable 5和GPT-5.6 Sol等高级编码AI模型的使用时间吻合。这些模型显著提升了作者的代码产出频率,可视化地展示了AI辅助编程的效果。技巧DatasetteOpus 4.8GPT-5.52 个信源在谈事件专题推荐理由:Simon Willison用GitHub提交频率图,直观展示了Opus 4.8等AI编码助手让他的代码产出暴增,有趣又有说服力。原文稍后读已读值得跟进有用关注 Datasette
01:30Cognition@cognition_labsDevin Fusion 即日起整合新模型 Fable 5。Fable 5 每任务运行成本低于 Opus 4.8,尽管模型本身更昂贵。在委托和推理链等环节,成本效率提升显著。AI产品Devin FusionFable 5Opus 4.88 个信源在谈事件专题推荐理由:Devin 升级了!新模型 Fable 5 比 Opus 4.8 单任务成本更低,效率反而更高。原文稍后读已读值得跟进有用关注 Devin Fusion
22:00小互@imxiaohu社交平台用户称 Grok 4.5 在多数测试中能与 Opus 4.8 持平。该模型处理简单任务速度极快,被比喻为 SpaceX 火箭般的体验。用户还表示期待今晚 GPT5.6 的表现。AI模型Grok 4.5Opus 4.8GPT5.63 个信源在谈事件专题推荐理由:有人说 Grok 4.5 比肩 Opus 4.8,速度还快得像火箭,你要不要试一下?原文稍后读已读值得跟进有用关注 Grok 4.5
21:20AI Will@FinanceYF5Alexandr Wang表示Muse Spark 1.1是一款具备行业竞争力的Agentic和编程模型。该模型在多个Agentic评测中与GPT-5.5和Opus 4.8相抗衡。目前可通过Meta Model API和Meta AI直接使用。AI模型Muse Spark 1.1GPT-5.5Opus 4.83 个信源在谈事件专题推荐理由:Muse Spark 1.1在Agentic任务上声称能追上GPT-5.5,还能直接用Meta API调用,挺有吸引力。原文稍后读已读值得跟进有用关注 Muse Spark 1.1
11:23Aravind Srinivas@AravSrinivasPerplexity 为 Enterprise 组织启用了 Grok 4.5 模型。面向 Consumer Pro 和 Max 订阅用户,Grok 4.5 可作为计算机编排模型。在 WANDR 基准上,Grok 4.5 得分高于其他五种编排配置。其成本约为 Opus 4.8 的一半。AI模型Grok 4.5PerplexityOpus 4.83 个信源在谈事件专题推荐理由:Perplexity 现在能用 Grok 4.5 做编排了,比 Opus 4.8 便宜一半,性能还更强,Pro 和 Max 用户快去试试。原文稍后读已读值得跟进有用关注 Grok 4.5
06:04Paul Couvert@itsPaulAi开源模型Hy3与Hermes agent配合可自动化计算机上的任何任务。Hy3比其它开源模型更强,在部分用例上与Opus 4.8持平。其模型大小仅为GLM-5.2的一半,而GLM-5.2此前是最佳编码/智能体开源模型。目前用户可以免费使用。AI模型Hy3Hermes agentOpus 4.84 个信源在谈事件专题推荐理由:Hy3这个开源模型配Hermes agent能自动搞定电脑上的活,比GLM-5.2小一半,性能却和Opus 4.8差不多,现在还免费,赶紧试试。原文稍后读已读值得跟进有用关注 Hy3
08:49IT之家(博客/媒体)SpaceXAI与Cursor计划最早7月10日推出联合开发的首款AI模型,原定周三发布因效率提升推迟。该模型部分性能对标Anthropic Opus 4.8和OpenAI GPT 5.5。今年6月SpaceX以600亿美元全股票交易收购Cursor。新模型强调信息处理速度,企业AI工具市场竞争加剧。AI模型SpaceXAICursorGPT 5.510 个信源在谈事件专题推荐理由:SpaceXAI和Cursor联手搞了个新模型,据说能跟GPT 5.5和Opus 4.8打平手,好奇到底多强,可以看看评测。原文稍后读已读值得跟进有用关注 SpaceXAI
02:29elvis@omarsar0一条推文指出,Fable 5的发布凸显了多模型智能体编排的重要性。用户可借助Opus 4.8或Fable 5规划任务,用GPT-5.5执行,用GLM-5.2设计界面。通过精心协调,token利用率能显著提升。观点认为多数场景下无需Fable 5,优化编排策略更关键。技巧Fable 5Opus 4.8GPT-5.510 个信源在谈事件专题推荐理由:别盯着Fable 5一个模型,试试用Opus做规划、GPT执行、GLM设计,省token效果还好原文稍后读已读值得跟进有用关注 Fable 5
23:27berryxia@berryxia一位用户在内部工具中使用Fable 5实现Agent功能,称其运行非常流畅,而此前尝试Opus 4.8多次失败。用户没有提供具体基准分数,仅描述体验差异。Fable 5在该场景下表现优于Opus 4.8。AI模型Fable 5Opus 4.8智能体10 个信源在谈事件专题推荐理由:Fable 5做Agent功能比Opus 4.8靠谱,实测一次搞定,适合想快速上手的开发者。原文稍后读已读值得跟进有用关注 Fable 5
10:37AI Will@FinanceYF5用户将Blender连接到Fable 5,在20分钟内完成了纽约市全部建筑群的重建。它先从公开数据源抓取建筑数据,再依据数据建模,实现等比例3D模型。发布者称这种“先查数据再动手”的方法优于Opus 4.8的做法,展现了AI的功课意识。技巧BlenderFable 5Opus 4.89 个信源在谈事件专题推荐理由:有人用Blender加Fable 5,20分钟把纽约市3D重建出来了,还先去查公开数据再建模,比Opus 4.8那种瞎画强多了。原文稍后读已读值得跟进有用关注 Blender
08:00IT之家(博客/媒体)71°Anthropic于7月1日重新上架Claude Fable 5模型,但用户反馈其实际表现弱于此前版本。目前该模型每周最多使用50%额度,7月7日后将转为按用量积分计费。Reddit和X平台用户指出模型更频繁触发安全护栏并自动回退到Opus 4.8。测试平台@arena验证了这些结果。AI模型Claude Fable 5Opus 4.8Anthropic10 个信源在谈事件专题推荐理由:Anthropic重新上架了Fable 5,但用户觉得变笨了,还老回退到旧版,看看怎么回事。原文稍后读已读值得跟进有用关注 Claude Fable 5
08:36berryxia@berryxiaAnthropic发布的Claude Fable 5(底层为Mythos模型)因安全防护过度,在BridgeBench测试中性能显著下降。调试能力从86.2降至25.9(降幅70%),重构能力从73.6降至38.4(降幅48%)。幻觉控制从75.9降至61.7(降幅19%)。许多正常编程任务被误判为高风险,回退到Opus 4.8。用户支付Fable 5的价格却得到Opus 4.8的能力。AI模型Claude Fable 5AnthropicMythos10 个信源在谈事件专题推荐理由:Anthropic给Fable 5加了安全防护,结果调试能力暴跌70%,编程任务动不动就回退到Opus 4.8,相当于花高价用低配。原文稍后读已读值得跟进有用关注 Claude Fable 5
16:21AI Will@FinanceYF5用户Machina在X上反馈,使用Fable 5时任务被路由到Opus 4.8,后者又生成了Sonnet 5子代理,消耗了30%的周限额后只输出了劣质结果(slop)。而此前同一系统能一次性构建完整开放世界或重构整个代码库。用户愤怒质问Anthropic的更新方向。AI模型Fable 5Opus 4.8Sonnet 510 个信源在谈事件专题推荐理由:Anthropic用户吐槽新模型链路性能狂降,从全能变废物,还烧额度,老用户都在骂。原文稍后读已读值得跟进有用关注 Fable 5
16:00AI Will@FinanceYF5Fable 5回归不到一天,用户发现同样任务被自动路由给Opus 4.8,再派生Sonnet 5子代理执行,单次消耗30%周限额。最终结果被形容为"糊弄活",质量远不如以前。该模型此前能一次性写完整个开源库或重构整个代码库。路由链条变长后,体验反而明显下降。AI模型Fable 5Opus 4.8Sonnet 510 个信源在谈事件专题推荐理由:有用户发现Fable 5回归后,同样任务被拆给Opus 4.8和Sonnet 5,消耗大量限额但效果反而不如以前,体验缩水了。原文稍后读已读值得跟进有用关注 Fable 5
15:19AI Will@FinanceYF5一项测试比较了4个模型在3个HTML5物理场景(断桥脱轨、峡谷碰撞、怪兽卡车)中的表现。Fable 5 以 $3.12 成本获得 A+ 评级且无穿模,GPT 5.5 花费 $1.14 表现最接近,Opus 4.8 成本 $0.56 效果一般,GLM 5.2 仅 $0.08 但未赢任何一局。结果显示质量与价格尚未兼得。AI模型Fable 5GPT 5.5Opus 4.810 个信源在谈事件专题推荐理由:Fable 5 和 GPT 5.5 在物理模拟上差距明显,但价格差近三倍,看你在意效果还是成本。原文稍后读已读值得跟进有用关注 Fable 5
15:18AI Will@FinanceYF5精选Fable 5在三个HTML5物理演示场景中全部获得A+评级,消耗62158 tokens,成本3.12美元。GPT 5.5最接近Fable,消耗37753 tokens,成本1.14美元。Opus 4.8消耗22280 tokens,成本0.56美元。GLM 5.2最便宜,消耗36246 tokens,成本0.08美元,但未赢得任何场景。Fable是质量最佳选择,但成本是Opus 4.8的6倍。AI模型Fable 5GPT 5.5Opus 4.810 个信源在谈事件专题推荐理由:Fable 5写物理动画确实牛,但钱包要厚;GLM 5.2便宜到离谱,预算有限就选它。原文稍后读已读值得跟进有用关注 Fable 5
13:19AI Will@FinanceYF5Dan McAteer实测显示Sonnet 5在几乎每个基准测试上都差于Opus 4.8。但他强调在Claude Code中使用Dynamic Workflows时,将/model设为Sonnet 5、/effort设为Ultracode,复杂任务会自动触发动态工作流。未来Fable 5回归后可充当超智能顾问,Sonnet 5则作为快速执行者。技巧Sonnet 5Opus 4.8Claude Code10 个信源在谈事件专题推荐理由:别只看跑分,Dan教你怎么用Sonnet 5配Claude Code动态工作流干复杂活。原文稍后读已读值得跟进有用关注 Sonnet 5
13:18AI Will@FinanceYF5在 Claude Code 中通过三步设置:/model 切换为 Sonnet 5,/effort 设为 Ultracode,并开启 Dynamic Workflow,可使复杂任务自动触发多模型协作。Dan McAteer 认为该配置下 Fable 5 作为超级智能顾问、Sonnet 5 作为执行层,两者分工大幅提升效果。原基准成绩逊于 Opus 4.8 的 Sonnet 5 由此实现性能 “起飞”。技巧Sonnet 5Claude CodeOpus 4.810 个信源在谈事件专题推荐理由:想榨干 Sonnet 5?这个三步设置能把它变成执行高手,配上 Fable 5 当大脑,复杂任务直接起飞。原文稍后读已读值得跟进有用关注 Sonnet 5
09:41AI Will@FinanceYF5Anthropic 与美国政府沟通后更新了 Fable 5 的网络安全防护,短期内正常编程请求被误拦概率增加。一旦误拦触发,回复会替换为 Opus 4.8 模型。生物化学分类器保持原状,仍偏严,基础问题也可能被拦。促销持续到 7 月 7 日,可用 50% 周限额,超额可用 credits 续。AI模型Fable 5Opus 4.8Anthropic10 个信源在谈事件专题推荐理由:Anthropic 给 Fable 5 加了更严的安全过滤,编程时容易被误拦,拦了就自动切到 Opus 4.8,用之前得想好怎么绕过。原文稍后读已读值得跟进有用关注 Fable 5
06:25elvis@omarsar0一位用户发推抱怨,其代理设置(使用循环和自动化)在Max计划上已耗尽Opus 4.8的限额,而Fable 5不仅几乎无法使用,还被削弱了。该用户称这是最令人困惑的AI发布。帖子获得9个点赞和1170次查看。AI产品Opus 4.8Fable 5用户反馈10 个信源在谈事件专题推荐理由:有用户反馈说,Max计划下Opus 4.8有严重使用限制,Fable 5也被削弱了,大家注意避坑。原文稍后读已读值得跟进有用关注 Opus 4.8
05:27AI SDK@aisdkAnthropic 的 Claude Fable 5 模型因内置安全护栏可能拒绝部分请求。用户可通过配置将拒绝请求自动回退到 Opus 4.8 模型处理。此功能在 SDK 中提供,支持自定义每个护栏的 fallback 行为。目前已有 514 次查看和 9 个点赞。AI产品Claude Fable 5Opus 4.8Anthropic10 个信源在谈事件专题推荐理由:Anthropic 给 Claude Fable 5 加了安全护栏,请求被拒时可以自动切换到 Opus 4.8,开发时避免中断。原文稍后读已读值得跟进有用关注 Claude Fable 5
04:50elvis@omarsar076°Anthropic在与美国政府对话后,于全球重新部署Claude Fable 5模型,并新增一套分类器以阻止网络安全相关任务。短期内,部分常规任务(如编码和调试)将回退到Opus 4.8处理。Anthropic计划在未来数周内持续优化这些分类器,以减少误判。同时,他们正联合Amazon、Microsoft、Google等伙伴起草AI越狱严重性评估共识框架,并扩大与美国政府的合作,包括预发布模型安全评估和信息共享。AI模型Claude Fable 5AnthropicOpus 4.810 个信源在谈事件专题推荐理由:Anthropic把Claude Fable 5加了安全护栏重新上线,但代价是部分功能降级到Opus 4.8。想了解新模型具体被削了哪些能力、行业如何反应,可以看这篇。原文稍后读已读值得跟进有用关注 Claude Fable 5
03:48Guillermo Rauch@rauchg精选Vercel CEO 引用 8090.ai 的测试:在将 PHP 应用现代化为 Next.js 的任务中,Opus 4.8 搭配 Software Factory 比单独 Opus 4.8 便宜 1.4 倍、快 1.5 倍;换用 GLM 5.2 成本降低 16.4 倍,但速度慢 3 倍。测试为单样本方向性结果,后续将扩大样本量并对比美国开模型。AI模型GLMOpus 4.8Next.js10 个信源在谈事件专题推荐理由:GLM 搭配 8090 的 Software Factory 在代码迁移任务中成本砍到 1/16,虽然慢了点,但省钱效果很直观。原文稍后读已读值得跟进有用关注 GLM
19:27官方账号Decoder@Matthias BastianClaude Sonnet 5 在 Artificial Analysis Intelligence Index 中排名第五,得分53,在部分智能体任务上超过更贵的 Opus 4.8。但相比前代,每个任务多消耗约40%的 token,导致实际成本几乎翻倍。Anthropic 在保持标价不变的情况下通过增加 token 消耗实现隐藏涨价,这已成为一种模式。AI模型Claude Sonnet 5AnthropicOpus 4.810 个信源在谈事件专题推荐理由:Anthropic 的新模型 Sonnet 5 标价没变但每个任务多用四成 token,实际贵了一倍。想省钱得留意。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
16:50orange.ai@oran_geSonnet 5 因更换tokenizer导致实际费用与Opus 4.8相近,在GDPeval等金融基准上表现最佳。编程任务中Sonnet 5费用可能超过Opus 4.8,被用户吐槽。Opus 4.8擅长复杂编程和HTML设计,但写作不如Opus 4.6。GPT 5.5目前是编程首选。四款模型均已上线Cola平台。AI模型Sonnet 5Opus 4.8GPT 5.510 个信源在谈事件专题推荐理由:Sonnet 5 换了tokenizer后费用涨了,金融评测很强但编程费钱,Opus 4.8和GPT 5.5各有特长,选模型前先算账。原文稍后读已读值得跟进有用关注 Sonnet 5