13:41IT之家(博客/媒体)DeepReinforce推出Ornith-1.5系列开源模型,其最大397B规模模型部分性能超过Claude Opus 4.8;Ornith-1.5系列包含多规模模型,397B版在部分测试中胜过Claude Opus 4.8;该系列还有9B量化版本,可在iPhone 17等手机上运行。AI模型Ornith-1.5Claude Opus 4.8iPhone 17推荐理由:DeepReinforce刚发布了Ornith-1.5系列开源模型,里面有量化版居然能在iPhone 17手机上用,而且大模型性能和Claude Opus 4.8差不多甚至更强,和其他模型比也有优势,值得看看。原文稍后读已读值得跟进有用关注 Ornith-1.5
02:05elvis@omarsar079°Faraday是一个27B参数的智能体,基于Replica框架将论文复现转化为可扩展的强化学习任务。它调用编码agent作为工具,在held-out研究复现上击败了Claude Opus 4.8和GPT-5.5。奖励信号来自自动生成的rubric judge,与人类评估一致性高。论文已发布在arxiv.org/abs/2608.13331。AI模型FaradayClaude Opus 4.8GPT-5.51 个信源在谈事件专题推荐理由:一个叫Faraday的27B智能体,把论文复现变成强化学习任务,在测试集上赢了Claude Opus 4.8和GPT-5.5,还把编码agent当工具用,有点意思。原文稍后读已读值得跟进有用关注 Faraday
00:33官方账号Decoder@Jonathan Kemper83°AI智能体使用Claude Opus 4.8和GPT-5.6 Sol,在六天、3000美元API预算和GPU访问权限下独立撰写AI研究论文。这些论文交由未发表的NeurIPS论文原作者评审,结果全部为“Reject”。研究显示,Claude Opus 4.8和GPT-5.6 Sol能完成研究工程流程,但缺乏研究判断、创造性问题解决和放弃失败方法的能力。这一结果直接反驳了Anthropic与OpenAI关于自主AI研究即将实现的声明。论文Claude Opus 4.8GPT-5.6 SolAnthropic10 个信源在谈事件专题推荐理由:普林斯顿和英国AI安全所让Claude和GPT-5写论文,全拒,打脸Anthropic和OpenAI。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
01:10官方账号LangChain@LangChainAI精选LangChain在Deep Agents评测套件中测试了NVIDIA开源路由器Switchyard,该套件包含145个多步任务,覆盖工具使用、检索、文件系统操作和长上下文场景。结果显示,93%的调用被路由到30B模型,仅7%需要Claude Opus 4.8。通过路由策略,总成本降低约70%,同时保留了Opus约90%的准确率。LangChain已推出与Switchyard的deepagents集成。AI产品SwitchyardNVIDIALangChain10 个信源在谈事件专题推荐理由:想知道你的智能体能不能少花点钱?LangChain实测NVIDIA的Switchyard,93%任务用30B模型搞定,成本砍七成,准确率还保住九成。原文稍后读已读值得跟进有用关注 Switchyard
21:51官方账号Decoder@Maximilian Schreiner阿里发布的Qwen3.8 Max在Artificial Analysis Intelligence Index上得分56,比上一代Qwen3.7 Max的46分高出10分。该分数追平了Claude Opus 4.8。但Kimi K3的得分更高,且成本低25%。AI模型Qwen3.8 MaxClaude Opus 4.8Kimi K310 个信源在谈事件专题推荐理由:Qwen3.8 Max一口气涨10分追平Claude,但Kimi K3更便宜还更强,值得看。原文稍后读已读值得跟进有用关注 Qwen3.8 Max
11:56官方账号arXiv cs.AI@Jens Lehmann, Andrei Aioanei, Sahar Vahdati论文提出Tycho编码代理系统,在ARC-AGI-3的25个公开游戏中用Claude Opus 4.8测试四种编排策略,Actor请求委托策略获得最高平均RHAE 88.49。GPT-5.6 Sol和Opus 5在该策略下均达到100.00 RHAE,并完成全部183个关卡。Opus 5比官方人类基线少用61%的计分动作,游戏均衡首轮人类重播中位排名为100.0。自动修复策略虽能更准确复现观察转移,但RHAE仅83.07,说明还需决定何时构建、修复或绕过模型。论文TychoARC-AGI-3Claude Opus 4.8推荐理由:Tycho让AI在ARC-AGI-3里边玩边建模,GPT-5.6和Opus 5都满分通关,动作效率还胜过人类基线。原文稍后读已读值得跟进有用关注 Tycho
11:23官方一手arXiv: DeepSeek@Jia Liu, Veena Krishnaraj, Kateryna Vovk, Kosuke Aizawa, Adrian E. Bayer, Linda Blot, Jessica Cowell, Suyog Garg, Jonathan Grée, Anamaria Hell, Ben Horowitz, Masaya Ichikawa, Kanyuni Iemoto, Keigo Kondo, Zacharie Lorsin, Kevin McCarthy, Jamie Robinson, Miguel Ruiz-Granda, Leander Thiele, Ievgen Vovk, Mingshen Zhou该研究测试了大型语言模型(LLMs)在科研项目规划和提案评估中的表现。人类研究者与ChatGPT、Claude、DeepSeek(2025年中模型)分别生成了8个专家构思的研究项目的一页计划,共计32份提案。4位人类评审员和2个前沿LLM(Claude Opus 4.8、ChatGPT Pro 5.5)采用四维度评估标准盲审。人类评审员对AI和人类提案的整体评分相似,而AI评审员对AI提案的评分平均高出约1分(5分制)。人类评审员正确识别人类和AI提案的比例分别为72%和79%,而两个AI评审员均100%正确分类。研究表明当前LLM能生成与人类提案相当的计划,但AI评审员存在系统性偏好。论文ChatGPTClaudeDeepSeek推荐理由:这篇论文测试了ChatGPT、Claude、DeepSeek写科研计划的能力,发现人类评委分不出好坏,但AI评委偏爱AI写的。值得一读。原文稍后读已读值得跟进有用关注 ChatGPT
11:30官方账号arXiv cs.AI@Koyar Afrasyab一项研究评估了证据充分性提示对临床语言模型的影响,使用Real-POCQi、HealthBench和MedRBench基准,测试GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash和Grok 4.3四个模型。结果显示,不安全过度自信从49.3%降至24.7%,但效果幅度依赖于评判模型:主要评判模型GPT-5.4-nano显示24.7个百分点的降低,而Claude Sonnet 5则只有13.1个百分点。安全增益伴随有用性成本,正确诊断率从80.3%降至50.3%,对Gemini影响较大(-58个百分点)。盲法临床医生审查指出主要评判模型灵敏度高(1.00)但特异性低(0.55)。论文GPT-5.5Claude Opus 4.8Gemini 3.5 Flash推荐理由:这篇论文揭示了AI安全评判的一个关键陷阱:安全增益可能只是评判模型的偏好,不是真实改进。告诉你为什么不能只看一个评判指标。原文稍后读已读值得跟进有用关注 GPT-5.5
03:07The Rundown AI@therundownaiMoonshot发布开源模型Kimi K3。早期基准测试中,Kimi K3全面超越Claude Opus 4.8。性能与Fable和GPT 5.6 Sol相当。定价与Sonnet相同。可能成为今年DeepSeek时刻。AI模型Kimi K3MoonshotClaude Opus 4.810 个信源在谈事件专题推荐理由:开源模型Kimi K3性能吊打Claude Opus 4.8,价格却和Sonnet一样,值得关注。原文稍后读已读值得跟进有用关注 Kimi K3
04:40Aravind Srinivas@AravSrinivas精选Perplexity CEO Arav Srinivas透露,SpaceXAI的Grok 4.5在内部代理研究基准WANDR上获得最高分。该模型作为orchestrator集成到Perplexity Computer中,价格仅为Claude Opus 4.8(高)的一半。Grok 4.5还以相近成本超越了Perplexity当前GLM 5.2后训练模型的表现。该模型现已面向Consumer Pro和Max订阅用户提供。AI模型Grok 4.5Claude Opus 4.8Perplexity推荐理由:Perplexity把Grok 4.5作为Computer的编排模型,代理研究任务得分最高,价格只有Opus 4.8的一半,值得试。原文稍后读已读值得跟进有用关注 Grok 4.5
09:04IT之家(博客/媒体)72°SpaceXAI与Cursor联合开发的AI模型最快当地时间今日面世,部分性能可与Anthropic Claude Opus 4.8或OpenAI GPT-5.5相媲美。双方尚未完成600亿美元收购交易,但开发人员已展开技术合作。马斯克透露Grok 4.5基于1.5T V9基座模型,已在其旗下企业测试。Cursor首席执行官称正使用SpaceXAI Colossus数据中心从零训练模型,欲与Anthropic和OpenAI直接竞争。AI模型SpaceXAICursorGPT-5.510 个信源在谈事件专题推荐理由:马斯克的SpaceXAI联手Cursor搞了个新模型,据说能跟GPT-5.5和Claude Opus 4.8掰手腕,可以看看。原文稍后读已读值得跟进有用关注 SpaceXAI
12:46shao__meng@shao__meng精选71°Flask/Sentry 工程师 @mitsuhiko 发现,Claude Opus 4.8 与 Sonnet 5 在调用 Pi 的嵌套 edits[] 工具时,会在 edit 对象末尾产生 requireUnique、type、id 等虚构字段,导致 schema 校验失败。此问题在单轮 prompt 下不出现,在长 agentic 历史中复现率约 20%。去掉历史中的 thinking 块后失败率减半,开启 strict 模式后问题消失。作者推测根因是 Anthropic 的 RL 后训练在 Claude Code 的 forgiving harness 中进行,该 harness 接受参数别名和未知键,导致模型学到“edit 操作可多带可选字段”的先验。相比之下,OpenAI 的 harmony 路线在 prompt 中显式标记 JSON 边界并支持约束采样,未出现此回归。AI模型Claude Opus 4.8Sonnet 5Anthropic10 个信源在谈事件专题推荐理由:Armin 用实际 bug 案例拆解了 Claude 新模型在工具调用上的奇怪倒退,解释了为什么更强的模型反而更不听话,读起来很爽。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
02:50Marc Andreessen@pmarcaBinghui Peng等人在最新研究中,使用GPT 5.5 Pro和Claude Opus 4.8构建的简单pipeline成功解决了9个前沿数学开放问题。其中包括4个来自COLT(计算学习理论会议)开放问题列表的问题,1个来自FOCS(计算机科学基础研讨会)的问题,以及4个来自交换代数领域的问题。项目代码已在GitHub公开。AI模型GPT 5.5 ProClaude Opus 4.8OpenAI10 个信源在谈事件专题推荐理由:这篇展示了用GPT和Claude联手破解COLT、FOCS等顶会未解难题,还开源了pipeline,做理论计算的值得看看。原文稍后读已读值得跟进有用关注 GPT 5.5 Pro
14:08IT之家(博客/媒体)普林斯顿大学发布CEO-Bench基准测试,模拟创业公司500天经营,初始资金100万美元。多数模型在500天内破产,Claude Fable 5期末现金达4715万美元,是唯一多次运行均高于初始余额的模型。Claude Opus 4.8和GPT-5.5分别以2777万美元和2129万美元位列其后。Grok 4.20表现最差,平均仅维持28天。基于规则的基准模型期末现金为1580万美元。AI模型CEO-BenchClaude Fable 5Claude Opus 4.810 个信源在谈事件专题推荐理由:普林斯顿搞了个AI当老板的模拟考试,Claude Fable 5赚了4700万,其他大多破产,这测试挺能看出谁更适合做长期决策。原文稍后读已读值得跟进有用关注 CEO-Bench
12:16AI Will@FinanceYF5精选73°Claude 正式进驻 Microsoft Foundry,即日起全面开放。Azure 账号可直接调用 Claude Opus 4.8 和 Haiku 4.5,身份验证、计费、合规管控沿用 Azure 现有体系。支持 prompt caching 和扩展思考功能,并覆盖有美国数据驻留需求的团队。这降低了企业使用 Claude 的门槛。AI产品ClaudeMicrosoft FoundryAzure3 个信源在谈事件专题推荐理由:Azure 用户现在可以直接用 Claude Opus 4.8 和 Haiku 4.5,不用改现有身份和计费系统,企业部署更快了。原文稍后读已读值得跟进有用关注 Claude
13:06lmarena.ai@lmarena_ai精选72°GLM-5.2 (Max) 在 Code Arena 前端排行榜上获得第2名,比 Claude Opus 4.7 (Thinking) 高出 29 分。在 React 子榜单排名第2,HTML 子榜单第4。在品牌营销、数据与分析、消费产品等6个子类别中均位列第一。该模型是开源模型中对 Kimi-K2.6 和 Minimax-M3 优势最大的。在社区投票的单次前端编码测试中展示了10个对比案例。AI模型GLM-5.2Code ArenaClaude Opus 4.82 个信源在谈事件专题推荐理由:GLM-5.2 在社区投票的编码竞技场上压过 Claude Opus,你可以在前端任务中试试它的单次生成效果。原文稍后读已读值得跟进有用关注 GLM-5.2
12:57IT之家(博客/媒体)Anthropic致信美国参议院,指控阿里巴巴在4月22日至6月5日期间使用约2.5万个欺诈账户进行了2880万次对话,对其Claude模型实施“迄今已知最大规模的蒸馏攻击”。蒸馏是一种利用更强模型输出训练更小模型的技术。然而,Anthropic自家旗舰模型Claude Opus 4.8于5月发布后,被用户发现回答中自称是阿里通义千问(Qwen)或DeepSeek,引发双标争议。埃隆·马斯克也批评Anthropic曾大规模盗用训练数据并支付和解金。行业Anthropic阿里巴巴模型蒸馏10 个信源在谈事件专题推荐理由:Anthropic刚发的Claude Opus 4.8被揭套壳千问和DeepSeek,转头就告阿里偷模型,马斯克都看不下去了,这瓜绝对值得吃。原文稍后读已读值得跟进有用关注 Anthropic
10:55官方账号arXiv cs.LG@Hannah Le, Ramesh Ramasamy, Alex Urrutia, Mahsa Yazdani, Tim Proctor, Kenny WorkmanTxBench-PP是一个用于评估AI agent在小分子临床前药理学中决策能力的基准,包含100个涉及作用机制、药效学等任务的评估。在16个模型配置(涉及11个模型和4800条轨迹)中,最佳配置Claude Opus 4.8 / Pi仅通过59.3%(178/300)的端点尝试,GPT-5.5 / Pi通过55.3%。结果表明,当前AI系统无法可靠复现临床前药理学决策。AI模型TxBench-PPClaude Opus 4.8GPT-5.51 个信源在谈事件专题推荐理由:想看看AI在药物发现中到底行不行?这个基准测试用4800条轨迹告诉你,Claude Opus 4.8和GPT-5.5都还差得远,最高才59.3%的通过率。原文稍后读已读值得跟进有用关注 TxBench-PP
13:50@hebbia@hebbia精选73°Hebbia CTO 指出 Claude Opus 4.8 在金融工作流中实现了更强的引用准确性。相比前代,它在处理复杂金融文档时 token 效率显著提升。新模型适用于需要高精度引用的财务分析场景。AI模型Claude Opus 4.8Hebbia金融1 个信源在谈事件专题推荐理由:Hebbia 的 CTO 亲测说 Claude Opus 4.8 在金融任务上引用更准、省 token,做财报分析的团队可以试试。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
04:51宝玉@dotey精选Anthropic 推出的 Claude Design 能根据一句话描述生成可交互原型,点哪都有反应,状态保持完整。作者拆解了 Agent 的 Harness 层和模型层,指出 Harness 层技术不复杂,但 Claude Opus 4.8 在 UI/UX 和系统架构设计上远超 GPT-5.5。Claude Design 的产出物是 React 代码和 JSON 数据结构,开发者可直接复用。作者认为 Codex 不推类似产品是因为 GPT-5.5 模型能力不足,无法一次性交付完整可交互原型。AI模型Claude DesignClaude Opus 4.8GPT-5.510 个信源在谈事件专题推荐理由:拆解 Claude Design 为何比 Codex 强原文稍后读已读值得跟进有用关注 Claude Design
16:54官方账号Decoder@Matthias BastianMoonshot AI 发布了开源模型 Kimi K2.7 Code,拥有 1 万亿参数,专为编程任务设计。在编程基准测试中,Kimi K2.7 Code 仍落后于 GPT-5.5 和 Claude Opus 4.8,但每 token 价格比它们低 12 倍。用户需权衡:在相同预算下,使用 Kimi K2.7 Code 能获得更多推理次数,但质量可能有所下降。AI模型Kimi K2.7 CodeMoonshot AIGPT-5.57 个信源在谈事件专题推荐理由:编程省钱利器,12倍性价比原文稍后读已读值得跟进有用关注 Kimi K2.7 Code
08:33lmarena.ai@lmarena_ai精选76°Anthropic 的 Claude Opus 4.8 在 Agent Arena 排行榜上首次亮相,在 Thinking 模式下与 GPT 5.5 (High) 并列第一,但在 Non-Thinking 模式下仅排第八。相比前代 Opus 4.7,Opus 4.8 在开启思考时任务完成率更高,但可操控性略差,从 bash 错误中恢复更慢,且工具幻觉率上升。Agent Arena 基于 30 万+任务、200 万+工具调用和 4000 万行代码,通过因果追踪方法评估模型在真实世界智能体任务中的表现。该排行榜衡量任务成功、可操控性、错误恢复、用户反馈和工具幻觉五个信号。AI模型智能体模型评测Claude Opus 4.810 个信源在谈事件专题推荐理由:Agent Arena 用真实任务和因果推断评估智能体,比传统基准更贴近实际使用场景。做智能体开发或选型的团队,值得关注这个排行榜来对比模型的实际表现。原文稍后读已读值得跟进有用关注 智能体
20:32rohanpaul_ai@rohanpaul_ai72°Cognition 推出 FrontierCode 编码基准测试,评估 AI 生成的代码是否达到人类维护者愿意合并的质量,而不仅仅是能否通过测试。该基准包含 150 个任务,由 20 多位开源维护者设计,每个任务耗时超 40 小时。结果显示,最强模型 Claude Opus 4.8 在最高难度 Diamond 子集上仅得 13.4%,GPT-5.5 得 6.3%,Gemini 3.1 Pro 得 4.7%。评分系统引入“阻塞项”机制,任何导致无法合并的问题(如行为错误、不安全改动)直接判 0 分,通过后才按可读性、类型安全等软质量项加权。这揭示了当前 AI 编程助手在代码设计、约束和项目风格适配上的严重不足。AI产品基准测试代码质量Claude Opus 4.83 个信源在谈事件专题推荐理由:FrontierCode 把 AI 编程评测从「能跑就行」升级到「能合并才算数」,做代码质量评估或 AI 编程工具的团队值得关注——它暴露了当前模型在真实代码审查中的致命短板。原文稍后读已读值得跟进有用关注 基准测试
10:03shao__meng@shao__meng精选76°Cognition 发布 FrontierCode 评估基准,旨在衡量 AI 模型生成代码的“可合并性”,而非仅通过单元测试。该基准包含 150 个来自 36 个旗舰开源仓库的任务,由 20 多位维护者参与,每个任务耗时 40 小时以上。评估沿六个维度(行为正确性、回归安全、机械整洁、测试质量、Scope 纪律、代码质量)打分,并设置 blocker 和 non-blocker 标准。结果中 Claude Opus 4.8 在 Diamond 子集得分 13.4%,GPT-5.5 为 6.3%,Kimi K2.6 仅 3.8%,显示前沿模型仍有巨大提升空间。AI模型CognitionFrontierCode代码评估3 个信源在谈事件专题推荐理由:FrontierCode 把 AI 编程评估从“能跑就行”升级到“能合并”,做代码质量评估或 AI 编程工具的团队可以直接参考这套标准,看看自己的模型在真实维护者眼中能拿几分。原文稍后读已读值得跟进有用关注 Cognition
08:46Gary Marcus@GaryMarcus83°Gary Marcus 发推指出 METR 的编码基准已饱和,但 Cognition 随即推出更难的 FrontierCode 评测,最高分仅 13.4%。该评测由顶级开源维护者花费 40+ 小时设计,首次衡量代码是否可合并维护,而非仅功能正确。这揭示了当前模型在编写可维护代码方面的严重不足,为 AI 编程能力评估设立了新标准。AI模型编码基准FrontierCodeClaude Opus 4.83 个信源在谈事件专题推荐理由:做 AI 编程评估或关注模型实际能力的开发者,这个新基准直接戳中了当前模型的软肋——代码能跑但不可维护,值得看看你的模型能拿几分。原文稍后读已读值得跟进有用关注 编码基准
14:42宝玉@dotey开发者 @dotey 在 X 上反馈,Codex GPT-5.5 在开发 Mac 应用时表现不如 Claude Opus 4.8,认为 Opus 更擅长此类任务。另有用户 @jesselaunz 称 Codex 突然降智,原本计划跑 2 天的目标 20 分钟就交付,但评分仅 5/10。这些反馈表明不同模型在特定开发场景下存在显著差异,开发者需根据任务类型选择合适的模型。AI产品CodexGPT-5.5Claude Opus 4.8推荐理由:做 Mac 应用开发的团队注意了——实测表明 Codex GPT-5.5 在特定场景下可能不如 Claude Opus 4.8,选模型前建议先看任务类型,避免踩坑。原文稍后读已读值得跟进有用关注 Codex
14:15AI Will@FinanceYF5Greg Isenberg 在播客中未讨论 Claude Opus 4.8,认为截至 5 月 29 日该模型相比 GPT 5.5 没有实质性提升。这一观点暗示当前 AI 模型迭代正进入类似 iPhone 时代的渐进式改进阶段,而非颠覆性突破。对于关注模型能力对比的开发者与用户,这提示需更理性看待新版本发布。行业模型发布Claude Opus 4.8GPT 5.52 个信源在谈事件专题推荐理由:Greg Isenberg 的观察点破了模型发布泡沫,做模型选型或关注 AI 进展的团队值得一看,避免被营销节奏带偏。原文稍后读已读值得跟进有用关注 模型发布
14:15AI Will@FinanceYF5Greg Isenberg 认为 Claude Opus 4.8 相比 GPT 5.5 没有显著提升,模型发布已进入类似 iPhone 的微调迭代阶段。他指出,基准测试与用户感受脱节,真正的价值在于模型周边的工具创新,如 Claude Code 的动态工作流和 Codex 的桌面应用。他预测 6 个月内用户将不再关心具体模型,就像不关心 Uber 的引擎一样。行业Claude Opus 4.8GPT 5.5模型迭代2 个信源在谈事件专题推荐理由:模型同质化趋势下,真正改变开发效率的是工具链创新——做 AI 应用或自动化流程的团队,建议关注 Claude Code 动态工作流和 Codex 桌面应用,而非纠结模型版本号。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
10:36Skywork@Skywork_ai88°Anthropic 最新模型 Claude Opus 4.8 已在 Skywork 平台上线。该模型在判断力和推理能力上有显著提升,能够处理更复杂的任务。Skywork 用户现在可以直接使用该模型进行对话和推理。这标志着 Anthropic 在 AI 模型能力上的持续进步。AI模型Claude Opus 4.8推理模型Skywork10 个信源在谈事件专题推荐理由:Claude Opus 4.8 的更强推理能力对需要高精度判断的开发者(如代码审查、逻辑分析)是直接利好,Skywork 用户现在就能体验,建议试试。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
10:30shao__meng@shao__mengClaude Opus 4.8 在基准测试、诚实度和长任务处理上优于 4.7,但作者认为这种进步对用户来说并不构成真正的改变,只是 4.7 的升级版。对于已经在用 Opus 4.7 的用户,切换到 4.8 是自然的选择,但不会吸引 GPT-5.5 或 DeepSeek 的用户迁移。作者指出,除非 Opus 5 有重大突破,否则难以撼动现有格局。AI模型Claude Opus 4.8模型对比升级3 个信源在谈事件专题推荐理由:如果你在用 Opus 4.7,升级到 4.8 是顺理成章的事;但如果你是 GPT 或 DeepSeek 用户,这次更新不值得你切换。做模型选型的团队可以看看这篇冷静分析,避免被 Benchmark 数字带偏。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
09:59elvis@omarsar0Claude Opus 4.8 在 DeepSWE Bench 上取得 58% Pass@1 的成绩,排名第二,仅次于 GPT-5.5。该模型在原始分数上略逊一筹,但在多个最新基准测试中展现出最高的可靠性和效率。这一结果延续了近期趋势:模型在追求极致性能的同时,更注重实际应用中的稳定性和资源效率。对于关注 AI 编程和模型选型的开发者来说,这是一个值得关注的信号。AI模型Claude Opus 4.8GPT-5.5DeepSWE Bench10 个信源在谈事件专题推荐理由:Claude Opus 4.8 在 DeepSWE Bench 上以 58% Pass@1 证明了自己是效率与可靠性的标杆,做 AI 编程选型的团队可以把它作为性价比参考。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
16:10shao__meng@shao__mengClaude Opus 4.8 发布后,用户反馈普遍认为相比 Opus 4.7 升级不大,甚至变笨,部分用户更倾向于 GPT-5.5。有用户尝试测试新模型时,发现自己的账号被莫名封禁,即使仅注册后发过一次消息。该事件引发对 Anthropic 模型更新策略和账号管理问题的讨论。AI产品Claude Opus 4.8模型更新账号封禁10 个信源在谈事件专题推荐理由:Claude 重度用户和开发者需要注意:Opus 4.8 口碑不佳,且账号封禁问题频发,建议谨慎更新和备份数据。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
11:47Milvus@milvusio精选Claude Opus 4.8 提升了编码智能体的独立工作能力、判断力和自我检查能力,使其不再只是生成代码片段,而是能规划变更、调用工具、编辑文件、检查输出,并在同一工作流中持续更长时间。这种变化改变了检索的角色:智能体检索错误上下文会导致后续计划、工具调用、代码修改和记忆都出错。因此,检索不能仅停留在“找几个相似片段”,而需要相关、新鲜、有范围且可追溯的上下文。Milvus 等向量数据库通过混合搜索、元数据过滤和生产级上下文访问,为智能体提供高质量的检索层。AI产品Claude Opus 4.8编码智能体检索增强生成10 个信源在谈事件专题推荐理由:Claude Opus 4.8 让编码智能体更自主,但检索质量成为瓶颈——做智能体开发或 RAG 的团队,建议关注 Milvus 如何解决上下文精准问题。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
11:29Marc Andreessen@pmarcaMarc Andreessen转发Greg Isenberg观点,认为AI模型发布正变得像iPhone迭代一样,每次升级差异微小,用户难以感知实质性提升。以Claude Opus 4.8为例,它相比GPT 5.5并无明显优势,基准测试与用户感受脱节。真正改变游戏规则的是模型周边的工具创新,如Claude Code的动态工作流和Codex的桌面应用。预计6个月内,用户将不再关心底层模型,就像不关心Uber的引擎一样。行业模型迭代Claude Opus 4.8GPT 5.510 个信源在谈事件专题推荐理由:模型同质化趋势已现,做AI应用开发的团队应关注工具生态而非模型本身——Claude Code和Codex的进展更值得投入时间。原文稍后读已读值得跟进有用关注 模型迭代
06:42rohanpaul_ai@rohanpaul_ai88°Anthropic 在宣布 9650 亿美元估值融资的同一天,发布了 Claude Opus 4.8 模型。KogAI 在 8× AMD MI300X GPU 上实现了 3000 tokens/s 的推理速度,在 8× NVIDIA H200 上达到 2100 tokens/s。Datacurve 推出了更严格的编程基准 DeepSWE,用于区分领先模型。OpenAI 与 Thrive 合作构建了准确率高达 97% 的自我改进税务智能体。AI产品AnthropicClaude Opus 4.8推理速度10 个信源在谈事件专题推荐理由:Anthropic 估值逼近万亿,Claude Opus 4.8 同日发布,关注前沿模型进展的开发者值得一看。KogAI 的推理速度数据对做推理优化的团队有参考价值。原文稍后读已读值得跟进有用关注 Anthropic
00:57宝玉@dotey72°Anthropic 在发布 Claude Opus 4.8 的同时,上线了 API 层面的新能力:mid-conversation system messages(对话中途系统消息)。该功能允许在对话过程中动态修改系统提示词,且不影响 Prompt Caching。对于 Agent 开发者来说,这解决了之前无法在对话中途覆盖原始系统指令的痛点,例如让一个被设定为只写文档的系统设计师角色转变为可以写代码的开发工程师。目前该功能仅支持 Claude Opus 4.8,且仅在 Anthropic 自家 API 和 AWS 上的 Claude Platform 可用。系统消息不能放在对话开头,也不能连续放置两条,必须跟在 user 消息后面。AI产品Claude Opus 4.8AnthropicAPI10 个信源在谈事件专题推荐理由:做 Agent 开发的团队终于可以动态调整系统提示词了,不用再靠 hack 方式覆盖指令,建议直接试。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
17:57AI SDK@aisdkAnthropic 发布了 Claude Opus 4.8,这是 Opus 4.7 的升级版本。新模型在判断力上更加敏锐,对自身进展的表述更诚实,并且能够比前代更长时间地独立工作。该模型现已可用,价格与 Opus 4.7 相同。AI SDK 已支持集成该模型,开发者可以立即使用。AI模型Claude Opus 4.8推理模型AI SDK10 个信源在谈事件专题推荐理由:Claude Opus 4.8 提升了判断力和自主工作能力,做复杂推理和长任务自动化的开发者可以直接用上,价格不变值得升级。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
17:54Dify@dify_aiClaude Opus 4.8 现已集成到 Dify 平台,用户可以在 Dify 中直接调用该模型构建多步骤 AI 工作流。该模型具备更强的推理能力,能自动化复杂任务。Dify 支持连接模型、工具、知识库和工作流逻辑,帮助用户从早期探索过渡到结构化、可复用的工作流。用户可通过 Dify 市场更新使用。AI产品Claude Opus 4.8DifyAI工作流10 个信源在谈事件专题推荐理由:Dify 用户终于能用上 Claude Opus 4.8 的强推理能力来构建多步工作流,做自动化流程的团队可以直接在平台上试,省去模型切换的麻烦。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
13:27IT之家(博客/媒体)72°Anthropic 今日发布旗舰大模型 Claude Opus 4.8,并宣布完成 650 亿美元融资,估值逼近万亿美元。然而,模型上线后不久,用户通过 API 测试发现,Opus 4.8 在回答身份问题时自称是阿里通义千问或 DeepSeek,引发“蒸馏”争议。Anthropic 此前曾指责中国公司进行“工业规模的蒸馏攻击”,但自身模型却出现类似问题,被指“双标”。新模型在编码、推理等方面有提升,并增加了“思考强度控制”功能。行业Claude Opus 4.8蒸馏Anthropic10 个信源在谈事件专题推荐理由:Anthropic 一边指责中国公司蒸馏,一边自己的模型却自称是千问和 DeepSeek,做 AI 模型训练或关注行业伦理的开发者值得看看这场“双标”闹剧。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
11:36AI Will@FinanceYF588°Anthropic 发布了 Claude Opus 4.8,这是 Opus 4.7 的升级版本。新模型在判断力上更加锐利,对自己的进展更加诚实,并且能够比前代更长时间地独立工作。该模型今日上线,价格保持不变。这一更新提升了 Claude 在复杂任务中的可靠性和自主性,对需要长期推理和决策支持的开发者与团队尤为重要。AI模型Claude Opus 4.8推理模型自主工作10 个信源在谈事件专题推荐理由:Claude Opus 4.8 在判断力和自主性上的提升,直接解决了长任务执行中的可靠性痛点,做复杂推理和自动化流程的团队值得立即试用。原文稍后读已读值得跟进有用关注 Claude Opus 4.8