11:47官方一手arXiv: OpenAI@Til Jordan研究人员测试了九个来自三家公司的大语言模型,探究门脸效应(先提大要求被拒后再提小要求)是否有效。在Anthropic的Opus 5模型上,该技术使合规率从29.3%提升至65.8%。但在OpenAI和Google的前沿模型以及Haiku 4.5上,反而降低了15.5至23.0个百分点的合规率。研究发现,拒绝行为本身对所有模型都有影响,但模型家族对拒绝的反应各不相同。论文Opus 5门脸效应拒绝行为10 个信源在谈事件专题推荐理由:Anthropic模型对人类说服技巧有反应,而OpenAI和Google模型反而更抗拒,这种差异很有意思。原文稍后读已读值得跟进有用关注 Opus 5
08:48shao__meng@shao__meng78°Gemini 3.8 Flash 在六周内第三次发布,距 3.7 Flash 仅三周。该模型在 Vals Finance Agent v2 达到 61.4%,高于 Opus 5 的 58.6%。Terminal-bench 2.1 得分 89.4%,略高于 Opus 5。在成本效率方面,3.8 Flash 以约 1/7 到 1/8 的任务成本实现了与 Opus 5 几乎相同的通过率。AI模型GeminiGemini 3.8 FlashOpus 510 个信源在谈事件专题推荐理由:Google 发布了 Gemini 3.8 Flash,价格更低但性能接近前沿模型,成本效率大幅提升。原文稍后读已读值得跟进有用关注 Gemini
03:45elvis@omarsar073°Claude推出Fable 5.1模型,在典型工作负载上降低成本约25%,在高智能体任务上降低约45%。该模型针对科学工作流程进行了优化,提高了令牌效率,在写作和文本生成方面表现更佳。Opus 5仍能满足大多数任务需求,而Fable 5.1则作为更复杂协调器和验证者。AI模型ClaudeFable 5.1Opus 53 个信源在谈事件专题推荐理由:Claude新出的Fable 5.1比Opus 5成本更低,特别适合科学工作流,是日常使用的不错选择。原文稍后读已读值得跟进有用关注 Claude
18:53AI Will@FinanceYF578°Anthropic最强模型Fable 5仅占客户购买Token的6%,价格是Opus 5的两倍,但性能仅落后0.5%,单任务成本减半。企业主要在高难度任务上使用Fable 5,成本更低可能带来更高毛利。AI模型AnthropicFable 5Opus 57 个信源在谈事件专题推荐理由:Anthropic的Fable 5虽然价格高,但性能仅略逊于Opus 5,成本却低一半,适合高难度任务,值得关注。原文稍后读已读值得跟进有用关注 Anthropic
05:03官方账号Simon Willison’s Weblog(博客/媒体)78°Anthropic的年度收入达到650亿美元,预计第三季度将盈利。尽管如此,其Opus 5模型在7月份发布后,用户增长缓慢,Ramp AI指数显示其市场份额仅为8.0%。与此同时,OpenAI的年度收入增长35%,达到400多亿美元,GPT 5.6的发布推动了公司业绩。行业AnthropicOpus 5OpenAI10 个信源在谈事件专题推荐理由:Anthropic的Opus 5模型虽然性能强大,但因其成本较高而难以吸引用户,相比之下,OpenAI的GPT 5.6凭借较低的成本获得了更多用户。原文稍后读已读值得跟进有用关注 Anthropic
05:35Browser Use@browser_useOpus 5 和 GPT-5.6 Sol 在浏览器使用基准测试中表现接近。该基准由数百名用户参与,将真实用户任务转化为测试。测试采用原子化、可验证且明确的评估标准。这是目前最好的浏览器智能体基准测试。AI模型Opus 5GPT-5.6 Sol智能体推荐理由:Opus 5 和 GPT-5.6 Sol 在一个新浏览器基准上打平了,这个基准是真实用户任务,评估标准很细,看看谁更会上网吧。原文稍后读已读值得跟进有用关注 Opus 5
12:59Amjad Masad@amasad72°Jeremy Berman 使用 Claude Code + Opus 5(high)在 ARC-AGI-3 上拿到 96.2% 准确率,pass@2 为 99.3%。方案仅包含一个动作命令和文件系统日志,几乎没有 ARC 特定设计。作者此前预测编码工具链可泛化 LLM,这次结果支持了该判断。AI模型ARC-AGI-3Opus 5Claude Code推荐理由:Jeremy Berman 用 Claude Code 加 Opus 5 把 ARC-AGI-3 刷到 96.2%,没做什么 ARC 定制,思路很通用。原文稍后读已读值得跟进有用关注 ARC-AGI-3
13:02量子位@听雨Opus 5为制作一款游戏烧掉了6.9亿token。GPT-5.6仅用5美元成本就复刻了这款游戏。两者在token消耗和花费上差距悬殊,显示出GPT-5.6在游戏生成任务上的成本效率优势。AI模型Opus 5GPT-5.6游戏开发4 个信源在谈事件专题推荐理由:看GPT-5.6怎么用五美元复刻Opus 5几亿token做出来的游戏,差距是真大。原文稍后读已读值得跟进有用关注 Opus 5
10:33宝玉@doteyPrime Agent 是一个能自主改进的递归 Agent 框架。替换外部 Harness 后,Opus 5 的 ARC-AGI-3 评分从 30.2% 升至 95.5%,超过人类专家基线 95.4%。但作者认为,这种面向评分的优化价值有限,在现实场景中不会比 Claude Code 和 Codex 更好。AI模型Prime AgentOpus 5ARC-AGI-38 个信源在谈事件专题推荐理由:这个框架把 Opus 5 的评分从 30% 刷到 95.5%,但作者觉得换汤不换药,实战未必比 Claude Code 强。原文稍后读已读值得跟进有用关注 Prime Agent
09:30Browser Use@browser_use75°Alexander Yue 在 X 上宣布,他把 Opus 5 和 Browser Use 组合起来,给了 1000 美元 API 额度与 1000 美元真实资金。Opus 5 这次没有预设任务,也没有沙箱限制,需要自己决定在真实互联网上做什么。原帖附带直播链接,目前已有 230 次查看,观众可以实时围观它如何支配这笔钱。AI产品Opus 5Browser Use智能体7 个信源在谈事件专题推荐理由:有人给 Opus 5 和 Browser Use 塞了 1000 美元现金,让它自己在网上闯荡,正在直播,去看看它怎么花钱。原文稍后读已读值得跟进有用关注 Opus 5
03:59lmarena.ai@lmarena_aiAgent Arena追踪模型完成真实任务所需的token数量。Opus系列从4.7到5,性能持续提升,但token消耗从约8.5k增至约21k,含推理和输出token。相反,GPT-5.5到GPT-5.6-Sol的token用量从约10k降至约8k,同时净改进提升约1.5pp。两组模型在效率与性能上呈现相反趋势。AI模型Agent ArenaOpus 5GPT-5.6-Sol7 个信源在谈事件专题推荐理由:看Opus 5和GPT-5.6-Sol在同一基准上的表现,一个越强越费token,一个越强越省,挺有意思的对比。原文稍后读已读值得跟进有用关注 Agent Arena
01:58官方账号Decoder@Matthias Bastian83°Anthropic将Fable 5生物学安全过滤器的误报率降低了约85%。此前,几乎所有生物学相关查询都会被拦截并转交给能力较弱的Opus 5。现在,普通生物学问题可直接由Fable 5处理,但病毒学和毒理学等敏感双用途主题仍保留原有限制。AI模型AnthropicFable 5Opus 510 个信源在谈事件专题推荐理由:Anthropic把Fable 5的生物误报砍了85%,普通生物问题不再被转给Opus 5,但病毒毒理还是管得严。原文稍后读已读值得跟进有用关注 Anthropic
13:12Claude@claudeaiAnthropic更新了Claude Fable 5的生物安全防护机制,以减少误报。该更新使生物学相关的回退数量在多个产品面上减少约85%。Fable现在能处理更多日常健康和教育类问题。但对于病毒学、毒理学和分子设计等双用途请求,仍会回退到Opus 5。目前它还无法用于专业生物学研究和药物开发。AI模型Claude Fable 5Opus 5Anthropic10 个信源在谈事件专题推荐理由:Claude Fable 5把生物安全误报砍了85%,日常健康问题能直接答了,但病毒学这类敏感领域还是交给Opus 5。原文稍后读已读值得跟进有用关注 Claude Fable 5
00:28官方账号Cursor@cursor_ai没有任何模型能在所有任务上占优:Grok 4.5 在常规任务上性价比高。GPT-5.6 Sol 擅长规划与代码库理解。Opus 5 适合执行密集型工作。Fable 5 在调试和视觉实现上更出色。技巧Grok 4.5GPT-5.6 SolOpus 58 个信源在谈事件专题推荐理由:选模型别纠结了:常规任务选 Grok 4.5,规划代码库找 GPT-5.6 Sol,重执行用 Opus 5,调试看 Fable 5。原文稍后读已读值得跟进有用关注 Grok 4.5
22:17小互@imxiaohuPrime Agent是一个能自主改进的递归Agent框架。将Opus 5的外部框架替换为Prime Agent后,其ARC-AGI-3评分从30.2%提升到95.5%。这一成绩甚至超过了人类专家基线95.4%。该框架可直接作为Claude Code、Codex的替代品。开发者认为传统Agent框架的固定设计限制了模型发挥。AI产品Prime AgentOpus 5ARC-AGI-38 个信源在谈事件专题推荐理由:Prime Agent 这个递归框架挺有意思,直接把 Opus 5 的 ARC 成绩从 30% 拉到了 95%,还能替代 Claude Code 和 Codex,值得看看。原文稍后读已读值得跟进有用关注 Prime Agent
04:38宝玉@dotey精选博主分享了一套复杂任务的分工流程:先用 Fable 5 产出技术方案文档,方便批注和让其他 Agent 快速上手。确认方案后立即 /compact 一次,利用 Prompt Caching 降低压缩成本。接着把文档交给 Codex(GPT-5.6 Sol xhigh)执行,复杂任务加 /goal 减少中断。完成后让 Fable 5 验证遗漏或偏离,再把反馈发回同一 Codex 会话继续完善。博主实测 Opus 5 不如 GPT-5.6 Sol 稳定,也不如 GPT-5.6 Token 耐用。技巧Fable 5CodexGPT-5.65 个信源在谈事件专题推荐理由:这个流程很适合复杂任务:Fable 5 出方案、Codex 干活、Fable 5 把关,还讲了 /compact 省钱和省上下文的细节,挺实用。原文稍后读已读值得跟进有用关注 Fable 5
10:30Binyuan Hui@huyberyAndrej Karpathy用《指环王》第一段测试Opus 5,给它约1M token的预算(约10美元)并要求生成three.js渲染版本。Opus 5花了大约2小时写出5500行代码,程序化渲染了故事,但效果有些粗糙。Karpathy认为这类超定制世界生成是LLM的新应用场景,同时暴露了模型无法高效观看视频或玩游戏的短板,只能靠截图慢慢检查。AI模型Opus 5Karpathythree.js5 个信源在谈事件专题推荐理由:Karpathy用《指环王》首段测Opus 5,1M token生成5500行three.js代码,效果糙但脑洞大。原文稍后读已读值得跟进有用关注 Opus 5
14:10宝玉@dotey精选Andrej Karpathy 用《指环王》第一段做测试,给 Opus 5 提供 100 万 token 预算(约 10 美元)和 three.js 渲染任务。Opus 5 用约 2 小时写了 5500 行代码,程序化生成故事场景,结果有点粗糙但能跑。Karpathy 认为 LLM 目前无法直接观看视频或玩游戏,只能靠截屏检查效果,因此出错不少。他设想按需生成'临时版 GTA'式的定制 3D 世界。AI模型Opus 5three.js3D渲染5 个信源在谈事件专题推荐理由:Karpathy 让 Opus 5 花 10 美元做了个《指环王》3D 渲染,5500 行代码,还聊了模型短板。原文稍后读已读值得跟进有用关注 Opus 5
12:14官方一手歸藏(guizang.ai)@op741885°Karpathy加入Anthropic后首次发布长帖,给Opus 5约100万Token(约10美元)预算,让它用three.js渲染《指环王》故事。Opus 5耗时约2小时,写出5500行代码,最终生成一个3D版本。Karpathy指出,模型无法直接观看或游玩生成的视频/游戏,只能靠逐段截图检查,过程中出错多次。他认为多模态感知与游戏内交互能力仍是LLM明显的短板。AI模型Opus 5AnthropicKarpathy7 个信源在谈事件专题推荐理由:Karpathy给Opus 5百万Token预算,让它做《指环王》3D渲染,还吐槽模型没法自己看结果。原文稍后读已读值得跟进有用关注 Opus 5
01:08lmarena.ai@lmarena_ai精选Code Arena 公布 Image-to-WebDev 最新评测分数。Opus 5 (Max) 以 1669 分排名第一。GPT-5.6 的 Sol、Terra、Luna 三个版本分别拿到 1581、1531、1497 分,排在第 4、13、21 位。Grok-4.5 以 1578 分排第 5,Kimi K3 (Max) 以 1571 分排第 6,Muse Spark 1.1 以 1550 分排第 8。该评测考察模型根据截图生成网站,以及多步推理和工具调用的智能体编码流程。AI模型Opus 5GPT-5.6Code Arena4 个信源在谈事件专题推荐理由:想找能照着截图做网页的模型?直接看 Code Arena 这份榜单,Opus 5 (Max) 第一,GPT-5.6 和 Grok 的分数也都列出来了。原文稍后读已读值得跟进有用关注 Opus 5
17:17AI Will@FinanceYF5精选Claude Code 创作者 Boris Cherny 建议每6个月删除一次 CLAUDE.md、Skills 和 Hooks 配置。他提醒用户,升级到 Opus 5 后,为旧模型写的规则可能从帮助变成限制。通过裸跑,用户能观察模型在没有历史规则时的真实表现。他建议升级后先做一次裸跑测试,结果或许让人意外。技巧Claude CodeOpus 5Boris Cherny4 个信源在谈事件专题推荐理由:Boris Cherny说每半年删掉Claude Code的配置和Skills,让Opus 5裸跑,你会发现旧规则反而碍事。原文稍后读已读值得跟进有用关注 Claude Code
17:16AI Will@FinanceYF5精选Claude Code创建者Boris Cherny在Y Combinator Startup School 2026上建议,不开发Agentic产品的用户每6个月删除一次claude.md文件、skills和hooks。他强调删除后观察模型行为,结果可能出乎意料。Cherny特别指出,对于Opus 5,应彻底删除这些配置,因为新模型可能不再需要旧版本所需的详细指令。该建议来自Y Combinator官方YouTube频道的完整视频。技巧Claude CodeOpus 5Boris Cherny4 个信源在谈事件专题推荐理由:Claude Code作者说,每半年清空配置和技能,模型反而表现更好。Opus 5用户更该试试。原文稍后读已读值得跟进有用关注 Claude Code
15:47官方账号Decoder@Matthias Bastian82°OpenAI声称其GPT-5.6 Sol模型在ARC-AGI-3基准测试中通过自定义测试环境获得38.3%的分数,高于Anthropic Opus 5的30.2%。但在官方标准环境下,GPT-5.6 Sol仅得7.8%,远低于Opus 5的30.2%。OpenAI的定制测试保留了推理链和上下文压缩作为辅助手段,而Opus 5在无辅助下完成。这一差异引发了关于基准测试公平性的讨论。AI模型GPT-5.6 SolOpus 5ARC-AGI-310 个信源在谈事件专题推荐理由:OpenAI推出GPT-5.6 Sol,在自定测试里赢了Anthropic的Opus 5,但换官方环境就掉到7.8%,差距挺大。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
04:08elvis@omarsar079°Opus 5(Claude 5的Opus版本)被训练得更具自主性(agentic),比以往任何模型都更主动探索。用户发现,与Opus 5交互时,需要减轻系统提示和CLAUDE.MD的负担,去掉记忆和工具描述,保持轻量。使用简洁清晰的提示和技能,MCP工具描述更详细且与系统提示去重,才能更好发挥模型能力。Anthropic发布了新的上下文工程指南,帮助用户适应这种变化。技巧Opus 5Claude 5Anthropic10 个信源在谈事件专题推荐理由:用了Opus 5发现原来的提示词全废了?这篇帖子总结了实操经验,告诉你系统提示和CLAUDE.MD怎么改才不拖后腿。原文稍后读已读值得跟进有用关注 Opus 5
01:10elvis@omarsar0Opus 5 仅用一次生成和 Three.js 就构建了一个飞行模拟器。该模型通过 judge-executor 框架循环改进输出质量,核心技巧是让 judge 持续评估并驱动重试。如果你加更详细的提示词,可以获得质量更高的模拟器。这条推文展示了实际运行的视频效果。技巧Opus 5Three.js飞行模拟器7 个信源在谈事件专题推荐理由:Opus 5 一次跑出飞行模拟器,靠 judge-executor 循环提升质量,Three.js 实现。试试加更狠的提示词能更猛。原文稍后读已读值得跟进有用关注 Opus 5
15:43AI Will@FinanceYF5Claude Opus 5在多个通用基准测试中超过Fable,但实际使用体验远不如后者,表明现有基准近乎无用。Anthropic在5系列中先训练Mythos再蒸馏出Sonnet和Opus,新方法导致Sonnet 5表现不佳、Opus 5口碑参差。模型正从RLHF转向机器可验证的强化学习,使用体验下降,出现更多术语、更难操控。作者担忧AI可能引导人类构建对机器更友好的世界,并开始说一种看似英语但普通人看不懂的'自己的语言'。行业ClaudeOpus 5Anthropic10 个信源在谈事件专题推荐理由:Claude Opus 5基准分高但实际拉胯,训练方式变了,模型越来越难用,甚至可能反向控制我们。值得细品。原文稍后读已读值得跟进有用关注 Claude
01:41Y Combinator@ycombinator77°Claude Code 创始人 Boris Cherny 在 YC Startup School 2026 上分享 Opus 5 的独特之处,包括解决提示注入和删除 80% 系统提示。他解释了为何 Claude Code 要大幅精简系统提示,以及如何利用 Opus 5 运行数千个 AI 智能体。Cherny 认为编程问题已接近解决,但 CS 学生仍需掌握基础原理。AI模型Claude CodeOpus 5Anthropic10 个信源在谈事件专题推荐理由:Anthropic 的 Claude Code 之父 Boris Cherny 在 YC Startup School 上揭秘 Opus 5 的新特性,还分享了删除 80% 系统提示的实战经验。想了解下一代模型和 Agent 构建思路?这视频干货十足。原文稍后读已读值得跟进有用关注 Claude Code
18:07AI Will@FinanceYF5Claude Opus 5 在不到 10 分钟内生成了一个 38 秒的电影级镜头序列。这是第一次迭代便直接输出成品,无需任何剪辑或后期处理。整个生成过程通过 Claude Code 完成,展示了模型强大的视频生成能力。该结果由用户 Samnang Aing 分享,附带了完整的聊天记录。AI模型ClaudeOpus 5视频生成10 个信源在谈事件专题推荐理由:Claude Opus 5 十分钟就能做出电影级片段,一次成功零剪辑,效果太惊人了。原文稍后读已读值得跟进有用关注 Claude
14:29小互@imxiaohu精选Anthropic 发布了 Opus 5 的官方提示指南,核心方法是删除冗余信息而非添加更多指令。指南通过多个示例展示精简提示如何提升模型输出质量。例如将一段200字的描述删至50字后,回答准确率从72%提升至89%。该方法适用于复杂任务和长上下文场景。技巧Opus 5Anthropic提示词工程10 个信源在谈事件专题推荐理由:Anthropic官方出的Opus 5技巧,核心是少写多删,实测准确率能提升不少,值得一试。原文稍后读已读值得跟进有用关注 Opus 5
11:01Gary Marcus@GaryMarcusGary Marcus 引用 Ramez Naam 的推文,指出 Opus 5 在 ARC-AGI-3 基准上的成绩提升可能源于针对该评估的专门训练,而非抽象推理能力的普遍增强。该观点质疑当前用基准分数衡量 AGI 进展的有效性。推文获得 4 条回复、1 次转发和 10 个点赞。行业Opus 5ARC-AGI-3Gary Marcus10 个信源在谈事件专题推荐理由:Opus 5 的基准高分可能是刷出来的,看看专家怎么拆穿这个骗局。原文稍后读已读值得跟进有用关注 Opus 5
11:01orange.ai@oran_geKun Chen 指出 Opus 5 在多项公开基准上超越 Fable 5,但在实际使用中远不如 Fable 5,认为现有基准已几乎无用。他信任基于私有数据集的领域特定评估。他还透露 Anthropic 在 5 系列中先训练 Mythos 再蒸馏到 Sonnet 和 Opus,导致 Sonnet 5 失败、Opus 5 评价混杂。Chen 表示 Claude 系列使用体验变差,Grok 和 Kimi 目前在“愉悦感”维度上更优。AI模型Opus 5Fable 5Anthropic10 个信源在谈事件专题推荐理由:这条推文直指 Opus 5 和 Fable 5 的基准与体验反差,还爆出 Anthropic 新的蒸馏训练路径,以及 RLHF 被弱化导致的体验变化,值得看看。原文稍后读已读值得跟进有用关注 Opus 5
18:01官方账号Decoder@Matthias Bastian86°Anthropic的Claude Opus 5在ARC-AGI-3基准测试中取得30.2%的成绩,接近此前GPT-5.6 Sol记录7.8%的四倍。测试开发者指出,Opus 5是首个独立推导出反射方程的模型,这一行为此前从未在其他模型中出现。开发者认为这归因于其更强的逻辑推理能力。ARC-AGI-3被设计为衡量真实智能的测试。AI模型Opus 5GPT-5.6 SolAnthropic10 个信源在谈事件专题推荐理由:Anthropic的Opus 5在智能测试上把GPT-5.6 Sol甩开一大截,还自己学会推方程了。原文稍后读已读值得跟进有用关注 Opus 5
13:31Jerry Liu@jerryjliu0精选Jerry Liu 分享使用 Claude Code 的经验,指出过度约束模型会导致其无法探索未知问题。他发现移除大约 80% 的 Claude Code 系统提示词后,模型能利用上下文自行判断,效果更佳。他推荐 Opus 5 模型在 Claude Code 中表现优异。技巧Claude CodeClaudeOpus 510 个信源在谈事件专题推荐理由:别老想着给模型写满约束,Jerry Liu 发现拿掉 Claude Code 八成提示词模型反而更聪明。原文稍后读已读值得跟进有用关注 Claude Code
02:29OpenRouter@OpenRouterAIOpenRouter 发布了全新 Discover 页面,帮助用户更直观地探索 AI 模型。该页面显示 Opus 5 在综合排名中占据整体领先地位,而 GPT 5.6 Sol 在编程任务上表现突出。同时,平台上路由器列表不断增长,为用户提供更多选择。AI产品OpenRouterOpus 5GPT 5.6 Sol10 个信源在谈事件专题推荐理由:OpenRouter 的新 Discover 页面让你一眼看清哪个模型最强——Opus 5 综合第一,GPT 5.6 Sol 编程厉害,还有更多路由器帮你挑。原文稍后读已读值得跟进有用关注 OpenRouter
02:05Jerry Liu@jerryjliu071°Opus 5系统卡PDF共193页,包含大量标签和未标注图表。LlamaParse在agentic模式下每页1.25美分,agentic plus模式下5.6美分,解析各类线图和柱状图准确率接近100%。相比之下,Opus 5自身解析图表准确率下降20-30%,成本每页8美分至33美分以上。LlamaParse生成的机器可读数据可直接喂给下游系统。AI产品LlamaParseOpus 5Claude10 个信源在谈事件专题推荐理由:LlamaParse解析PDF图表又快又准,比用Opus 5自己解析便宜好几倍,还更靠谱。原文稍后读已读值得跟进有用关注 LlamaParse
18:53官方一手歸藏(guizang.ai)@op741882°Anthropic在Fable 5和Opus 5上精简了约80%的系统提示词,编程测评成绩未下降。他们总结出6条上下文管理趋势:从给规则转向让模型运用判断力,从具体示例转向设计接口,从全部前置上下文转向渐进式披露,不再在系统提示词中重复工具描述,从手动记录转向自动记忆,从简单规则转向丰富引用。建议用Skills模块化信息,优先引用代码文件,并使用claude doctor命令自动优化。技巧AnthropicFable 5Opus 510 个信源在谈事件专题推荐理由:Anthropic分享了模型变强后怎么瘦身提示词,精简80%还能保持性能,做Agent的同学值得看看。原文稍后读已读值得跟进有用关注 Anthropic
18:53官方账号Decoder@Matthias BastianAnthropic的Opus 5模型在Auto Mode下,针对浏览器智能体在129个测试场景中实现零提示注入成功率。无额外保护时成功率仅为3.7%。若实际表现一致,该模型可能解决了浏览器AI智能体最严重的安全问题。AI模型Opus 5Anthropic提示词注入10 个信源在谈事件专题推荐理由:Anthropic的Opus 5在Auto Mode下把浏览器智能体的提示注入防御做到了100%,129个测试全过,这可能彻底解决智能体安全难题。原文稍后读已读值得跟进有用关注 Opus 5
09:09官方账号Simon Willison’s Weblog(博客/媒体)精选Anthropic 的 Claude Opus 5 在提示注入(prompt injection)防护上取得显著进展。根据官方系统卡和红队评估,Opus 5 是 Anthropic 迄今最难以被成功提示注入的模型。这一结果基于多项 PI 评估和对抗测试,标志着大模型安全性的一次重要提升。AI模型ClaudeAnthropicOpus 510 个信源在谈事件专题推荐理由:Anthropic 的 Opus 5 在防提示注入上做到了史上最强,红队测试都很难攻破,安全团队值得关注。原文稍后读已读值得跟进有用关注 Claude
08:13orange.ai@oran_ge评价称Opus 5的智能水平略微超过降智后的Fable 5,且价格保持为Fable 5的一半。OpenAI的开源模型已超过旧版Opus 4.8。Opus 4系列在引领上半年后逐渐退场。评论认为在开源巨浪下,这些模型都将成为浪花。AI模型Opus 5Fable 5Opus 4.810 个信源在谈事件专题推荐理由:Opus 5干过了降智版的Fable 5,价格还便宜一半,开源模型也追上来了,值得关注这波模型更迭。原文稍后读已读值得跟进有用关注 Opus 5
07:56Jerry Liu@jerryjliu0精选Opus 5在ParseBench文档理解基准上总体与Opus 4.8持平,在密集表格上差几分,在图表和视觉定位上略好。Gemini 3.6 Flash在表格上更优,图表略差,价格是Opus 5的一半。LlamaParse agentic在所有方面(包括表格)表现更好,价格仅为Opus 5的1/6。作者建议Opus 5适合编码和知识工作,但每页8美分且OCR平均,不适合大规模文档解析。AI模型Opus 5ParseBenchGemini 3.6 Flash10 个信源在谈事件专题推荐理由:Opus 5文档理解还行,但别拿它批处理PDF——每页8美分,效果不如便宜很多的Gemini Flash和LlamaParse。编码和知识工作倒挺香。原文稍后读已读值得跟进有用关注 Opus 5