8月29日
02:07
02:07官方账号Anthropic@AnthropicAI
精选
Anthropic 让 Sonnet 5 对 Opus 4.8 的早期检查点进行后训练。经过训练后,该模型的安全分数接近完整对齐训练的 Opus 4.8 水平。这是测试模型能否对其更强大的继任者的首次尝试。
事件专题

推荐理由:Anthropic 让 Sonnet 5 训练 Opus 4.8,安全分数接近原版,模型自我对齐有新进展。
8月22日
03:38
03:38官方账号Decoder@Matthias Bastian
Deepseek推出V4-Flash-Vision-Exp,一个实验性多模态模型,为V4-Flash的文本能力添加图像理解。在公司自己的多模态智能体基准测试中,其性能接近Opus 4.8,有时甚至超越它。

推荐理由:Deepseek新推出的V4-Flash-Vision-Exp模型,将图像理解能力与文本处理结合,在多模态智能体基准测试中表现优异,与Opus 4.8不相上下,值得一试。
8月13日
17:43
7月25日
08:13
08:13orange.ai@oran_ge
评价称Opus 5的智能水平略微超过降智后的Fable 5,且价格保持为Fable 5的一半。OpenAI的开源模型已超过旧版Opus 4.8。Opus 4系列在引领上半年后逐渐退场。评论认为在开源巨浪下,这些模型都将成为浪花。
事件专题

推荐理由:Opus 5干过了降智版的Fable 5,价格还便宜一半,开源模型也追上来了,值得关注这波模型更迭。
02:12
02:12Claude@claudeai
ClaudeAI在推文中对比了Opus 5与Opus 4.8在网络安全任务上的表现,称Opus 5更强。但Opus 5在开发漏洞利用方面仍大幅落后于Mythos 5。其安全措施旨在帮助开发者识别和修复软件漏洞,同时阻止高风险用途。
事件专题

推荐理由:ClaudeAI刚说Opus 5比Opus 4.8更擅长网络安全,但别指望它能搞漏洞利用,那还得看Mythos 5。
01:53
01:53官方一手歸藏(guizang.ai)@op7418
Claude Opus 5 已发布,定价与 Opus 4.8 相同。在多项基准测试中,Opus 5 成绩大幅优于 Opus 4.8,并且多数测评成绩高于 Fable 5。官方称其智能接近 Fable 5,但价格为 Fable 5 的一半。用户反馈该模型可用性明显提升。
事件专题

推荐理由:Opus 5 性能强于 4.8,价格不变,还接近 Fable 5 但便宜一半,值得升级。
7月22日
12:30
12:30官方账号arXiv cs.AI@Harmon Bhasin, Kevin Flyangolts, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Amanda Darling, Joshua Stallings, David Stern, Shawn Higdon, Claire Duvallet, Bryan Tegomoh, Kenny Workman
新基准BioSecBench-Surveillance包含100个评估任务,覆盖7个类别,从分类到基因工程检测。16个模型-工具组合在3962次尝试中,最佳配置Opus 4.8 with PI仅达50.2%准确率,与GPT-5.5 with Codex并列。Opus 4.7 with PI为49.6%,Sonnet 4.6 with PI为48.6%。即使调用正确工作流,错误仍源于参考序列、阈值、过滤器等选择失误。该基准为衡量下次疫情爆发时AI代理的可信度提供了标准。
事件专题

推荐理由:想看看AI在基因组监测上多不靠谱?新基准BioSecBench-Surveillance测了16个模型,最好才一半正确,细节值得细读。
7月14日
06:09
06:09官方账号Simon Willison’s Weblog博客/媒体
Simon Willison查看了Datasette开源项目的GitHub代码提交频率图,发现近期出现巨大峰值。该峰值与Opus 4.8、GPT-5.5、Fable 5和GPT-5.6 Sol等高级编码AI模型的使用时间吻合。这些模型显著提升了作者的代码产出频率,可视化地展示了AI辅助编程的效果。
事件专题

推荐理由:Simon Willison用GitHub提交频率图,直观展示了Opus 4.8等AI编码助手让他的代码产出暴增,有趣又有说服力。
01:30
7月11日
22:00
21:20
11:23
11:23Aravind Srinivas@AravSrinivas
Perplexity 为 Enterprise 组织启用了 Grok 4.5 模型。面向 Consumer Pro 和 Max 订阅用户,Grok 4.5 可作为计算机编排模型。在 WANDR 基准上,Grok 4.5 得分高于其他五种编排配置。其成本约为 Opus 4.8 的一半。
事件专题

推荐理由:Perplexity 现在能用 Grok 4.5 做编排了,比 Opus 4.8 便宜一半,性能还更强,Pro 和 Max 用户快去试试。
7月10日
06:04
06:04Paul Couvert@itsPaulAi
开源模型Hy3与Hermes agent配合可自动化计算机上的任何任务。Hy3比其它开源模型更强,在部分用例上与Opus 4.8持平。其模型大小仅为GLM-5.2的一半,而GLM-5.2此前是最佳编码/智能体开源模型。目前用户可以免费使用。
事件专题

推荐理由:Hy3这个开源模型配Hermes agent能自动搞定电脑上的活,比GLM-5.2小一半,性能却和Opus 4.8差不多,现在还免费,赶紧试试。
7月5日
23:27
7月4日
7月2日
06:25
06:25elvis@omarsar0
一位用户发推抱怨,其代理设置(使用循环和自动化)在Max计划上已耗尽Opus 4.8的限额,而Fable 5不仅几乎无法使用,还被削弱了。该用户称这是最令人困惑的AI发布。帖子获得9个点赞和1170次查看。
事件专题

推荐理由:有用户反馈说,Max计划下Opus 4.8有严重使用限制,Fable 5也被削弱了,大家注意避坑。
05:27
05:27AI SDK@aisdk
Anthropic 的 Claude Fable 5 模型因内置安全护栏可能拒绝部分请求。用户可通过配置将拒绝请求自动回退到 Opus 4.8 模型处理。此功能在 SDK 中提供,支持自定义每个护栏的 fallback 行为。目前已有 514 次查看和 9 个点赞。
事件专题

推荐理由:Anthropic 给 Claude Fable 5 加了安全护栏,请求被拒时可以自动切换到 Opus 4.8,开发时避免中断。