全部动态
朋友A说,3个安全研究员用Claude Opus 5攻陷了OpenAI员工账户,还让被攻陷账户里的Codex在OpenAI内部提交了代码,成本不到3000美元,这事儿挺有意思。
阶跃这个新模型Step 5 Preview挺厉害的,能处理真实世界的编程任务,成本还低,和Claude Opus 5比起来单任务成本只有1/8。
朋友,有个挺有意思的,有人用 Claude Opus 5 做了个网站,里面有 25 个迷你房间,每个房间都有个 Claude 陪着,挺有趣的。
Claude 新版 Opus 5.2 上线了,测试下来比旧版快很多,而且不“偷懒”,代码生成能力更强,值得试试。
DeepSeek 推出了 V4.1 Flash,性能接近 GPT-5.6,但成本只有 1/30,用 15 美元就能跑 100 个复杂任务,性价比很高。
朋友发了 Genspark 的 Gen-1 Slides,这个模型做幻灯片生成很厉害,和 Claude Opus 5 一样好,但价格便宜很多,才 1/17。
朋友,Fireworks AI 新出的 Gen-1 Slides 模型很棒,幻灯片生成效果和 Claude Opus 5 差不多,但价格便宜很多,是 1/17,适合做演示文稿。
DeepSeek 新发布的 V4.1 Flash 模型,比 V4-Pro 小三分之一,但在很多测试里还比它强,价格也便宜很多,值得看看。
OpenAI 发布了 GPT-6 Astra,虽然减少了幻觉,但在隐藏提示注入攻击面前仍有 8.5% 的失败率,比 Claude Opus 5 的 4.8% 差。
OpenAI的GPT6-Astra评测曝光,编程能力与Claude Opus 5相当,但价格涨2.5倍,因效率提升实际成本反而降一半。
GoogleDeepMind 新发布的 Gemini 3.8 Flash (High) 在多个竞技场表现优异,成本比同类模型低 44-50%。
GoogleDeepMind发布Gemini 3.8 Flash (High),在多个基准测试中超越前代版本和Claude Opus 5。
阿里Qwen3.8-Max-0902以1691分登顶CodeArena WebDev排行榜,比前代模型高出22分,价格仅5美元/百万token。
斯坦福发布了科研AI代理基准Terminal-Bench-Science,Claude Opus 5仅完成30%,看看你的模型表现如何。
Poonam Soni 在 Replit 上比较了 Free Mode、Gemini 3.7 Flash、Grok 4.6 和 Claude Opus 5,看看哪个在创建 Subway Surfer 克隆时表现最佳。
想知道代码、工作、聊天分别谁最强?Agent Arena 新榜单给出答案:GPT 5.6 和 Claude Opus 5 各领风骚。
Gemini 3.7 Flash在Text Arena冲到第9,创意写作第3,数学第4,跟Qwen-3.8和Claude Opus 5只差几分。