OpenAI 把 GPT-6 Astra 的能力塞进了两个更快更便宜的模型,API 价格直接砍半,Genspark 上已经能用了。
全部动态
一天之内 Opus 5.5、GPT-6 Sol/Luna、Grok 4.7、Mimo v2.6 全来了,Opus 5.5 还降了 40% 成本,这篇帮你梳理各家提升方向和 benchmark。
OpenAI 的 GPT-6 Sol 和 Luna 已经能在 Augment 的 Cosmos 里直接用了,他们还打算把整套 GPT-5.6 工作流迁过去,想看迁移实测数据的可以蹲一下。
OpenAI 把 GPT-6 Astra 的能力下放到了 Sol 和 Luna 这两个便宜一半的型号上,批量跑任务的可以看看价格。
GPT-6 两个新模型已经在 LMArena 可以测了,评分还没出,想抢先体验可以现在去投票。有人还拿它和 GPT-5.6 同条件跑了对比,token 用量和速度都测了。
OpenAI 把 Astra 的能力做成大中小三档,Sol 跑分超 Claude Opus 5 但成本只有 9%,跑长任务智能体的开发者账单能省不少。
OpenAI 把 GPT-6 Astra 的能力下放到了 Sol 和 Luna 两个便宜模型上,API 价格直接砍半,跑批量任务的成本党可以看看。
同一模型放进 Claude Code 和 Codex 跑同样的任务,结果居然会一个升一个降,这篇论文用 PowerPoint 重建实验讲清楚了 harness 的影响。
OpenAI 把 GPT-6 Astra 的能力塞进了 Sol 和 Luna 两个便宜版本,API 价格直接砍半,用 AI SDK 的开发者可以马上试试。
OpenAI 把 GPT-6 Astra 的能力下放到了 Sol 和 Luna 两个便宜一半的新模型上,还能在 Agent Arena 里亲手测试投票。
LlamaIndex 的 Jerry Liu 开源了 DocJev,扔几条自然语言规则就能给文档分类和拆分,速度还比 gpt-5.6-luna 快 6 倍,免费可用。
OpenAI 又出新款了,GPT-6 Sol 和 Luna 是 Astra 的省钱版,API 价格直接比 GPT-5.6 便宜一半,跑批量任务的可以看看。
OpenAI 把 GPT-6 Astra 的能力塞进了更便宜更快的 Sol 和 Luna,缓存读取打 1 折,API 价格比 GPT-5.6 还低一半。
OpenAI 出了个便宜档的 GPT-6 Luna,跑分追平 Claude Opus 5,但只要零头的价格,看重成本的可以去 OpenRouter 试试。
OpenAI 新出的 GPT-6 Sol 和 Luna 上 OpenRouter 了,价格砍半,Sol 输入 2 美元、Luna 只要 0.1 美元每百万 token,跑分还比上一代强。
OpenAI 把 GPT-6 Astra 的能力塞进了 Sol 和 Luna 两个更便宜的型号,API 价格比 GPT-5.6 还砍了一半,跑批量任务的可以看看。
做网页应用的朋友看下:Lovable 已经换上 GPT-6 Sol,官方测下来比 GPT-5.6 Sol 高 6-12%,指令遵循提升最明显。
OpenAI 把 GPT-6 Astra 的能力下放到 Sol 和 Luna 两个便宜版本,API 直接砍半价,跑批量任务的成本党可以看看。
Cognition 跑了 GPT-6 两个型号的编程实测:Sol 省了 17% 上下文还少留烂尾测试,Luna 会写真回归测试了,写代码的可以看看。
Devin 接入了 GPT-6 Sol 和 Luna,Luna 每个任务不到 0.1 美元,比 GPT-5.6 便宜一大截,分数还更高。
OpenAI 一次发了两个 GPT-6 模型,价格还砍半,做应用的可以看看 Sol 和 Luna 怎么选
OpenAI 把 GPT-6 Sol 和 Luna 发出来了,说是接了 Astra 的对齐成果,对齐评估比 GPT-5.6 那两版要好,可以先看看。
OpenAI 把 GPT-6 Astra 的能力做成了 Sol 和 Luna 两个便宜版,API 价格直接砍半,跑批量任务的可以看看。
OpenAI 放出了 GPT-6 的 Sol 和 Luna 两个版本,对齐能力比 GPT-5.6 更强,想追最新模型动态的可以看看这条。
Mem0 把 GPT-5.6-Luna、MiniMax M3、Claude Sonnet 5 扔进 Hermes 和 Claude Code 两套框架跑分了,排行榜在 dolphinbench.ai,可以直接看哪个模型换框架后掉分最少。
宝玉实测的省钱组合:贵的模型出方案,便宜的模型干活,再让贵模型自动验收,全程不用人工盯。Token 贵的都该看看这套闭环玩法。
做文档切分可以试试 Jerry Liu 新开源的 DocJev,比 luna 快 6 倍、准确率相当,还带可视化页面。
LangChain 实测 Jev 当智能体评估裁判:单次 0.44 秒、整轮 0.34 美元,比 Claude 便宜 83 倍。
llama_index 团队开源的 DocJev 工具,能帮你快速分类或拆分文档,比 GPT-5.6 快 6 倍,准确率相当,适合处理大量文档。
DAIR.AI 和 MIT 新方法 SIFT,用 LLM 判定器筛选,把代码生成效率提升 10 倍,比 DGM 算法快很多。
Anthropic拟10月在新加坡设亚太第五个办事处 开放本地招聘 数据显示,按人口比例计算,新加坡的Claude.ai使用水平在121个国家中排名第二。 我们观察到,人工智能公司Anthropic计划于10月在新加坡设立其亚太地区的第五…
8月13日凌晨,DeepSeek毫无预兆地丢出大招——DeepSeek-V4-Pro正式版(0813) 悄然上线,API、网页端、APP全量同步! 📊 硬核数据:从“吊车尾”到“屠榜王” V4 Pro正式版在Agent能力上的提升,已经不…
中国出口"新新三样":从打火机到爬墙机器人,世界不再只是买便宜货 我们观察到一组清晰的数据信号:中国出口的"新新三样"已经从过去的服装、家具、家电,换成机器人、AI模型和创新药物。这不是产业升级的修辞游戏,而是发生在澳大利亚和巴西的实证样…
Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索…
DeepSeek-V4-Flash-0731:当版本号成为信息泡沫的容器 我们观察到 DeepSeek-V4-Flash-0731 在站内 rawitems 与 items 数据流中高频出现。需要先声明一个基本口径:截至本文撰写时,Dee…