OpenAI官方晒了组省钱实测:Hypha AI用GPT-5.6 Luna把文档提取成本降到1/18,准确率还保住98%;RogoAI靠工具调用省了21%输入token。
全部动态
OpenAI 的 GPT-5.6 Sol 在 ARC-AGI-3 上分数翻倍还多,token 还省了六倍,看看他们怎么做到的。
花 1 美元订阅 Command Code,再用 Codex Router 转发给 Codex,就能用上 GPT-5.6 Luna 和 Grok 4.5,这操作可以学一下。
Codex 的 GPT-5.6 Sol 百万上下文现在 ChatGPT 账号也能开了,不用 API 密钥,Plus/Pro 用户手动配置就能处理大项目,但注意额度烧得快。
想看看AI在规则变了之后能不能自己改代码?PACE-Bench 专门测这个,目前最强的 GPT-5.5 也只解决了 Statics 子集的三分之二,离满分还远得很。
LlamaIndex给LlamaParse加了新模式,专门抽长文档里的海量字段,准确率比Claude Code和Codex高10-20%,每个字段还带出处。
西蒙威利森今天做了个叫CORS Chat的小工具,能通过网页界面测试LM Studio和OpenRouter的聊天接口,还支持流式SVG渲染,挺实用。
Moonshot AI 出了个新测试 PerceptionBench,专门查 AI 的“眼神”。结果最强模型 GPT-5.6 Sol 准确率也不到 60%,而且很多错是从看图时就错了。
一个叫Faraday的27B智能体,把论文复现变成强化学习任务,在测试集上赢了Claude Opus 4.8和GPT-5.5,还把编码agent当工具用,有点意思。
一个神经外科医生借 GPT-5.6 证明了 Crouzeix 猜想,数学家集体震惊。完整提示词和代码都开源了,可以看看。
OpenAI 的 GPT-5.6 Sol 在低推理强度下就超过了 GPT-5.5 的高推理强度表现,还更省 Token,你可以直接上手试试。
这篇把6月以来中国AI密集发模型的节奏和全球企业采购逻辑说清楚了,还给了DeepSeek比Claude便宜39倍的实测成本对比。
这篇论文用 QuoteBench 拆穿了只看匹配分数的假象,原来 GPT-5.6-sol 的分数是负 64 和正 60 抵消出来的,部署配置一变排名就翻,评估编程智能体前该看看。
OpenAI 给最强模型 GPT-5.6 Sol 上了个超快模式,每秒能出 750 个词元,比原来快 14 倍,适合客服、金融这些要抢时间的活儿。
谷歌新出的 Gemini 3.7 Flash,编码和智能体能力更强,价格比 3.6 又砍半,还比 Claude 和 GPT 便宜一半,拿来写代码试试。
谷歌新出的Gemini 3.7 Flash在智能体评测里冲到第20,比上代强一截,编码和网页开发更好用了,感兴趣的可以试试。
Grok-4.6 刚发布就把网页开发能力冲进第一梯队,分数压过 Claude 和 GPT 的最新版,差距只有个位数,写代码的可以关注下。
OpenAI搞了个叫Ultrafast的API新档位,跑GPT-5.6 Sol能快14倍,每秒750 token,用的是Cerebras的芯片。
Ramp用7万家企业账单告诉你,OpenAI的GPT-5.6 Sol收入反超了Fable 5,但采用率还是Anthropic领先,看企业AI花钱风向。
Grok 4.6 已经能在 Devin 里用了,Desktop 和 CLI 都支持,比 GPT-5.6 Sol 强,仅次于 Opus 5 和 Fable 5,想尝鲜的赶紧试试。
Simon Willison 发布了 alchemy-utils,相当于多数据库版 sqlite-utils,支持 PostgreSQL 和 DuckDB,一行命令导入查询,CSV 导 DuckDB 仅 35 秒。