全部动态
Gary Marcus说,Q3数据显示OpenAI企业增长82%,比Anthropic的76%还高,因为GPT-5.6 Sol更好用,而Anthropic的Fable 5则有点失望。
Artificial Analysis刚发了搜索API基准,用GPT-5.6 Luna测了7家提供商,帮你选搜索工具时看质量、成本、速度。
OpenAI官方晒了组省钱实测:Hypha AI用GPT-5.6 Luna把文档提取成本降到1/18,准确率还保住98%;RogoAI靠工具调用省了21%输入token。
OpenAI 的 GPT-5.6 Sol 在 ARC-AGI-3 上分数翻倍还多,token 还省了六倍,看看他们怎么做到的。
花 1 美元订阅 Command Code,再用 Codex Router 转发给 Codex,就能用上 GPT-5.6 Luna 和 Grok 4.5,这操作可以学一下。
LlamaIndex给LlamaParse加了新模式,专门抽长文档里的海量字段,准确率比Claude Code和Codex高10-20%,每个字段还带出处。
一个叫Faraday的27B智能体,把论文复现变成强化学习任务,在测试集上赢了Claude Opus 4.8和GPT-5.5,还把编码agent当工具用,有点意思。
OpenAI 的 GPT-5.6 Sol 在低推理强度下就超过了 GPT-5.5 的高推理强度表现,还更省 Token,你可以直接上手试试。
谷歌新出的Gemini 3.7 Flash在智能体评测里冲到第20,比上代强一截,编码和网页开发更好用了,感兴趣的可以试试。
Grok-4.6 刚发布就把网页开发能力冲进第一梯队,分数压过 Claude 和 GPT 的最新版,差距只有个位数,写代码的可以关注下。
Grok 4.6 已经能在 Devin 里用了,Desktop 和 CLI 都支持,比 GPT-5.6 Sol 强,仅次于 Opus 5 和 Fable 5,想尝鲜的赶紧试试。
Grok 4.6发布,价格不变,Agent和编程更强,AA Intelligence Index追平GPT-5.6 Sol,API输入2美元/百万Token。
DeepSeek新模型V4-Pro专攻代码生成,在Code Arena排第8,开源第2,仅次于Kimi K3,还超过了GPT-5.6 Sol。
DeepSeek新模型在Text Arena拿1465分,和GLM-5.1、GPT-5.6 Terra一个水平,开源阵营排第五。