OpenAI 让自家模型 GPT-5.6 Sol 反过来优化自己的推理,成本降了20%,token 生成快了15%,挺有意思的。
全部动态
OpenAI 分享了两个超实用的 API 开关,GPT-5.6 Sol 在 ARC-AGI-3 上分数直接翻了三倍,token 还省了十二倍,搞推理优化的一定要看看。
评估论文图表质量?SciFigQual-Bench这个新基准让GPT-5.6-Sol驱动的SFQ-Agent打分,误差比直问模型低43%,更靠谱。
想看看AI到底能不能做会计?新出的APEX-Accounting基准拿160道真实会计题考了九个模型,最强Claude Fable-5才56%,离实际干活还差得远。
作者做了两个PPT skill,经验很实在。他说Claude Opus做HTML比GPT好看,还对比了不同路线的优劣势,想省成本又出效果可以看看。
OpenAI 的 GPT-5.6 Sol 改了俩设置就在 ARC-AGI-3 上屠榜,教你多窗口推理+规范化压缩这套新打法。
OpenAI 发现 GPT-5.6 Sol 在 ARC-AGI-3 上表现差是因为 API 设置没开对。改两个参数分数涨三倍,token 省六倍,学起来很实用。
OpenAI 白送 10 万科学家免费试用 GPT-5.6 Sol,超大上下文窗口做深度研究爽翻,做文献调研的赶紧填表。
OpenAI 让最新的 GPT-5.6 Sol 自己给自己打工,结果运行成本降了 20%、输出速度提升超 15%,看看模型怎么自己优化自己。
OpenAI 搞了个新模型 GPT-5.6 Sol,能自己优化自己,部署后服务成本直接降了20%,生成速度还快了15%,搞推理服务的值得关注。
Claude Opus 5 在 Agent Arena 和代码榜都冲进前三,Max 版更是双榜第一,比 GPT-5.6 还靠前,很强悍。
Weaviate 的 Query Agent 现在用上 OpenAI 的新模型 GPT-5.6 Luna 和 Terra,召回率涨了5-10%,不涨价不降速,自动升级真省心。
Wiz搞了个Atlas系统,让多个AI智能体像安全团队一样协作挖漏洞,已经在开源项目找到200多个漏洞,基准测试还超过了GPT-5.5-Cyber和Claude 4.6。
OpenAI 开源了安全扫描工具 Codex Security,真阳性率 74% 远超 Snyk 和 Semgrep,还能拦截 git 提交,安全团队赶紧试试。
ClinFusion用新架构统一2D/3D医学图像,在20/24基准上碾压Hulu-Med、Lingshu,甚至超GPT-5.2。医生盲评说它报告最好,值得关注。
这篇论文用70道政治题+12种人格提示,测了GPT-5、Claude、Grok等7个模型,发现提示词比模型本身更能左右回答方向。想了解AI怎么被‘带节奏’的可以看看。
Kimi 开源了2.8T参数的K3模型,激活104B参数,能处理百万token上下文,视觉能力也不弱,性能直逼Claude和GPT-5.6,适合用来部署或研究。
这篇论文研究了AI模型评估结论过时的速度,发现模型发布后近一年结论可能已失效。如果你做AI评测或读评测报告,它能帮你判断证据是否还新鲜。
微软出了个专攻安全的AI模型MAI-Cyber-1-Flash,CyberGym跑分95.95%,比Mythos 5和GPT-5.5 Cyber都强,还更省钱。
GPT-5.6 的 Sol 版在 Agent Arena 上表现亮眼,比 Terra 和 Luna 都强,直接对标 Claude Opus 4.8。想了解新模型实力的话可以看看。