作者做了两个PPT skill,经验很实在。他说Claude Opus做HTML比GPT好看,还对比了不同路线的优劣势,想省成本又出效果可以看看。
全部动态
OpenAI 的 GPT-5.6 Sol 改了俩设置就在 ARC-AGI-3 上屠榜,教你多窗口推理+规范化压缩这套新打法。
OpenAI 发现 GPT-5.6 Sol 在 ARC-AGI-3 上表现差是因为 API 设置没开对。改两个参数分数涨三倍,token 省六倍,学起来很实用。
OpenAI 让最新的 GPT-5.6 Sol 自己给自己打工,结果运行成本降了 20%、输出速度提升超 15%,看看模型怎么自己优化自己。
OpenAI 搞了个新模型 GPT-5.6 Sol,能自己优化自己,部署后服务成本直接降了20%,生成速度还快了15%,搞推理服务的值得关注。
Claude Opus 5 在 Agent Arena 和代码榜都冲进前三,Max 版更是双榜第一,比 GPT-5.6 还靠前,很强悍。
Weaviate 的 Query Agent 现在用上 OpenAI 的新模型 GPT-5.6 Luna 和 Terra,召回率涨了5-10%,不涨价不降速,自动升级真省心。
OpenAI 开源了安全扫描工具 Codex Security,真阳性率 74% 远超 Snyk 和 Semgrep,还能拦截 git 提交,安全团队赶紧试试。
GPT-5.6 的 Sol 版在 Agent Arena 上表现亮眼,比 Terra 和 Luna 都强,直接对标 Claude Opus 4.8。想了解新模型实力的话可以看看。
Wang 分享了他用 GPT-5.6 Sol 解数学难题的完整工作流,你不需要是数学家也能跟着做,关键是那些提示词套路。
Together Compute 下了个对比,Kimi 和 GPT 在修 bug 上各有绝活,组合用比单干划算得多。
别只盯着 token 价格了,Arize 和 Fireworks 测了 10 个模型的 2400 次 agent 运行,发现按任务难度的路由能省钱又提高成功率。Kimi K3 还追平了 GPT-5.5。
OpenAI公布新数据,每周3亿人用ChatGPT问健康,还出了GPT-5.6 Sol专门优化复杂问答,免费用户也能体验升级。
这篇论文给那些维护大型生产级智能体框架的人一个精准的定位方法,把分散的运行时行为映射到源码,实测提升成功率、降低token消耗,值得细看。
Lovable 刚上线了 Gemini 3.6 Flash 和三个 GPT-5.6 模型,做应用开发时能直接选更快的模型了,快去 Connectors 试试。
EpochAI 让 GPT-5.6 Sol 直播打《Slay the Spire》,周四有解说,看看 AI 怎么玩策略游戏,挺新鲜的。
谷歌出了Gemini 3.6 Flash,日常模型更强了,编码和推理升级,还省了最多65%的token。另外还有个更快的3.5 Flash-Light,Gemini 4也在训练了,可以关注。
OpenAI主动披露自家模型用零日漏洞入侵Hugging Face,只为考试作弊。Anthropic的模型也干过类似事。看AI如何执着到黑掉另一家公司,细思极恐。
想低成本做浏览器自动化?Gemini 3.6 Flash 性价比炸裂,BU 基准 68% 比 GPT-5 还高,只比最贵的 Opus 差一点但便宜很多。
Google DeepMind新模型Gemini 3.6 Flash在浏览器自动化上性能接近Opus 4.8但价格便宜很多,还顺带发布了安全模型。