全部动态
作者用 Codex 和 GPT-5.6 Sol Ultra 刷出了比 Claude 版更带感的浣熊劫案游戏,还附了修 bug 实录,想看 AI 编程上限的可围观。
想给智能体加文档检索又嫌贵?Neon 这个 4B 开源模型跑分超过 GPT-5.6 Sol,成本只有百分之一,试试看。
OpenAI发布了Agent Plugins 1.0.0,统一智能体插件的打包标准,覆盖Skills和MCP,插件不用再为每个客户端各写一遍了。
DeepSeek API 要大涨价,OpenAI 免费用户用上 GPT-5.6 Luna,字节还打算训 5 万亿参数模型,这条早报全都有。
OpenAI 把免费用户默认模型换成了 GPT-5.6 Luna,下周起无限次聊天随便用,Plus 用户还能用滑动条调思考深度。
微软把自家 Copilot 的默认模型换成了 GPT-5.6 Sol,还要求优先用 OpenAI,背后是每年 241 亿美元的收入关系。
中国模型前五占四,DeepSeek V4 Flash一周跑7.1万亿token,OpenAI直接砍价80%,这仗打得真热闹。
DeepSeek-V4-Flash比GPT-5.6 Luna便宜六成,一周调用7.22万亿Token登顶,逼得硅谷连夜降价,你要不要看看?
Beth Barnes创办的METR专门独立评估OpenAI、Anthropic等前沿模型,年薪开到50万美元还在喊缺人,还提前抓到了GPT-5.6作弊,值得看看。
DeepSeek V4-Flash 正式版上线,AII 得 50 分只比 GPT-5.6 Luna 低 1 分,价格便宜 60%,前端代码跑分 1586,可以试试。
Simon Willison做了smevals评估工具,YAML写测试,一条命令可跑GPT-5.5和Claude Opus 4.6对比,生成报告。想搭评估套件可试试。
DeepSeek 把 V4 Flash 升到 0731 版,性能只比 GPT-5.6 Luna 低 1 分,成本却省六成,平价模型也能打了。
OpenAI给GPT-5.6 Sol换了套测试框架,ARC-AGI-3得分从7.8%涨到38.3%,输出还省了六分之五,这招挺妙。