15:06orange.ai@oran_geBen Davis 在 x.com 上分享,DeepSWE 在 10 项任务中表现优于 Fable 和 GPT-5.6-sol,得分超过 80%,引发热议。AI模型DeepSWEFableGPT-5.6-sol推荐理由:Ben Davis 在 x.com 上展示了 DeepSWE 在多项任务中的出色表现,比 Fable 和 GPT-5.6-sol 更胜一筹,值得关注。原文稍后读已读值得跟进有用关注 DeepSWE
12:10官方账号arXiv cs.AI@Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan YangQuoteBench 用 56 个单次任务、14 个事故来源族,验证 LLM 编程智能体在生成命令与执行传输之间的边界。同一回复经新增解析器后,成功率下降 55.4 到 73.2 个百分点;六种配置在披露边界后恢复 30.4 到 60.7 个百分点,另两种恢复为零或负值。GPT-5.6-sol 的匹配分数仅 -3.6 点,但实际隐藏了 -64.3 点损坏和 +60.7 点补偿。部署配置会重排模型顺序,26 对可比模型中有一对明确反转,另有四对处于单任务边缘。论文建议评估命令型智能体时报告模型配置、生成合同、执行路径、操作点和最终状态验证器,而非只给匹配分数。论文QuoteBenchGPT-5.6-sol编程助手推荐理由:这篇论文用 QuoteBench 拆穿了只看匹配分数的假象,原来 GPT-5.6-sol 的分数是负 64 和正 60 抵消出来的,部署配置一变排名就翻,评估编程智能体前该看看。原文稍后读已读值得跟进有用关注 QuoteBench
09:27官方一手arXiv: OpenAI@Jihao Liu论文证明了 n 维空间中体积为 (n+1)^n/n! 且重心是唯一内格点的凸体必为单纯形 (n+1)Δ_n-(1,…,1) 的单模像。这一结果补上了 Ehrhart 体积猜想的等号情形,与 OpenAI 近期证明的不等式部分形成对应。论文称主要结果由生成式 AI 完成,涉及 GPT-5.6-sol、Fable 5 和 Danus 系统。论文GPT-5.6-solEhrhart猜想Fable 55 个信源在谈事件专题推荐理由:Ehrhart猜想等号情形被GPT-5.6-sol等AI证明了,数学证明也能这么玩。原文稍后读已读值得跟进有用关注 GPT-5.6-sol
06:34官方账号Greg Brockman@gdbOpenAI 近期推出了 /goal 功能,但 GPT-5.6-sol 模型无需该功能即可持续执行任务直至完成。Shopify 的 tobi lutke 在 X 上表示,GPT-5.6-sol 是第一个不再需要 /goal 的模型,能自己持续推进任务。该推文获得 201 个赞和超过 2.2 万次查看。AI模型GPT-5.6-solOpenAI智能体10 个信源在谈事件专题推荐理由:OpenAI 悄悄升级了 GPT-5.6-sol,它能自己把事做完,不用你再设目标了,执行力超强。原文稍后读已读值得跟进有用关注 GPT-5.6-sol
14:45量子位@量子位的朋友们GPT-5.6-sol模型成功进入DRACO基准榜单,展示其综合性能。OpenSquilla团队推出的集成方案在Brave组的评测中,以较低成本实现高质量输出,两项指标均优于同类方案。Brave组评估聚焦实际部署场景,成本与质量权重各占50%。OpenSquilla的模型集成策略在参数效率与推理速度上取得平衡。AI模型GPT-5.6-solDRACOOpenSquilla推荐理由:GPT-5.6-sol刚冲进DRACO排行榜,OpenSquilla那个集成方案在Brave组又便宜又能打,搞模型部署的值得关注。原文稍后读已读值得跟进有用关注 GPT-5.6-sol
06:59AI Will@FinanceYF5精选73°OpenAI 的 GPT-5.6-sol 在 Code Arena: Frontend 中跃升至第一,与 Claude Fable 5 并列。该模型从之前的第 18 名大幅提升至第 1 名,并在 Data & Analytics、Brand Marketing、Consumer product 和 Gaming 类别中均排名第一。定价为 $5/$30 每百万输入/输出 Token,大约是 Claude Fable 5 价格的一半。这是 OpenAI 模型首次在 Code Arena 中取得最高排名。AI模型GPT-5.6-solOpenAIClaude Fable 510 个信源在谈事件专题推荐理由:OpenAI终于登顶了!GPT-5.6-sol在代码竞技场和Claude Fable 5打成平手,价格还便宜一半,搞前端开发的快来看看。原文稍后读已读值得跟进有用关注 GPT-5.6-sol
05:25lmarena.ai@lmarena_ai88°OpenAI的GPT-5.6-sol在Code Arena: Frontend中取得并列第一的成绩,追平Claude Fable 5。这是OpenAI模型首次在该基准中夺冠,相较于前代GPT-5.5-xhigh从第18名跃升至第1名。该模型在Data & Analytics、Brand Marketing、Consumer product和Gaming四个子类别中均排名第一。定价为每百万输入/输出token分别5美元/30美元,约为Claude Fable 5的一半。AI模型GPT-5.6-solClaude Fable 5OpenAI10 个信源在谈事件专题推荐理由:OpenAI发了GPT-5.6-sol,代码能力直接冲到第一,还比Claude便宜一半,搞前端开发的可以试试。原文稍后读已读值得跟进有用关注 GPT-5.6-sol