8月21日
21:38
8月18日
00:20
00:20官方一手@OpenAIDevs@OpenAIDevs
73°
OpenAI 发布 GPT-5.6 Sol 的基准结果。在 ARC-AGI-3 任务上,得分从 13.3% 提升到 38.3%。同时输出 token 数量减少约 6 倍。OpenAI 称这一改进来自保留推理和压缩机制。该结果由 OpenAI Devs 在 X 平台公布。
事件专题

推荐理由:OpenAI 的 GPT-5.6 Sol 在 ARC-AGI-3 上分数翻倍还多,token 还省了六倍,看看他们怎么做到的。
8月8日
7月31日
06:44
06:44官方账号OpenAI@OpenAI (@OpenAI)
ARC-AGI-3基准测试要求模型无需指令学习不熟悉的2D游戏。标准测试丢弃了GPT-5.6 Sol每步后的推理,并在上下文填满时丢弃早期动作。这导致模型无法积累有效经验,只能不断重启。测试结果凸显了长上下文维持对推理模型的关键性。
事件专题

推荐理由:ARC-AGI这个测试挺刁钻,GPT-5.6 Sol在没法记住之前推理的情况下学不会新游戏,说明长上下文对推理很重要。
7月30日
08:38
08:38官方账号OpenAI@OpenAI
GPT-5.6 Sol 成功解决了数学中的开放问题,但在 ARC-AGI-3 2D 拼图基准测试中表现挣扎。调查发现,问题出在 API 的 harness 不允许模型记住之前学到的内容。启用两个 API 设置后,分数提高了 3 倍,同时输出 token 减少了 6 倍。
事件专题

推荐理由:OpenAI 发现 GPT-5.6 Sol 在 ARC-AGI-3 上表现差是因为 API 设置没开对。改两个参数分数涨三倍,token 省六倍,学起来很实用。
07:12
07:12官方一手OpenAI Blog博客/媒体
OpenAI 通过启用两个 API 设置(保留推理轨迹和启用结果压缩)让模型在 ARC-AGI-3 基准上的得分提升至原来的三倍。这些设置分别作用于推理过程和输出压缩,不增加额外计算成本。具体配置方法在官方博客中公开。
事件专题

推荐理由:OpenAI 官方分享的实用技巧,只改两个参数就让 ARC-AGI-3 分数翻三倍,玩模型的可以试试。
7月17日
08:09