8月28日
00:09
00:09Stanford AI Lab@StanfordAILab
精选
Muennighoff等提出Prefix Sliding方法,通过遗忘部分上下文信息,提高长任务中全注意力机制的效率,避免信息丢失。新论文发表于斯坦福大学AI实验室。
事件专题

推荐理由:斯坦福大学AI实验室提出Prefix Sliding,优化长任务中全注意力机制的效率,值得一读。
5月29日
08:24
08:24Augment Code@augmentcode
精选78°
Claude Opus 4.8 现已在 Cosmos 平台上线。该模型在长时间运行任务上表现优异,包括多小时的执行和从工单到 PR 的自动化工作流,几乎无需人工干预。相比 Opus 4.7,它拥有更敏锐的判断力、更诚实的自我评估能力,并能独立工作更长时间。价格保持不变。
事件专题

推荐理由:做自动化工作流和复杂工单处理的开发者,终于有了能跑通多小时的模型——Opus 4.8 在 ticket-to-PR 场景几乎零干预,建议直接上 Cosmos 试。
5月25日
10:21
10:21官方一手pandaily@contact@pandaily.com (Pandaily)
83°
阿里巴巴的 Qwen 3.7 Max 模型完成了一次长达 35 小时的自主任务运行,期间执行了 1,158 次工具调用。这一表现展示了模型在长时间、多步骤任务中的持续稳定能力,令海外开发者印象深刻。该成果凸显了 Qwen 系列在复杂自动化场景下的潜力,可能推动更多企业探索 AI 驱动的长周期工作流。

推荐理由:Qwen 3.7 Max 证明了 AI 可以稳定执行 35 小时的长任务,做自动化工作流或复杂项目管理的开发者值得关注,这可能是你寻找的可靠长任务模型。