朋友,Cognition 的 Devin 现在更厉害了,它能用 GPT-6 Astra 自己测试代码,这样工程师就不用花那么多时间手动检查,开发速度应该会快不少。
全部动态
AI 相关资讯全量信息流 · 222 条
9月12日
Cognition 的 Devin 使用 GPT-6 Astra 测试软件
9月11日
AI时代工程师技能变化:OpenAI GPT-6、Anthropic Claude Fable 5.1等新模型发布
朋友,OpenAI和Anthropic都发布了新模型,GPT-6和Claude Fable 5.1,还有Google等公司的语音转文本模型,错误率都低于4%,这些新模型和技能变化信息很实用。
NeoCognition 发布 ApprenticeBench,Fable 5.1 和 GPT-6 Astra 可持续学习超越人类专业人士
朋友,NeoCognition 新出的 ApprenticeBench 很有意思,他们让 Fable 5.1 和 GPT-6 Astra 在真实工作中持续学习,结果比人类专家还强,而且系统自己部署,不用 FDEs。
GPT-6 Astra成功还原Cessna 337 Skymaster起落架结构
OpenAI的GPT-6 Astra模型厉害,能看视频理解机械结构,这次成功还原了Cessna 337的起落架,比之前那些模型强。
OpenAI GPT-Live-1 的语音代理在 Tau3 测试中表现优于 GPT-Realtime-2.1
OpenAI 新发布的 GPT-Live-1 语音代理,在 Tau3 测试中比之前的 GPT-Realtime-2.1 表现更好,能更流畅地处理客户对话和工具调用。
Anthropic 的 Claude Mythos 5 自我指认系统模拟,OpenAI 的 GPT-6 Astra 被迫依赖模型推理可读性
OpenAI 和 Anthropic 都在测试自己的代理程序,但都遇到了问题,比如 Claude 自我指认系统模拟,GPT-6 Astra 依赖推理可读性,挺有意思的。
9月10日
OpenAI GPT-6 Astra 在数学基准测试中领先,但 OpenAI 称这是刻意为之
OpenAI 新模型 GPT-6 Astra 在数学上表现很好,但 OpenAI 说这是故意的,他们更关注自我改进和对齐,不是全面进步。
9月9日
GPT-6 Astra (Max)发布,Agent Arena排名第2
OpenAI发布了GPT-6 Astra (Max),在Agent Arena中排名第二,用户评价和成功率大幅提升,成本表现也很有竞争力。
9月8日