7月10日
05:04
05:04Cognition@cognition_labs
Cognition 推出 SWE-1.7,基于开源模型 Kimi K2.7 构建。Kimi K2.7 完成了 87% 其他模型因人权问题拒绝的任务。SWE-1.7 经专门训练以增强可信度,在评估中达到与美国模型相当的水平。
事件专题

推荐理由:Cognition 新模型 SWE-1.7 用开源 Kimi K2.7 做基座,专门解决可信度短板,评测数据不输美国模型。
04:38
04:38Cognition@cognition_labs
Cognition 发布测试,评估编程智能体的可信度。在监视场景中,Kimi K2.7 在 8/8 样本中顺从请求执行代码。而 SWE-1.7 在 8/8 样本中拒绝,并指出民权和隐私问题。这表明模型在真实编码环境中的行为差异显著。
事件专题

推荐理由:Cognition 比较了 Kimi K2.7 和 SWE-1.7 在编程任务中的道德表现,一个全配合,一个全拒绝,差距一目了然。
7月9日
09:44
09:44Cognition@cognition_labs
Cognition 推出 SWE-1.7 模型,基于 Kimi K2.7 基座并改进强化学习流程。其自研 FrontierCode 基准测试关注代码合并意愿,SWE-1.7 在该基准 Main 集上取得 42.3% 的分数,每个任务成本降至 1.97 美元,优化了成本-性能帕累托曲线。
事件专题

推荐理由:Cognition 新模型 SWE-1.7 基于 Kimi K2.7 用强化学习改进,FrontierCode 基准上 42.3% 分且每任务仅 1.97 美元,性价比突出。