论文Agent 与开发者11:03SWE-Flux:仓库级代码执行推理基准,最佳模型仅得 37%一个新的代码执行推理基准,480 道题来自真实仓库的测试执行,最强模型才 37 分,看看你常用的模型到底会不会“跑”代码。#SWE-Flux#LLM#代码推理#基准测试aarXiv cs.AI@Hamed Taherkhani 等 6 人原文稍后读已读值得跟进有用关注 SWE-Flux