论文Agent 与开发者多源确认19:22D2K-Bench 基准测试:LLM Agent 能否把专家设计转化为高效 GPU 内核arXiv 上的新基准 D2K-Bench,26 个任务测 LLM 写 GPU 内核,加上专家指导后 GPT-6-Astra 等模型的加速比从 1.69 倍冲到 2.49 倍,结果挺有意思。#D2K-Bench#GPU内核#GPT-6-Astra#Claude-Opus-4.810 个信源在谈事件专题aarXiv cs.AI@Daifeng Li 等 9 人11 个信源在谈原文稍后读已读值得跟进有用关注 D2K-Bench