论文Agent 与开发者精选09:17首个LLM版本约束理解基准测试集发布这个研究很实用,它帮你选LLM时有个新维度,比如Claude在版本约束理解上比GPT-5.1强很多,值得看看。#SemVerBench#LLM#版本约束#编程助手aarXiv: OpenAI@Qibai Chen, Zeming Liu原文稍后读已读值得跟进有用关注 SemVerBench