论文
arXiv 与期刊里的 AI 论文,每篇附中文摘要与推荐理由 · 5284 篇
9月3日
9月2日
论文10:49
CordisBench评测语言模型组件生命周期推理能力CordisBench基准测试了模型在动态代理环境中的组件生命周期推理能力,发现模型随复杂度增加可靠性下降,GPT-5.6 Luna在中等推理下每题需近3000个token。
CordisBench基准测试了模型在动态代理环境中的组件生命周期推理能力,发现模型随复杂度增加可靠性下降,GPT-5.6 Luna在中等推理下每题需近3000个token。