事件专题 ·多源确认

研究显示本地部署栈会影响工具调用评测结果

arXiv 论文 2609.26693 研究本地推理服务栈如何影响代码 Agent 的工具调用评测。测试发现 Ollama 会按模型的静态模板标志拦截请求,Phi-3 和 Gemma-3 在推理前就被直接拒绝。被拒和重试耗尽在评测框架中没有被记录为结构化失败元数据,可能被误判为模型不调用工具,错误报告 0% 保真度。在 Ollama、llama.cpp、vLLM、SGLang 四个栈上,相同请求的处理方式各不相同,Llama-3.2 在统一文本协议下保真度反而下降,按轮次汇总与按实例统计的结果差距可达约 55 个百分点。论文给出把服务栈行为纳入评测协议的检查清单。

当前结论

这篇论文很实用:同一个模型在 Ollama 和 vLLM 上跑工具调用评测,结果可能差几十个百分点,做本地评测前建议先看它的检查清单。

3 个信源44° AI 热度最后更新 2026/9/22 16:48:17

证据链

3 个信源
相关来源 1Hugging Face: Blog
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。