事件专题 ·官方一手

AgenticBBO-Bench:评测 LLM 智能体黑盒优化能力的跨域基准

研究团队发布 AgenticBBO-Bench,覆盖合成函数、超参数优化、数据库调优、芯片设计和分子设计五个领域,统一有限预算评测协议。实验显示 agentic BBO 在全部五个领域的平均得分高于直接使用 LLM 的方法,并在其中四个领域超过最佳数值优化器。分析发现额外增加数值工具并不总是提升性能,任务语义信息普遍有用,具体先验知识反而不够可靠。在五任务前沿挑战中,七款 LLM 在 Codex agent 框架下评测,GPT-6 Astra 和 DeepSeek-V4.1-Flash 位于性能与成本的 Pareto 前沿。

当前结论

想用 LLM 智能体做黑盒优化的可以看看,五个领域统一评测,还拆了哪些设计选择真有用、哪些是伪收益。

11 个信源37° AI 热度最后更新 2026/10/8 15:48:07

证据链

11 个信源
相关来源 3掘金本周最热
查看原文
相关来源 6Artificial Analysis
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。