事件专题 ·多源确认

DolphinBench 基准:用真实任务评估智能体记忆的准确率、成本与延迟

arXiv 论文提出 DolphinBench,把记忆评估从问答对错改为直接看智能体完成任务的成败。基准设置 3 个知识工作者 persona,每个积累约 50 万 token 的历史消息,任务必须依赖这些历史才能完成。每个 persona 配 200 个任务,验证方式是带历史运行必须成功、去掉历史运行必须失败。所有提交须同时报告准确率、总成本和延迟,论文据此绘制记忆系统的帕累托前沿,并指出此前没有基准同时覆盖这三项。数据集和评测代码已在 dolphinbench.ai 公开。

当前结论

做智能体记忆的可以看这份新基准:500k token 历史里找信息完成任务,还得报成本和延迟。

3 个信源43° AI 热度最后更新 2026/9/21 17:54:35

证据链

3 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。