主要来源elvis
查看原文事件专题 ·单一信源
Google 发布 VeriHarness:用智能体验证器替代多数投票选答案
Google 论文指出,对多个 agent rollout 取共识答案的做法可能掩盖共同错误,而分歧反而常指向正确答案。VeriHarness 将同一个基础模型变成 agentic verifier:一边在 rollout 分歧时核查 workspace 证据,一边挑战全员一致但可能遗漏需求的结论。在五个 long-horizon 基准上取得最佳选择成绩,配合证据支持的修订,Gemini 3.5 Flash 单 rollout 提升 6.2 分,Claude Opus 4.8 提升 6.4 分。作者同时开源了约 26,000 条 rollout 数据。
当前结论
Google 这篇论文有点反直觉:答案一致反而可能是错的。VeriHarness 用同款模型当验证器挑毛病,五个基准上都能涨分,数据也开源了。
2 个信源31° AI 热度最后更新 2026/10/4 11:00:11
证据链
2 个信源相关来源 1arXiv cs.AI
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。