事件专题 ·单一信源

Google 发布 VeriHarness:用智能体验证器替代多数投票选答案

Google 论文指出,对多个 agent rollout 取共识答案的做法可能掩盖共同错误,而分歧反而常指向正确答案。VeriHarness 将同一个基础模型变成 agentic verifier:一边在 rollout 分歧时核查 workspace 证据,一边挑战全员一致但可能遗漏需求的结论。在五个 long-horizon 基准上取得最佳选择成绩,配合证据支持的修订,Gemini 3.5 Flash 单 rollout 提升 6.2 分,Claude Opus 4.8 提升 6.4 分。作者同时开源了约 26,000 条 rollout 数据。

当前结论

Google 这篇论文有点反直觉:答案一致反而可能是错的。VeriHarness 用同款模型当验证器挑毛病,五个基准上都能涨分,数据也开源了。

2 个信源31° AI 热度最后更新 2026/10/4 11:00:11

证据链

2 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。