主要来源DAIR.AI
查看原文事件专题 ·多源确认
NVIDIA 论文:终端智能体加大验证器投入比增加采样更有效
NVIDIA 发表关于终端智能体测试时计算的论文,核心做法是采样多条候选 shell 命令并在执行前验证。用 GPT-5.6 Sol 作为验证器从 8 个候选动作中挑选时,TerminalBench-Lite 的 Pass@1 从 50.0% 提升到 68.0%,而弱验证器下增加采样几乎没有收益。Mid-Harness 方法不改动生成器和 harness,在两者之间做验证。当 TMAX-9B 小模型自验证时,成对比较效果最好,再把强验证器蒸馏进去还能进一步提升。
当前结论
NVIDIA 新论文说终端命令别直接跑,先采样再验证,验证器要舍得花钱,Pass@1 直接从 50% 拉到 68%。
11 个信源52° AI 热度最后更新 2026/10/4 11:00:11
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。