AITOPAI热报
今日精选全部动态早读东盟 AIAgent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOPAI热报

多轮推理

共 2 条相关 AI 资讯
9月1日
10:17
10:17官方账号arXiv cs.AI@Jie Liang, Zhengxin Yu, Hamid Nasiri, Peter Garraghan
精选73°
研究人员提出通过几何信号追踪LLM隐藏状态轨迹,包括时间曲率和方差斜率。在四项任务和三种底层模型上,这些信号能在任务完成前区分正确与错误推理路径。研究将每个任务分解为读、写、回应、转移四个动作链,发现不同信号能区分各种链模式。实验表明,该方法在τ-Bench上将任务成功率从24.1%提升至39.6%,同时减少11.2%的token消耗。
论文LLM多轮推理隐藏状态

推荐理由:这篇论文用几何方法追踪LLM推理轨迹,能提前发现错误路径,提升任务成功率还降低token成本。
原文
8月4日
11:46
11:46官方一手arXiv: DeepSeek@Sicong Liao, Zhi Chen, Yaohua Tang
TCPO是一种面向验证器引导多轮强化学习的回合级信用分配方法,将验证器分数转换为回合级优势。它通过参考比较构建三种信用估计:回溯信用衡量相对最优状态的即时进展,事后延迟信用识别有后续回报的非改进回合,选择性反事实估计修正高意外回合。在数学推理、代码生成和AppWorld智能体任务上的实验显示,TCPO在Qwen3-4B和DeepSeek-R1-Distill-Llama-8B上取得最佳或并列最佳的最优回合Pass@8,并减少成功所需轮次。
论文TCPO强化学习多轮推理

推荐理由:TCPO把验证器分数拆成每一步的信用,让模型知道哪个回合真正有用,在数学、代码和Agent任务上都有效果。
原文
精选动态早读东盟登录