论文
arXiv 与期刊里的 AI 论文,每篇附中文摘要与推荐理由 · 5284 篇
9月9日
Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails
研究解决了小模型模仿专家时的性能下降问题,提出了新的在线策略修正方法,让小模型在特定任务中更接近大模型表现。
研究解决了小模型模仿专家时的性能下降问题,提出了新的在线策略修正方法,让小模型在特定任务中更接近大模型表现。