模型82°

HuggingFace 开源 SmolDataEnvs:5000+ 可验证数据科学 RL 训练任务

精选理由

HuggingFace 开源了 5000 个数据科学 RL 任务,源自真实 Kaggle 笔记本,评分不用 LLM 判卷,还配了 SFT 轨迹和 Colab 脚本,想自己练小模型可以直接上手。

HuggingFace 上线 SmolDataEnvs 数据集,包含 5000 个面向小模型强化学习的可验证数据科学任务。任务源自真实数据科学家在 471 个 Kaggle 数据集上写的 Jupyter 笔记本,每个任务都经过强 agent 模型在沙箱中解出并复现金标准答案后才被收录。评分由不依赖任何 LLM 的确定性评分器完成,通过精确比较已知答案给出奖励,保证奖励信号不漂移。项目配套提供 4677 条已验证的 agent 轨迹用于 SFT 热启动,以及打包成 Harbor 沙箱环境的训练/评测版本,官方 Colab notebook 显示 SFT 在免费 T4 上即可跑完,RL 需要一块 A100。

原文 · shao__meng

HuggingFace 开放了 5000+ 面向小模型 RL 训练的“可验证数据科学任务”数据集「SmolDataEnvs」 作者 @adithya_s_k 构建数据集的想法:模型拿到一个从未见过的真实表格数据集和一个问题,必须在沙箱里写代码、跑代码、算出答案,答案由一个不依赖任何 LLM 的确定性评分器判对错。 数据集地址: huggingface.co/datasets/FineE… 数据从哪来、怎么保证质量? 1. 原材料是 jupyter-agent 数据集:真实数据科学家在 471 个 Kaggle 数据集上写的 Jupyter 笔记本。每一对“问题—答案”都是从这些真实笔记本里抽取的(不是模板生成的),所以问题本身就是人类真实会问的。 2. 准入验证:每个任务都必须由强 agent 模型在真实沙箱中解出并复现金标准答案,才被收录;任何有歧义或无法判定的任务直接丢弃。也就是说,每个任务都是“已知可解、可无歧义评分”的,模型得了零分,那是模型的问题,不是任务的问题。 3. 评分无 LLM 参与:奖励是对已知答案的精确比较,通过一个判定阶梯实现。换模型、换环境,奖励信号不会漂移,因为奖励路径里根本没有会漂移的东西。 一个完整的“产品家族”,不是一个孤立数据集 这个项目最用心的地方是给了三种使用方式、五个仓库: · SmolDataEnvs (本数据集):纯行式数据 + grader. py,自由 prompt 任意模型 · SmolDataEnvs-sft:4,677 条已验证的 agent 轨迹,TRL 就绪,用于 SFT 热启动 · SmolDataEnvs-harbor-train/test/eval:同样任务打包成 Harbor 沙箱环境,可直接接进训练框架 推荐的完整流程是:先在基模型上跑留出评测 (“不先测基线,后面一切都是没有对照的故事”) → SFT 热启动 → GRPO 强化学习 → 用与第一步完全相同的测量方式复测。官方提供 Colab notebook (SFT 在免费 T4 上就能跑完,RL 需要一块 A100,因为 vLLM 生成与训练共置在同一 GPU),以及一键提交 Hugging Face Jobs 的脚本。 clem 🤗 @ClementDelangue Super happy to release SmolDataEnvs: 5,000 verifiable RL environment tasks for hill-climbing small models in code and data science by @adithya_s_k 100% open source: environments, evals, training! huggingface.co/datasets/FineE… 🔗 View Quoted Tweet 💬 0 🔄 0 ❤️ 2 👀 304 📊 1 ⚡

  • Clement Delangue09-25 16:11原文