23:50Fireworks AI@FireworksAI_HQ精选FireworksAI 发布了新一代推理引擎,实现了每步部署新权重的权重同步机制。该引擎在 rollout throughput 方面显著提升了生成速度和 GPU 利用率。Cofounder @jamesr66a 详细介绍了如何构建同时满足这三点要求的系统。AI产品FireworksAI推理引擎GPU利用率推荐理由:FireworksAI 推出新一代推理引擎,实现每步更新权重,大幅提升生成速度和 GPU 利用率。原文稍后读已读值得跟进有用关注 FireworksAI
22:05官方账号Clement Delangue@ClementDelangue精选83°Hugging Face 科学团队在 TRL 库中实现了一种新的异步强化学习权重同步方法,将每次同步的带宽成本降低约 100 倍。核心洞察是:在 RL 步骤之间,约 99% 的 bf16 权重是比特相同的,只有极少部分发生变化。他们只将变化的元素编码为稀疏 safetensors 文件,通过 Hugging Face Bucket 传输,而不是传输整个权重文件。以 Qwen3-0.6B 为例,每次步骤的传输量从 1.2 GB 降至 20-35 MB。这意味着不再需要共享集群、RDMA、VPN 或跨云 NCCL,只需一个 GPU 和一个 Hugging Face 账号即可进行真正的分离式 RL 训练。AI产品强化学习权重同步Hugging Face推荐理由:做分布式 RL 训练的团队终于可以告别昂贵的带宽和复杂的基础设施——只需 HTTPS 和一个 Bucket,就能实现跨区域的推理集群同步,建议搞 RL 的开发者直接看原文。原文稍后读已读值得跟进有用关注 强化学习