产品76°

PyTorch用FBTriton替代CUDA提升TBE性能

精选理由

PyTorch团队用FBTriton替代CUDA,推荐系统模型速度翻倍,开发者效率大增。

PyTorch团队用FBTriton替代CUDA实现Table Batched Embedding(TBE)内核。该优化使推荐系统模型前向速度提升最高1.28倍,后向速度提升2倍。开发者工作效率也获得显著提升。

原文 · PyTorch

Replacing CUDA with FBTriton for Table Batched Embedding (TBE) kernels delivered massive gains for our rec sys models.

@Meta contributors achieved up to 1.28x faster forward passes, 2x faster backward passes, and a huge boost in developer velocity. Check out the engineering deep-dive: https://t.co/qdP0nnoLgF

✍️ Daohang Shi, Oleksandr Stashuk, Rupert Wu, Liangbei Xu, Rich Zhu