模型多源确认

Beam 被指是 DeepSeek V3 的等算力复现:23B 参数 × 23.8T tokens

精选理由

有人算出 Beam 和 DeepSeek V3 总训练算力几乎一模一样,等于是两年后的复现,但效率差挺远,评论区还挺热闹。

一条推文算了一笔账:Beam 用 23B 参数训练 23.8T tokens,与 DeepSeek V3 的 37B 参数 × 14.8T tokens 总 FLOPs 几乎相同,比值约 0.9996,相当于两年后的 iso-FLOP 复现。作者同时指出 Beam 并未复现 V3 的训练效率,认为在精细量化下单张 H100 的效果可超过 NVL72 中的一张 GB300。

原文 · Teortaxes

interesting fact about Beam: 23B*23,8T/37B*14,8T≈0,9996! It's an iso-flop replication of DeepSeek V3, 2 years later. Not of V3's efficiency, though. in tender loving Chinese quant hands, one gimped H100 is > one GB300 in NVL72. https://t.co/kYY8swW3hb