技巧

LocalMaxxing:查你的显卡本地跑大模型能有多快

精选理由

想本地跑模型又怕显卡拉胯的,先上 LocalMaxxing 查查同款显卡的实测 token 速度,买卡前心里有数。

LocalMaxxing 是一个本地大模型跑分社区,用户上传自己机器的实测结果,可按模型、显卡、推理引擎和量化格式筛选。榜单关注三项指标:每秒生成 token 数、首字延迟和显存占用。千亿参数模型现在 12GB 显存就能跑起来,买显卡前可以先查相近配置的实测表现。用户也能用 CLI 测速并上传结果到排行榜,比较时需注意引擎和量化格式不同会导致速度差异。

原文 · Lxfater

国庆后,估计每个人都想试试本地跑大模型

因为现在千亿参数 12gb 显存就能跑起来了

但想知道自己的显卡能跑多快?

可以查这个网站:LocalMaxxing。

一个本地大模型跑分社区,用户上传自己机器的实测结果,可以按模型、显卡、推理引擎和量化格式筛选。

主要看三件事: 1. 生成速度:每秒输出多少 token 2. 首字延迟:发出问题后多久开始回答 3. 显存占用:这套配置能不能装得下

准备买显卡,或者折腾本地模型时,可以先找相近配置,看看别人跑出来的表现,再决定怎么配。

自己也能用 CLI 测速,把结果上传到排行榜。比较时记得看具体测试条件,同一个模型换引擎、换量化,速度也会变。

https://t.co/LmirNpSesw