sparkDash 2.0 开源企业私有化 token 工厂看板
搞私有化算力的团队福音,sparkDash 2.0 让你的 GPU 真正变成可管理的 token 工厂,从监控到成本分析一站式搞定。
sparkDash 2.0 是一个面向私有化算力运营的开源看板工具。该工具支持监控 GPU 状态、实时 token 生成速度、模型质量评估和成本计算。MiaAI_lab 使用 4 台 DGX Spark 跑 GLM 5.3 Flash 的需求开发,支持 vLLM/SGLang 等多种引擎指标。内置压测功能可对比模型切换前后的质量变化,帮助企业评估私有化部署成本。
企业私有化 token 工厂的看板,有人开源了:sparkDash 2.0,对于我们这种搞私有化算力的从业者来说非常有价值。
自建算力、私有部署、模型主权——这条路上的公司,买卡和下权重都不难,难的是把一堆 GPU 真正当成一座工厂来运营。
工厂要有看板,产线在不在跑、产能多少、良率多少、单位成本多少,推理集群也一样:
1、卡在干什么? 每秒出多少 token,卡在 decode 还是 prefill? 一千个 token 烧多少电、花多少钱? 换模型、换量化、换引擎之后,质量掉没掉? MiaAI_lab 用自己 4 台 DGX Spark 跑 GLM 5.3 Flash 的真实需求,把这四个问题做成了一个面板 开源出来。
2、产线状态 每台机器一张卡片:GPU、CPU、统一内存、存储、网络、当前服务的模型。任何带 N 卡的 Linux 机器都能接,多卡主机每张卡一个块,从 UI 加机器不重启。
3、产能 直接读 vLLM / SGLang / llama.cpp / TensorFold / EXL3 等引擎自己的指标:实时 decode 和 prefill tok/s、KV cache 占用、运行/等待队列、TTFT、ITL p95、抢占、prefix cache 命中、MTP 接受率,这是token生产线仪表盘,不是显卡温度计。
4、良率 内置压测:Decode bench 跑 1/2/4/8 并发的总吞吐和单流吞吐,Prefill bench,Quality bench 直接跑 GSM8K 和 MMLU,Tool Eval Bench 69 个工具调用场景。
每次结果都留着,换模型前后一对比,质量回退一眼看出来,私有化交付的验收环节,就靠这个。
5、成本 Token 总量按模型、按天、生成和读取分开,缓存命中率。Fleet energy 算当前功耗、24 小时耗电、电费、每千 token 多少 Wh。
"自建到底比调 API 便宜多少",这一页截图就是答案。
6、运营 面板上启停模型、整机群优雅关机、Wake-on-LAN、Tailnet 掉线告警、手机端可看、SSH 密码 AES-256-GCM 加密。
它不是替代 DCGM + Prometheus 的万卡监控的方案,大厂方案太重,自己拼 Grafana 太费劲,它刚好面向企业私有化的小型 token 工厂:企业内部算力池、政府部门的内网部署、团队实验机群。
模型主权 = 权重在自己手里 + 推理在自己机器上 + 账在自己脑子里,前两个大家都在做,但第三个一直缺工具,现在sparkDash补齐了这个。