Atomic Chat 接入 NVIDIA TensorRT,本地推理比 llama.cpp 快 206%
Atomic Chat 把 NVIDIA TensorRT 接进自家引擎,RTX 5090 上跑 Qwen 系列模型比 llama.cpp 快一倍多,本地部署党可以看看实测数据。
Atomic Chat 将 NVIDIA TensorRT 接入其本地推理引擎,在 Blackwell RTX 5090 上测试 Qwen3.5-4B 和 Qwen 3-8B。实测耗时 3.43 秒,对比 llama.cpp 的 10.49 秒,速度快 206%。测试通过 CUDA 运行,覆盖两款 Qwen 系列 4B/8B 级别模型。
TensorRT 206% faster than llama.cpp ✳️
We wired @NVIDIAAI's TensorRT into Atomic Chat's engine and tested Qwen3.5-4B/Qwen 3-8B via CUDA on a Blackwell RTX 5090, measuring 3.43s vs 10.49s with llama.cpp
Run AI models locally -> https://t.co/RbcCOIgVkj https://t.co/j8kCqJYzSE