Apple Silicon 跑本地大模型,速度还能再提升多少?
BaseRT 给出了一个答案:在 M5 Pro 上,它的提示词处理速度最高达到 llama.cpp 的 6.4 倍,MLX 的 3.9 倍

BaseRT 是一款专为 Apple Silicon 优化的本地 AI 推理引擎,可以运行 Qwen、Llama、Gemma 等多种开源模型。
在对比测试中,BaseRT 的优势主要集中在 Prefill(提示词处理)阶段,在 Decode(生成速度)阶段也有一定提升:
| 模型阶段 | 对比 llama.cpp | 对比 MLX |
|---|---|---|
| Prefill(提示词处理速度) | 最高 6.4 倍 | 最高 3.9 倍 |
| Decode(生成速度) | 最高 1.75 倍 | 最高 1.33 倍 |
curl -LsSf https://basecompute.co/install.sh | sh
basert pull Qwen/Qwen3-4B
basert chat Qwen/Qwen3-4B
就可在终端中与本地模型对话了。
basert serve Qwen/Qwen3-4B --port 8080
BaseRT 会提供 OpenAI 兼容接口:
大模型运行速度,不只取决于芯片性能,也取决于软件是否能够充分利用硬件。
与 llama.cpp、MLX 等已有本地推理方案相比,BaseRT 的优化重点是利用 Apple Silicon 的硬件特性。在 M5 Pro 测试中,它利用 M5 新增的 Tensor Core 架构,以及 Metal 4 Tensor API 提供的底层计算能力,获得了明显的性能提升。
BaseRT 在 Qwen3、Qwen3.5、Qwen3.6、Llama 3.2、Gemma 4 等多个模型上进行了测试,覆盖 0.6B 到 35B 参数规模。
使用的设备:Apple M5 Pro、48 GB 内存。
| Model | BaseRT pp128 | llama.cpp pp128 | BaseRT pp256 | llama.cpp pp256 | BaseRT pp512 | llama.cpp pp512 | BaseRT pp1024 | llama.cpp pp1024 | BaseRT pp2048 | llama.cpp pp2048 |
|---|---|---|---|---|---|---|---|---|---|---|
| Qwen3-0.6B | 11873 | 10559 | 17578 | 14093 | 24525 | 17350 | 29062 | 18973 | 31183 | 19232 |
| Llama-3.2-1B | 8936 | 6859 | 13491 | 9267 | 19539 | 11922 | 23952 | 13742 | 27443 | 14358 |
| Qwen3.5-2B | 4594 | 3908 | 6994 | 5224 | 10662 | 6888 | 14137 | 8121 | 16291 | 8500 |
| Llama-3.2-3B | 3663 | 2831 | 5658 | 3845 | 8428 | 5115 | 11206 | 6132 | 13315 | 6577 |
| Gemma-4-E2B | 4991 | 1992 | 7825 | 2524 | 12380 | 2631 | 14661 | 2600 | 16264 | 2547 |
| Gemma-4-26B-A4B | 2246 | 1185 | 3448 | 1488 | 5246 | 1897 | 6718 | 2208 | 7857 | 2419 |
| Qwen3-30B-A3B | 2478 | 1280 | 3767 | 1592 | 5663 | 2043 | 7357 | 2324 | 8644 | 2586 |
| Qwen3.5-35B-A3B | 1501 | 1065 | 2259 | 1356 | 3525 | 1652 | 4577 | 1894 | 5304 | 2094 |
| Qwen3.6-35B-A3B | 1361 | 1042 | 2053 | 1331 | 3198 | 1614 | 4202 | 1847 | 4860 | 2051 |
| Qwen3.6-27B | 440 | 358 | 664 | 453 | 1021 | 560 | 1416 | 662 | 1706 | 747 |
| 模型 | BaseRT | llama.cpp | 提升 | MLX | 提升 |
|---|---|---|---|---|---|
| Qwen3-0.6B | 530.8 tok/s | 386.1 tok/s | 1.37× | 398.1 tok/s | 1.33× |
| Llama 3.2-1B | 342.1 tok/s | 267.1 tok/s | 1.28× | 298.0 tok/s | 1.15× |
| Qwen3.5-2B | 219.6 tok/s | 147.1 tok/s | 1.49× | 208.7 tok/s | 1.05× |
| Llama 3.2-3B | 137.0 tok/s | 120.0 tok/s | 1.14× | 131.0 tok/s | 1.05× |
| Gemma 4-26B-A4B | 85.0 tok/s | 83.3 tok/s | 1.02× | 87.0 tok/s | 0.98× |
| Qwen3-30B-A3B | 105.1 tok/s | 96.7 tok/s | 1.09× | 97.7 tok/s | 1.08× |
| Qwen3.5-35B-A3B | 110.6 tok/s | 72.5 tok/s | 1.53× | 104.8 tok/s | 1.06× |
| Qwen3.6-35B-A3B | 110.7 tok/s | 63.1 tok/s | 1.75× | 101.9 tok/s | 1.09× |