Apple Silicon 的 GPU 与系统共享内存,因此无需填写显存。PC 用户请查看显卡型号对应的显存(如 RTX 4060 为 8 GB,RTX 4090 为 24 GB)。
模型规模Q4Q8FP16
3B参数较慢(CPU)~3 GB较慢(CPU)~5 GB较慢(CPU)~8 GB
7B参数较慢(CPU)~5 GB较慢(CPU)~9 GB无法运行~17 GB
13B参数较慢(CPU)~9 GB无法运行~16 GB无法运行~30 GB
34B参数无法运行~20 GB无法运行~39 GB无法运行~76 GB
70B参数无法运行~40 GB无法运行~79 GB无法运行~156 GB
如何解读
- 流畅运行 — 可完全载入 GPU/统一内存——配合 Ollama 或 LM Studio 等运行时可达到交互级速度。
- 较慢(CPU) — 只能载入系统内存——由 CPU 运行,每秒仅几个 token。测试没问题,日常使用会很吃力。
- 无法运行 — 即使采用 Q4 量化,所需内存也超出本机配置。
以上是针对 llama.cpp 类本地推理的规划估算,已计入运行时开销。实际占用会随上下文长度和运行时而变化。Q4/Q8/FP16 为量化等级:数字越小,模型越小,精度略有下降。