the IT Hustle
工具实战手册关于

本地 AI 检测器

输入内存和显卡配置,看看你的机器到底能跑哪些本地模型——从 3B 到 70B,从 Q4 到 FP16。

Apple Silicon 的 GPU 与系统共享内存,因此无需填写显存。PC 用户请查看显卡型号对应的显存(如 RTX 4060 为 8 GB,RTX 4090 为 24 GB)。

模型规模Q4Q8FP16
3B参数较慢(CPU)~3 GB较慢(CPU)~5 GB较慢(CPU)~8 GB
7B参数较慢(CPU)~5 GB较慢(CPU)~9 GB无法运行~17 GB
13B参数较慢(CPU)~9 GB无法运行~16 GB无法运行~30 GB
34B参数无法运行~20 GB无法运行~39 GB无法运行~76 GB
70B参数无法运行~40 GB无法运行~79 GB无法运行~156 GB
如何解读
  • 流畅运行 — 可完全载入 GPU/统一内存——配合 Ollama 或 LM Studio 等运行时可达到交互级速度。
  • 较慢(CPU) — 只能载入系统内存——由 CPU 运行,每秒仅几个 token。测试没问题,日常使用会很吃力。
  • 无法运行 — 即使采用 Q4 量化,所需内存也超出本机配置。

以上是针对 llama.cpp 类本地推理的规划估算,已计入运行时开销。实际占用会随上下文长度和运行时而变化。Q4/Q8/FP16 为量化等级:数字越小,模型越小,精度略有下降。

如何检测你的电脑能否运行本地 AI

查看你的硬件能运行哪些本地模型,覆盖 3B 到 70B 参数规模。

  1. 1
    输入内存容量填写系统总内存(GB)。Windows 用户可在任务管理器的“性能”页查看,macOS 用户可在“关于本机”中查看。
  2. 2
    输入 GPU 显存填写独立显卡的显存(GB),如 RTX 4060 为 8 GB、RTX 4090 为 24 GB。Apple Silicon 用户可跳过此项,勾选统一内存选项即可。
  3. 3
    解读结果矩阵每个模型规模(3B–70B)在各量化等级下都有一个判定:GPU 流畅运行、CPU 较慢,或无法运行——并附上所需内存的大致数值。
  4. 4
    安装运行时如果出现绿色格子,安装 Ollama 或 LM Studio,拉取一个能装下的模型,就能零 API 成本在本地运行 AI 了。

常见问题

它们是量化等级——即每个模型权重用多少比特存储。Q4 能把模型压缩到完整大小的约四分之一,质量略有损失;FP16 是完整精度、完整体积。多数本地用户为了省内存会选择 Q4 或 Q8。

Apple Silicon 的 Mac 让 CPU 和 GPU 共享同一块统一内存,所以一台 32 GB 的 MacBook 能用 GPU 加速的模型,在 PC 上可能需要一块 24 GB 显存的独立显卡。

不能——前沿的云端模型明显更强。但 7B–13B 的本地模型足以胜任摘要、起草和编程辅助,且没有按 token 计费的成本,可离线使用,敏感数据也不会离开你的电脑。

它们是针对 llama.cpp 类运行时的规划数值,已计入常见的运行时开销。长上下文、大批量以及具体运行时都会影响实际占用——如果绿色判定的余量很小,请当作“可能可以”来看待。

相关工具

AI 成本规划器Token 计数器网络工具