the IT Hustle
FerramentasManual de campoSobre

Verificador de IA Local

Informe sua RAM e GPU e descubra quais modelos locais sua máquina consegue rodar de verdade — de 3B a 70B, de Q4 a FP16.

No Apple Silicon, a GPU compartilha a memória do sistema, então a VRAM não se aplica. Em PCs, verifique a VRAM do modelo da sua GPU (ex.: RTX 4060 = 8 GB, RTX 4090 = 24 GB).

Tamanho do modeloQ4Q8FP16
3BparâmetrosLento (CPU)~3 GBLento (CPU)~5 GBLento (CPU)~8 GB
7BparâmetrosLento (CPU)~5 GBLento (CPU)~9 GBNão cabe~17 GB
13BparâmetrosLento (CPU)~9 GBNão cabe~16 GBNão cabe~30 GB
34BparâmetrosNão cabe~20 GBNão cabe~39 GBNão cabe~76 GB
70BparâmetrosNão cabe~40 GBNão cabe~79 GBNão cabe~156 GB
Como interpretar
  • Roda bem — Cabe na GPU/memória unificada — velocidade interativa com runtimes como Ollama ou LM Studio.
  • Lento (CPU) — Cabe apenas na RAM do sistema — roda na CPU a poucos tokens por segundo. Serve para testes, mas é sofrido no uso diário.
  • Não cabe — Precisa de mais memória do que esta máquina tem, mesmo com quantização Q4.

Estimativas de planejamento para inferência local no estilo llama.cpp, já incluindo o overhead do runtime. O uso real varia com o tamanho do contexto e o runtime. Q4/Q8/FP16 = níveis de quantização: números menores significam modelos menores e um pouco menos precisos.

Como saber se sua máquina roda IA local

Descubra quais modelos locais o seu hardware consegue rodar, de 3B a 70B parâmetros.

  1. 1
    Informe sua RAMMemória total do sistema em GB. No Windows: Gerenciador de Tarefas → Desempenho. No macOS: Sobre Este Mac.
  2. 2
    Informe a VRAM da GPUMemória dedicada da GPU em GB (ex.: RTX 4060 = 8 GB, RTX 4090 = 24 GB). Em Apple Silicon, pule esta etapa e marque a caixa de memória unificada.
  3. 3
    Leia a matrizCada tamanho de modelo (3B–70B) recebe um veredito por nível de quantização: roda bem na GPU, lento na CPU ou não cabe — com a memória aproximada necessária.
  4. 4
    Instale um runtimeSe aparecerem células verdes, instale o Ollama ou o LM Studio, baixe um modelo que caiba e pronto: você está rodando IA localmente sem gastar nada com API.

Perguntas frequentes

São níveis de quantização — quantos bits armazenam cada peso do modelo. O Q4 encolhe um modelo para cerca de um quarto do tamanho original com uma pequena perda de qualidade; o FP16 é qualidade total em tamanho total. A maioria de quem roda IA local usa Q4 ou Q8 pela economia de memória.

Os Macs com Apple Silicon compartilham um único pool de memória unificada entre CPU e GPU, então um MacBook de 32 GB consegue acelerar na GPU modelos que exigiriam uma placa de vídeo dedicada de 24 GB em um PC.

Não — os modelos de fronteira hospedados na nuvem são claramente mais fortes. Mas um modelo local de 7B a 13B dá conta de resumos, rascunhos e ajuda com código, não custa nada por token, funciona offline e mantém dados sensíveis na sua máquina.

São números de planejamento para runtimes no estilo llama.cpp, já incluindo o overhead típico. Contextos longos, lotes grandes e runtimes específicos alteram o uso real — trate um veredito verde apertado como um talvez.

Ferramentas relacionadas

Planejador de Custos de IAContador de TokensFerramentas de Rede