Informe sua RAM e GPU e descubra quais modelos locais sua máquina consegue rodar de verdade — de 3B a 70B, de Q4 a FP16.
No Apple Silicon, a GPU compartilha a memória do sistema, então a VRAM não se aplica. Em PCs, verifique a VRAM do modelo da sua GPU (ex.: RTX 4060 = 8 GB, RTX 4090 = 24 GB).
Estimativas de planejamento para inferência local no estilo llama.cpp, já incluindo o overhead do runtime. O uso real varia com o tamanho do contexto e o runtime. Q4/Q8/FP16 = níveis de quantização: números menores significam modelos menores e um pouco menos precisos.
Descubra quais modelos locais o seu hardware consegue rodar, de 3B a 70B parâmetros.