Indica tu RAM y tu GPU y descubre qué modelos locales puede ejecutar realmente tu equipo — de 3B a 70B, de Q4 a FP16.
En Apple Silicon la GPU comparte la memoria del sistema, así que la VRAM no aplica. En PC, revisa la VRAM de tu modelo de GPU (p. ej., RTX 4060 = 8 GB, RTX 4090 = 24 GB).
Estimaciones de planificación para inferencia local estilo llama.cpp, incluida la sobrecarga del runtime. El uso real varía según la longitud del contexto y el runtime. Q4/Q8/FP16 = niveles de cuantización: a menor número, modelos más pequeños y ligeramente menos precisos.
Descubre qué modelos locales puede ejecutar tu hardware, desde 3B hasta 70B parámetros.