the IT Hustle
HerramientasManual de campoAcerca de

Verificador de IA Local

Indica tu RAM y tu GPU y descubre qué modelos locales puede ejecutar realmente tu equipo — de 3B a 70B, de Q4 a FP16.

En Apple Silicon la GPU comparte la memoria del sistema, así que la VRAM no aplica. En PC, revisa la VRAM de tu modelo de GPU (p. ej., RTX 4060 = 8 GB, RTX 4090 = 24 GB).

Tamaño del modeloQ4Q8FP16
3BparámetrosLento (CPU)~3 GBLento (CPU)~5 GBLento (CPU)~8 GB
7BparámetrosLento (CPU)~5 GBLento (CPU)~9 GBNo cabe~17 GB
13BparámetrosLento (CPU)~9 GBNo cabe~16 GBNo cabe~30 GB
34BparámetrosNo cabe~20 GBNo cabe~39 GBNo cabe~76 GB
70BparámetrosNo cabe~40 GBNo cabe~79 GBNo cabe~156 GB
Cómo interpretar esto
  • Corre bien — Cabe en la memoria de la GPU o unificada — velocidad interactiva con runtimes como Ollama o LM Studio.
  • Lento (CPU) — Solo cabe en la RAM del sistema — corre en CPU a unos pocos tokens por segundo. Sirve para probar, pero se hace pesado para el uso diario.
  • No cabe — Necesita más memoria de la que tiene este equipo, incluso con cuantización Q4.

Estimaciones de planificación para inferencia local estilo llama.cpp, incluida la sobrecarga del runtime. El uso real varía según la longitud del contexto y el runtime. Q4/Q8/FP16 = niveles de cuantización: a menor número, modelos más pequeños y ligeramente menos precisos.

Cómo saber si tu equipo puede correr IA local

Descubre qué modelos locales puede ejecutar tu hardware, desde 3B hasta 70B parámetros.

  1. 1
    Introduce tu RAMLa memoria total del sistema en GB. En Windows: Administrador de tareas → Rendimiento. En macOS: Acerca de esta Mac.
  2. 2
    Introduce la VRAM de tu GPULa memoria dedicada de la GPU en GB (p. ej., RTX 4060 = 8 GB, RTX 4090 = 24 GB). En Apple Silicon sáltate este paso y marca la casilla de memoria unificada.
  3. 3
    Lee la matrizCada tamaño de modelo (3B–70B) recibe un veredicto por nivel de cuantización: corre bien en GPU, lento en CPU o no cabe — con la memoria aproximada que necesita.
  4. 4
    Instala un runtimeSi te salen celdas verdes, instala Ollama o LM Studio, descarga un modelo que quepa y ya estarás corriendo IA en local sin pagar nada por token.

Preguntas frecuentes

Son niveles de cuantización — cuántos bits almacenan cada peso del modelo. Q4 reduce un modelo a aproximadamente una cuarta parte de su tamaño completo con una pequeña pérdida de calidad; FP16 es calidad completa a tamaño completo. La mayoría de los usuarios locales corren Q4 o Q8 por el ahorro de memoria.

Las Mac con Apple Silicon comparten un solo bloque de memoria unificada entre CPU y GPU, así que una MacBook de 32 GB puede acelerar por GPU modelos que en una PC exigirían una tarjeta gráfica dedicada de 24 GB.

No — los modelos de frontera alojados en la nube son claramente superiores. Pero un modelo local de 7B–13B resuelve bien resúmenes, borradores y ayuda con código, no cuesta nada por token, funciona sin conexión y mantiene los datos sensibles en tu equipo.

Son cifras de planificación para runtimes estilo llama.cpp, incluida la sobrecarga típica del runtime. Los contextos largos, los lotes grandes y cada runtime concreto modifican el uso real — si un veredicto verde te queda muy justo, tómalo como un quizás.

Herramientas relacionadas

Planificador de Costos de IAContador de TokensHerramientas de Red