the IT Hustle
OutilsManuel de terrainÀ propos

Vérificateur d'IA locale

Indiquez votre RAM et votre GPU et découvrez quels modèles locaux votre machine peut réellement faire tourner — de 3B à 70B, de Q4 à FP16.

Sur Apple Silicon, le GPU partage la mémoire système : la VRAM ne s'applique donc pas. Sur PC, vérifiez la VRAM de votre carte graphique (ex. RTX 4060 = 8 Go, RTX 4090 = 24 Go).

Taille du modèleQ4Q8FP16
3BparamètresLent (CPU)~3 GBLent (CPU)~5 GBLent (CPU)~8 GB
7BparamètresLent (CPU)~5 GBLent (CPU)~9 GBNe tient pas~17 GB
13BparamètresLent (CPU)~9 GBNe tient pas~16 GBNe tient pas~30 GB
34BparamètresNe tient pas~20 GBNe tient pas~39 GBNe tient pas~76 GB
70BparamètresNe tient pas~40 GBNe tient pas~79 GBNe tient pas~156 GB
Comment lire ce tableau
  • Tourne bien — Tient dans la mémoire GPU/unifiée — vitesse interactive avec des outils comme Ollama ou LM Studio.
  • Lent (CPU) — Tient uniquement en RAM système — tourne sur CPU à quelques tokens par seconde. Suffisant pour tester, pénible au quotidien.
  • Ne tient pas — Demande plus de mémoire que cette machine n'en possède, même en quantification Q4.

Estimations indicatives pour l'inférence locale de type llama.cpp, surcharge d'exécution incluse. La consommation réelle varie selon la longueur de contexte et le moteur utilisé. Q4/Q8/FP16 = niveaux de quantification : plus le chiffre est petit, plus le modèle est compact, avec une légère perte de précision.

Comment savoir si votre machine peut faire tourner une IA locale

Découvrez quels modèles locaux votre matériel peut exécuter, de 3B à 70B paramètres.

  1. 1
    Saisissez votre RAMMémoire système totale en Go. Sur Windows : Gestionnaire des tâches → Performance. Sur macOS : À propos de ce Mac.
  2. 2
    Saisissez la VRAM de votre GPUMémoire GPU dédiée en Go (ex. RTX 4060 = 8 Go, RTX 4090 = 24 Go). Sur Apple Silicon, ignorez cette étape et cochez plutôt la case mémoire unifiée.
  3. 3
    Lisez la matriceChaque taille de modèle (3B–70B) reçoit un verdict par niveau de quantification : tourne bien sur GPU, lent sur CPU ou ne tient pas — avec la mémoire approximative nécessaire.
  4. 4
    Installez un moteur d'exécutionSi vous obtenez des cases vertes, installez Ollama ou LM Studio, téléchargez un modèle qui tient, et vous faites tourner une IA en local sans aucun coût d'API.

Questions fréquentes

Ce sont des niveaux de quantification — le nombre de bits utilisés pour stocker chaque poids du modèle. Q4 réduit un modèle à environ un quart de sa taille complète avec une légère perte de qualité ; FP16 offre la qualité maximale à taille maximale. La plupart des utilisateurs en local choisissent Q4 ou Q8 pour économiser la mémoire.

Les Mac Apple Silicon partagent un seul pool de mémoire unifiée entre CPU et GPU : un MacBook de 32 Go peut donc accélérer sur GPU des modèles qui exigeraient une carte graphique dédiée de 24 Go sur PC.

Non — les modèles hébergés de pointe restent nettement plus performants. Mais un modèle local de 7B à 13B gère bien le résumé, la rédaction et l'aide au code, ne coûte rien par token, fonctionne hors ligne et garde vos données sensibles sur votre machine.

Ce sont des chiffres indicatifs pour des moteurs de type llama.cpp, surcharge d'exécution typique incluse. Les contextes longs, les gros batchs et chaque moteur spécifique font varier la consommation réelle — considérez un verdict vert limite comme un « peut-être ».

Outils associés

Planificateur de coûts IACompteur de tokensOutils réseau