Indiquez votre RAM et votre GPU et découvrez quels modèles locaux votre machine peut réellement faire tourner — de 3B à 70B, de Q4 à FP16.
Sur Apple Silicon, le GPU partage la mémoire système : la VRAM ne s'applique donc pas. Sur PC, vérifiez la VRAM de votre carte graphique (ex. RTX 4060 = 8 Go, RTX 4090 = 24 Go).
Estimations indicatives pour l'inférence locale de type llama.cpp, surcharge d'exécution incluse. La consommation réelle varie selon la longueur de contexte et le moteur utilisé. Q4/Q8/FP16 = niveaux de quantification : plus le chiffre est petit, plus le modèle est compact, avec une légère perte de précision.
Découvrez quels modèles locaux votre matériel peut exécuter, de 3B à 70B paramètres.