RAM과 GPU 사양을 입력하면 내 컴퓨터에서 실제로 돌릴 수 있는 로컬 모델을 알려줍니다 — 3B부터 70B까지, Q4부터 FP16까지.
Apple Silicon은 GPU가 시스템 메모리를 공유하므로 VRAM 항목이 적용되지 않습니다. PC에서는 사용 중인 GPU 모델의 VRAM을 확인하세요(예: RTX 4060 = 8GB, RTX 4090 = 24GB).
llama.cpp 방식의 로컬 추론을 기준으로 런타임 오버헤드를 포함한 추정치입니다. 실제 사용량은 컨텍스트 길이와 런타임에 따라 달라집니다. Q4/Q8/FP16은 양자화 수준으로, 숫자가 작을수록 모델이 작아지는 대신 정확도가 약간 떨어집니다.
3B부터 70B 파라미터까지, 내 하드웨어로 실행할 수 있는 로컬 모델을 확인해 보세요.