the IT Hustle
도구실전 매뉴얼소개

로컬 AI 체커

RAM과 GPU 사양을 입력하면 내 컴퓨터에서 실제로 돌릴 수 있는 로컬 모델을 알려줍니다 — 3B부터 70B까지, Q4부터 FP16까지.

Apple Silicon은 GPU가 시스템 메모리를 공유하므로 VRAM 항목이 적용되지 않습니다. PC에서는 사용 중인 GPU 모델의 VRAM을 확인하세요(예: RTX 4060 = 8GB, RTX 4090 = 24GB).

모델 크기Q4Q8FP16
3B파라미터느림 (CPU)~3 GB느림 (CPU)~5 GB느림 (CPU)~8 GB
7B파라미터느림 (CPU)~5 GB느림 (CPU)~9 GB실행 불가~17 GB
13B파라미터느림 (CPU)~9 GB실행 불가~16 GB실행 불가~30 GB
34B파라미터실행 불가~20 GB실행 불가~39 GB실행 불가~76 GB
70B파라미터실행 불가~40 GB실행 불가~79 GB실행 불가~156 GB
결과 보는 법
  • 원활하게 실행 — GPU/통합 메모리에 올릴 수 있어 Ollama나 LM Studio 같은 런타임에서 쾌적한 속도로 실행됩니다.
  • 느림 (CPU) — 시스템 RAM에만 올릴 수 있어 CPU에서 초당 몇 토큰 수준으로 실행됩니다. 테스트용으로는 괜찮지만 일상적으로 쓰기에는 답답합니다.
  • 실행 불가 — Q4 양자화를 적용해도 이 컴퓨터의 메모리로는 부족합니다.

llama.cpp 방식의 로컬 추론을 기준으로 런타임 오버헤드를 포함한 추정치입니다. 실제 사용량은 컨텍스트 길이와 런타임에 따라 달라집니다. Q4/Q8/FP16은 양자화 수준으로, 숫자가 작을수록 모델이 작아지는 대신 정확도가 약간 떨어집니다.

내 컴퓨터에서 로컬 AI를 돌릴 수 있는지 확인하는 방법

3B부터 70B 파라미터까지, 내 하드웨어로 실행할 수 있는 로컬 모델을 확인해 보세요.

  1. 1
    RAM 입력시스템 전체 메모리를 GB 단위로 입력하세요. Windows에서는 작업 관리자 → 성능, macOS에서는 '이 Mac에 관하여'에서 확인할 수 있습니다.
  2. 2
    GPU VRAM 입력전용 GPU 메모리를 GB 단위로 입력하세요(예: RTX 4060 = 8GB, RTX 4090 = 24GB). Apple Silicon이라면 이 항목은 건너뛰고 통합 메모리 체크박스를 선택하세요.
  3. 3
    매트릭스 확인각 모델 크기(3B~70B)에 대해 양자화 수준별 판정이 표시됩니다. GPU에서 원활하게 실행, CPU에서 느리게 실행, 실행 불가 여부를 필요한 대략적인 메모리와 함께 보여줍니다.
  4. 4
    런타임 설치초록색 셀이 있다면 Ollama나 LM Studio를 설치하고 사양에 맞는 모델을 내려받으세요. API 비용 없이 로컬에서 AI를 돌릴 수 있습니다.

자주 묻는 질문

양자화 수준, 즉 모델 가중치 하나를 몇 비트로 저장하느냐를 뜻합니다. Q4는 약간의 품질 손실을 감수하는 대신 모델을 원본의 약 4분의 1 크기로 줄이고, FP16은 원본 크기 그대로의 최고 품질입니다. 로컬 사용자는 대부분 메모리 절약을 위해 Q4나 Q8을 사용합니다.

Apple Silicon Mac은 CPU와 GPU가 하나의 통합 메모리 풀을 공유합니다. 그래서 PC에서라면 24GB급 외장 그래픽카드가 필요한 모델도 32GB MacBook에서는 GPU로 가속할 수 있습니다.

아니요. 클라우드에서 서비스되는 프론티어 모델이 분명히 더 뛰어납니다. 하지만 7B~13B 로컬 모델도 요약, 초안 작성, 코딩 지원은 충분히 잘 처리하며, 토큰당 비용이 전혀 들지 않고 오프라인에서도 작동하며 민감한 데이터가 내 컴퓨터 밖으로 나가지 않습니다.

일반적인 런타임 오버헤드를 포함한 llama.cpp 방식 런타임 기준의 계획용 수치입니다. 긴 컨텍스트, 큰 배치 크기, 런타임 종류에 따라 실제 사용량이 달라지므로, 아슬아슬하게 초록색이 나온 판정은 '될 수도 있다' 정도로 받아들이시기 바랍니다.

관련 도구

AI 비용 플래너토큰 카운터네트워크 도구