RAM と GPU を入力するだけで、お使いのマシンで実際に動かせるローカルモデルがわかります。3B〜70B、Q4〜FP16 に対応しています。
Apple Silicon では GPU がシステムメモリを共有するため、VRAM の入力は不要です。PC の場合は GPU モデルの VRAM を確認してください(例:RTX 4060 = 8 GB、RTX 4090 = 24 GB)。
llama.cpp 系のローカル推論を想定した目安値で、ランタイムのオーバーヘッドを含みます。実際の使用量はコンテキスト長やランタイムによって変わります。Q4/Q8/FP16 は量子化レベルを表し、数値が小さいほどモデルは小さくなり、精度はわずかに低下します。
3Bから70Bパラメータまで、お使いのハードウェアで動かせるローカルモデルを確認しましょう。