What GPU do I need to run it?
VRAM requirements and the cheapest live GPU fit for 228 Hugging Face models, at native, FP8 and INT4 precision. Pick a model below, or jump straight to an owner.
How the VRAM and cost numbers are calculated
- Weight bytes = parameter count × bytes-per-parameter for the shown precision (FP32=4, BF16/FP16=2, FP8=1, INT4=0.5 bytes).
- Required VRAM adds a flat 1.2× overhead on top of weight size for KV-cache, activations, and allocator fragmentation, calibrated for an assumed 8,192-token context — a rule-of-thumb, not a per-request simulation. Long contexts or large batch sizes need materially more headroom.
- “Cheapest live fit” only matches a GPU to a row if its hardware actually supports that row's compute format — a pre-Ampere card (Pascal/Volta/Turing) never qualifies for a BF16 or FP8 row, regardless of VRAM or price — and caps a fit at 8 GPUs of the same model. See the GPU Index for per-model specs.
- The INT4 row additionally requires a GPU with AWQ/GPTQ/ Marlin-class quantized-serving kernel support AND a quantized checkpoint that's actually been published for the model in question — neither is guaranteed, so check the model's Hugging Face page for a published INT4/AWQ/GPTQ variant before relying on that row.
- Prices are live per-GPU $/hr rates from Aquanode's marketplace feed, normalized the same way as the GPU Index, with outlier offers excluded.
- Multi-GPU fits assume the model shards cleanly across cards (e.g. tensor parallelism) — real throughput and interconnect overhead aren't modeled.
Qwen59 models
Qwen3-0.6B
752M params · BF16
Qwen3-8B
8.2B params · BF16
Qwen2.5-1.5B-Instruct
1.5B params · BF16
Qwen2.5-7B-Instruct
7.6B params · BF16
Qwen3-Embedding-0.6B
596M params · BF16
Qwen3-32B
32.8B params · BF16
Qwen3-1.7B
2.0B params · BF16
Qwen2.5-3B-Instruct
3.1B params · BF16
Qwen2.5-0.5B-Instruct
494M params · BF16
Qwen3-4B
4.0B params · BF16
Qwen3-Embedding-8B
7.6B params · BF16
Qwen2.5-14B-Instruct
14.8B params · BF16
Qwen3-4B-Instruct-2507
4.0B params · BF16
Qwen2-1.5B-Instruct
1.5B params · BF16
Qwen3-30B-A3B
30.5B params · BF16
Qwen3-Embedding-4B
4.0B params · BF16
Qwen2.5-Coder-14B-Instruct
14.8B params · BF16
Qwen3-14B
14.8B params · BF16
Qwen3-Reranker-0.6B
596M params · BF16
Qwen3-Reranker-4B
4.0B params · BF16
Qwen2.5-0.5B
494M params · BF16
Qwen3-Coder-Next-FP8
79.7B params · F8_E4M3
Qwen2.5-Coder-7B-Instruct
7.6B params · BF16
Qwen3-30B-A3B-Instruct-2507
30.5B params · BF16
Qwen2.5-32B-Instruct
32.8B params · BF16
Qwen-72B
72.3B params · BF16
Qwen3-0.6B-FP8
752M params · F8_E4M3
Qwen3-Coder-30B-A3B-Instruct
30.5B params · BF16
Qwen3-Coder-30B-A3B-Instruct-FP8
30.5B params · F8_E4M3
Qwen2.5-Coder-32B-Instruct
32.8B params · BF16
Qwen2-0.5B
494M params · BF16
Qwen3-4B-Instruct-2507-FP8
4.4B params · F8_E4M3
Qwen2.5-Coder-7B
7.6B params · BF16
Qwen2.5-7B
7.6B params · BF16
Qwen3-8B-FP8
8.2B params · F8_E4M3
Qwen3-1.7B-Base
1.7B params · BF16
Qwen2.5-1.5B
1.5B params · BF16
Qwen3-0.6B-Base
596M params · BF16
Qwen3-235B-A22B
235.1B params · BF16
Qwen3-4B-Base
4.0B params · BF16
Qwen2.5-Coder-1.5B-Instruct
1.5B params · BF16
Qwen3-Coder-Next
79.7B params · BF16
Qwen2-7B-Instruct
7.6B params · BF16
Qwen3-Reranker-8B
8.2B params · BF16
Qwen3-30B-A3B-Instruct-2507-FP8
30.5B params · F8_E4M3
Qwen2.5-72B-Instruct
72.7B params · BF16
Qwen3-14B-FP8
14.8B params · F8_E4M3
Qwen3-8B-Base
8.2B params · BF16
QwQ-32B
32.8B params · BF16
Qwen3-Next-80B-A3B-Instruct-FP8
81.3B params · F8_E4M3
Qwen3-4B-Thinking-2507
4.0B params · BF16
Qwen2-0.5B-Instruct
494M params · BF16
Qwen3-Coder-480B-A35B-Instruct-FP8
480.2B params · F8_E4M3
Qwen2.5-3B
3.1B params · BF16
Qwen3Guard-Gen-4B
4.4B params · BF16
Qwen3-Next-80B-A3B-Instruct
81.3B params · BF16
Qwen2.5-Coder-1.5B
1.5B params · BF16
Qwen3-4B-Thinking-2507-FP8
4.4B params · F8_E4M3
Qwen1.5-MoE-A2.7B
14.3B params · BF16
meta-llama14 models
Llama-3.2-1B-Instruct
1.2B params · BF16
Llama-3.1-8B-Instruct
8.0B params · BF16
Meta-Llama-3-8B
8.0B params · BF16
Meta-Llama-3-8B-Instruct
8.0B params · BF16
Llama-3.2-1B
1.2B params · BF16
Llama-3.2-3B-Instruct
3.2B params · BF16
Llama-3.1-8B
8.0B params · BF16
Llama-3.1-70B-Instruct
70.6B params · BF16
Llama-2-7b-hf
6.7B params · F16
Llama-2-7b-chat-hf
6.7B params · F16
Llama-3.2-3B
3.2B params · BF16
Llama-3.3-70B-Instruct
70.6B params · BF16
Llama-3.1-405B-FP8
405.9B params · F8_E4M3
Llama-2-13b-chat-hf
13.0B params · F16
deepseek-ai19 models
DeepSeek-R1
684.5B params · F8_E4M3
DeepSeek-R1-0528-Qwen3-8B
8.2B params · BF16
DeepSeek-V2-Lite-Chat
15.7B params · BF16
DeepSeek-V3.2
685.4B params · F8_E4M3
DeepSeek-V3
684.5B params · F8_E4M3
DeepSeek-V3-0324
684.5B params · F8_E4M3
DeepSeek-R1-Distill-Qwen-32B
32.8B params · BF16
DeepSeek-R1-Distill-Llama-70B
70.6B params · BF16
DeepSeek-R1-Distill-Qwen-14B
14.8B params · BF16
DeepSeek-R1-Distill-Qwen-1.5B
1.8B params · BF16
DeepSeek-Coder-V2-Lite-Instruct
15.7B params · BF16
deepseek-coder-7b-instruct-v1.5
6.9B params · BF16
DeepSeek-V2-Lite
15.7B params · BF16
deepseek-coder-6.7b-instruct
6.7B params · BF16
DeepSeek-R1-Distill-Llama-8B
8.0B params · BF16
DeepSeek-R1-Distill-Qwen-7B
7.6B params · BF16
DeepSeek-V3.1
684.5B params · F8_E4M3
DeepSeek-V3.2-Exp
685.4B params · F8_E4M3
DeepSeek-R1-0528
684.5B params · F8_E4M3
openai-community3 models
google9 models
gemma-3-1b-it
1000M params · BF16
gemma-3-270m
268M params · BF16
gemma-4-31B-it-assistant
470M params · BF16
gemma-2-2b-it
2.6B params · BF16
gemma-3-270m-it
268M params · BF16
gemma-2-9b-it
9.2B params · BF16
gemma-4-26B-A4B-it-assistant
420M params · BF16
gemma-2-2b
2.6B params · F32
gemma-1.1-2b-it
2.5B params · BF16
zai-org6 models
nvidia12 models
Gemma-4-31B-IT-NVFP4
20.9B params · BF16
NVIDIA-Nemotron-3-Nano-30B-A3B-BF16
31.6B params · BF16
NVIDIA-Nemotron-3-Super-120B-A12B-BF16
123.6B params · BF16
NVIDIA-Nemotron-3-Nano-4B-BF16
4.0B params · BF16
NVIDIA-Nemotron-3-Nano-30B-A3B-FP8
31.6B params · F8_E4M3
Nemotron-Labs-Diffusion-8B-Base
8.5B params · BF16
NVIDIA-Nemotron-Nano-12B-v2
12.3B params · BF16
NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16
560.5B params · BF16
NVIDIA-Nemotron-Nano-9B-v2
8.9B params · BF16
Llama-3_3-Nemotron-Super-49B-v1_5-FP8
49.9B params · F8_E4M3
NVIDIA-Nemotron-3-Super-120B-A12B-FP8
123.6B params · F8_E4M3
Nemotron-Labs-Diffusion-8B
8.5B params · BF16
microsoft9 models
Phi-3.5-vision-instruct
4.1B params · BF16
Phi-3.5-mini-instruct
3.8B params · BF16
phi-2
2.8B params · F16
phi-4
14.7B params · BF16
Phi-3-mini-4k-instruct
3.8B params · BF16
Phi-4-multimodal-instruct
5.6B params · BF16
Phi-4-mini-instruct
3.8B params · BF16
Phi-3-mini-128k-instruct
3.8B params · BF16
Phi-3-vision-128k-instruct
4.1B params · BF16
HuggingFaceTB5 models
ibm-granite4 models
dphn2 models
EleutherAI4 models
RedHatAI6 models
Llama-3.2-1B-Instruct-FP8-dynamic
1.5B params · F8_E4M3
Llama-3.2-1B-Instruct-FP8
1.5B params · F8_E4M3
Qwen3-Coder-Next-FP8-dynamic
79.8B params · F8_E4M3
Meta-Llama-3.1-8B-Instruct-FP8
8.0B params · F8_E4M3
Meta-Llama-3.1-8B-FP8
8.0B params · F8_E4M3
DeepSeek-Coder-V2-Lite-Instruct-FP8
15.7B params · F8_E4M3