Qwen3 models

104 Qwen3 models on Hugging Face, from 537M to 480.2B parameters. At the precision each one is published in, the smallest needs about 0.8 GB of VRAM (Qwen3-0.6B-FP8, cheapest live fit: RTX 5060 Ti) and the largest about 1073 GB (Qwen3-Coder-480B-A35B-Instruct). The cheapest way to run Qwen3-0.6B-FP8 is $0.110/hr.

Qwen3 models

ModelParametersPublished asVRAM neededLive GPU fitEst. $/hr
Qwen3-4B-DFlash-b16537MBF161.2 GBRTX 5060 Ti$0.110/hr
Qwen3-Embedding-0.6B596MBF161.3 GBRTX 5060 Ti$0.110/hr
Qwen3-Reranker-0.6B596MBF161.3 GBRTX 5060 Ti$0.110/hr
Qwen3-0.6B-Base596MBF161.3 GBRTX 5060 Ti$0.110/hr
OmniVoice613MF322.7 GBV100$0.088/hr
Qwen3-0.6B752MBF161.7 GBRTX 5060 Ti$0.110/hr
Qwen3-0.6B752MBF161.7 GBRTX 5060 Ti$0.110/hr
Qwen3Guard-Gen-0.6B752MBF161.7 GBRTX 5060 Ti$0.110/hr
s1-mini752MBF161.7 GBRTX 5060 Ti$0.110/hr
Qwen3-0.6B-FP8752MF8_E4M30.8 GBRTX 5060 Ti$0.110/hr
Qwen3-ASR-0.6B-hf782MBF161.7 GBRTX 5060 Ti$0.110/hr
Qwen3-ForcedAligner-0.6B918MBF162.1 GBRTX 5060 Ti$0.110/hr
Qwen3-ASR-0.6B938MBF162.1 GBRTX 5060 Ti$0.110/hr
Qwen3-8B-speculator.eagle31.0BBF162.3 GBRTX 5060 Ti$0.110/hr
Qwen3-VL-4B-Instruct-MLX-4bit1.0BBF162.3 GBRTX 5060 Ti$0.110/hr
Qwen3-8B-DFlash-b161.0BBF162.3 GBRTX 5060 Ti$0.110/hr
Qwen3-32B-speculator.eagle31.6BBF163.5 GBRTX 5060 Ti$0.110/hr
Qwen3-1.6B-A0.9B1.6BBF163.5 GBRTX 5060 Ti$0.110/hr
Qwen3-1.7B-MLX-bf161.7BBF163.8 GBRTX 5060 Ti$0.110/hr
Qwen3-1.7B-Base1.7BBF163.8 GBRTX 5060 Ti$0.110/hr
Qwen3-1.7B2.0BBF164.5 GBRTX 5060 Ti$0.110/hr
Qwen3-1.7B-FP82.0BF8_E4M32.3 GBRTX 5060 Ti$0.110/hr
Confucius4-R2T22.0BBF164.6 GBRTX 5060 Ti$0.110/hr
Qwen3-ASR-1.7B-hf2.0BBF164.6 GBRTX 5060 Ti$0.110/hr
Qwen3-VL-2B-Instruct2.1BBF164.8 GBRTX 5060 Ti$0.110/hr
Qwen3-VL-Embedding-2B2.1BBF164.8 GBRTX 5060 Ti$0.110/hr
Qwen3-VL-Reranker-2B2.1BBF164.8 GBRTX 5060 Ti$0.110/hr
Qwen3-ASR-1.7B2.3BBF165.3 GBRTX 5060 Ti$0.110/hr
Qwen3-VL-2B-Instruct-FP82.4BF8_E4M32.7 GBRTX 5060 Ti$0.110/hr
Qwen3-Embedding-4B4.0BBF169.0 GBRTX 5060 Ti$0.110/hr
Qwen3-Embedding-4B4.0BBF169.0 GBRTX 5060 Ti$0.110/hr
Qwen3-Reranker-4B4.0BBF169.0 GBRTX 5060 Ti$0.110/hr
Qwen3-4B4.0BBF169.0 GBRTX 5060 Ti$0.110/hr
Qwen3-4B-Base4.0BBF169.0 GBRTX 5060 Ti$0.110/hr
Qwen3-4B-Instruct-25074.0BBF169.0 GBRTX 5060 Ti$0.110/hr
Qwen3-4B-Thinking-25074.0BBF169.0 GBRTX 5060 Ti$0.110/hr
Qwen3-4B-Instruct-25074.0BBF169.0 GBRTX 5060 Ti$0.110/hr
Qwen3Guard-Gen-4B4.4BBF169.9 GBRTX 5060 Ti$0.110/hr
Qwen3-4B-FP84.4BF8_E4M34.9 GBRTX 5060 Ti$0.110/hr
Qwen3-4B-Instruct-2507-FP84.4BF8_E4M34.9 GBRTX 5060 Ti$0.110/hr
Qwen3-4B-Thinking-2507-FP84.4BF8_E4M34.9 GBRTX 5060 Ti$0.110/hr
Qwen3-VL-4B-Instruct4.4BBF169.9 GBRTX 5060 Ti$0.110/hr
Qwen3-VL-4B-Instruct-FP84.8BF8_E4M35.4 GBRTX 5060 Ti$0.110/hr
LightNav-04.8BBF1610.8 GBRTX 5060 Ti$0.110/hr
Qwen3-Embedding-8B7.6BBF1616.9 GBRTX A5000$0.176/hr
avibe7.9BBF1617.7 GBRTX A5000$0.176/hr
Qwen3-VL-Embedding-8B8.1BBF1618.2 GBRTX A5000$0.176/hr
Qwen3-Reranker-8B8.2BBF1618.3 GBRTX A5000$0.176/hr
T-lite-it-2.18.2BBF1618.3 GBRTX A5000$0.176/hr
Goedel-Prover-V2-8B8.2BBF1618.3 GBRTX A5000$0.176/hr
Qwen3-8B-FP88.2BF8_E4M39.2 GBRTX 5060 Ti$0.110/hr
Qwen3-8B8.2BBF1618.3 GBRTX A5000$0.176/hr
Qwen3-8B-Base8.2BBF1618.3 GBRTX A5000$0.176/hr
Qwen3Guard-Gen-8B8.2BBF1618.3 GBRTX A5000$0.176/hr
Qwen3-8B8.2BBF1618.3 GBRTX A5000$0.176/hr
Qwen3-8B-FP88.2BF8_E4M39.2 GBRTX 5060 Ti$0.110/hr
Qwen3-8B-FP8-dynamic8.2BF8_E4M39.2 GBRTX 5060 Ti$0.110/hr
Qwen3-VL-8B-Instruct8.8BBF1619.6 GBRTX A5000$0.176/hr
Qwen3-VL-8B-Thinking8.8BBF1619.6 GBRTX A5000$0.176/hr
qwen3vl-resume-parser8.8BBF1619.6 GBRTX A5000$0.176/hr
Qwen3-VL-8B-Instruct-FP88.8BF8_E4M39.8 GBRTX 5060 Ti$0.110/hr
Qwen3-VL-Embedding-8B-FP88.8BF8_E4M39.8 GBRTX 5060 Ti$0.110/hr
Qwen3-14B14.8BBF1633.0 GBRTX A6000$0.363/hr
Qwen3-14B-Base14.8BBF1633.0 GBRTX A6000$0.363/hr
ContextPilot-14B14.8BBF1633.0 GBRTX A6000$0.363/hr
Qwen3-14B-FP814.8BF8_E4M316.5 GBRTX 4000 SFF Ada$0.198/hr
lynx-instruct-30b30.5BBF1668.2 GBA100$1.31/hr
Qwen3-30B-A3B-abliterated30.5BF32136 GBV100 × 5$0.935/hr
Qwen3-30B-A3B30.5BBF1668.2 GBA100$1.31/hr
Qwen3-30B-A3B-Base30.5BBF1668.2 GBA100$1.31/hr
Qwen3-30B-A3B-Instruct-250730.5BBF1668.2 GBA100$1.31/hr
Qwen3-30B-A3B-Thinking-250730.5BBF1668.2 GBA100$1.31/hr
Qwen3-Coder-30B-A3B-Instruct30.5BBF1668.2 GBA100$1.31/hr
Qwen3-30B-A3B-FP830.5BF8_E4M334.1 GBRTX 4090$0.441/hr
Qwen3-30B-A3B-Instruct-2507-FP830.5BF8_E4M334.1 GBRTX 4090$0.441/hr
Qwen3-30B-A3B-Thinking-2507-FP830.5BF8_E4M334.1 GBRTX 4090$0.441/hr
Qwen3-Coder-30B-A3B-Instruct-FP830.5BF8_E4M334.1 GBRTX 4090$0.441/hr
Qwen3-30B-A3B-FP8-Dynamic30.6BF8_E4M334.1 GBRTX 4090$0.441/hr
Qwen3-VL-30B-A3B-Instruct31.1BBF1669.4 GBA100$1.31/hr
Qwen3-VL-30B-A3B-Instruct-FP831.1BF8_E4M334.7 GBRTX 4090$0.441/hr
Goedel-Prover-V2-32B32.8BBF1673.2 GBA100$1.31/hr
Qwen3-32B32.8BBF1673.2 GBA100$1.31/hr
Qwen3-32B-FP832.8BF8_E4M336.6 GBRTX 4090$0.441/hr
Qwen3-VL-32B-Instruct33.4BBF1674.6 GBA100$1.31/hr
Qwen3-VL-32B-Instruct-FP833.4BF8_E4M337.3 GBRTX 4090$0.441/hr
Karnak-40B-v1.040.7BBF1690.9 GBRTX PRO 6000$1.38/hr
Qwen3-Coder-Next79.7BBF16178 GBRTX A5000 × 8$1.41/hr
Qwen3-Coder-Next-FP879.7BF8_E4M389.0 GBRTX PRO 6000$1.38/hr
Qwen3-Coder-Next-FP879.7BF8_E4M389.0 GBRTX PRO 6000$1.38/hr
Qwen3-Coder-Next-FP8-dynamic79.8BF8_E4M389.1 GBRTX PRO 6000$1.38/hr
Qwen3-Next-80B-A3B-Instruct81.3BBF16182 GBRTX A5000 × 8$1.41/hr
Qwen3-Next-80B-A3B-Thinking81.3BBF16182 GBRTX A5000 × 8$1.41/hr
Qwen3-Next-80B-A3B-Instruct-FP881.3BF8_E4M390.9 GBRTX PRO 6000$1.38/hr
Qwen3-235B-A22B235.1BBF16525 GBRTX PRO 6000 × 6$8.25/hr
Qwen3-235B-A22B-Instruct-2507235.1BBF16525 GBRTX PRO 6000 × 6$8.25/hr
Qwen3-235B-A22B-Thinking-2507235.1BBF16525 GBRTX PRO 6000 × 6$8.25/hr
Qwen3-235B-A22B-FP8235.1BF8_E4M3263 GBRTX 4090 × 6$2.64/hr
Qwen3-235B-A22B-Instruct-2507-FP8235.1BF8_E4M3263 GBRTX 4090 × 6$2.64/hr
Qwen3-235B-A22B-Thinking-2507-FP8235.1BF8_E4M3263 GBRTX 4090 × 6$2.64/hr
Qwen3-VL-235B-A22B-Instruct235.7BBF16527 GBRTX PRO 6000 × 6$8.25/hr
Qwen3-VL-235B-A22B-Instruct-FP8235.7BF8_E4M3263 GBRTX 4090 × 6$2.64/hr
Qwen3-VL-235B-A22B-Instruct-FP8-dynamic235.8BF8_E4M3263 GBRTX 4090 × 6$2.64/hr
Qwen3-Coder-480B-A35B-Instruct480.2BBF161073 GBNo live fit–
Qwen3-Coder-480B-A35B-Instruct-FP8480.2BF8_E4M3537 GBRTX PRO 6000 × 6$8.25/hr

VRAM is for the precision the model is published in, with the same overhead and an 8,192-token context assumed on every page; see the methodology. The fit shown is the lowest-priced single GPU type that holds the model at that precision, or the lowest-priced multi-GPU set (up to 8) when none does.

More from Qwen

Submit the job. Everything after that is ours.

Sign up in 60 seconds. Pay for the GPU minutes you actually use.

© 2026 Aquanode. All rights reserved.

All trademarks, logos and brand names are the property of their respective owners.