| Qwen3-4B-DFlash-b16 | 537M | BF16 | 1.2 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-Embedding-0.6B | 596M | BF16 | 1.3 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-Reranker-0.6B | 596M | BF16 | 1.3 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-0.6B-Base | 596M | BF16 | 1.3 GB | RTX 5060 Ti | $0.110/hr |
| OmniVoice | 613M | F32 | 2.7 GB | V100 | $0.088/hr |
| Qwen3-0.6B | 752M | BF16 | 1.7 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-0.6B | 752M | BF16 | 1.7 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3Guard-Gen-0.6B | 752M | BF16 | 1.7 GB | RTX 5060 Ti | $0.110/hr |
| s1-mini | 752M | BF16 | 1.7 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-0.6B-FP8 | 752M | F8_E4M3 | 0.8 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-ASR-0.6B-hf | 782M | BF16 | 1.7 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-ForcedAligner-0.6B | 918M | BF16 | 2.1 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-ASR-0.6B | 938M | BF16 | 2.1 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-8B-speculator.eagle3 | 1.0B | BF16 | 2.3 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-VL-4B-Instruct-MLX-4bit | 1.0B | BF16 | 2.3 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-8B-DFlash-b16 | 1.0B | BF16 | 2.3 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-32B-speculator.eagle3 | 1.6B | BF16 | 3.5 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-1.6B-A0.9B | 1.6B | BF16 | 3.5 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-1.7B-MLX-bf16 | 1.7B | BF16 | 3.8 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-1.7B-Base | 1.7B | BF16 | 3.8 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-1.7B | 2.0B | BF16 | 4.5 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-1.7B-FP8 | 2.0B | F8_E4M3 | 2.3 GB | RTX 5060 Ti | $0.110/hr |
| Confucius4-R2T2 | 2.0B | BF16 | 4.6 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-ASR-1.7B-hf | 2.0B | BF16 | 4.6 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-VL-2B-Instruct | 2.1B | BF16 | 4.8 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-VL-Embedding-2B | 2.1B | BF16 | 4.8 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-VL-Reranker-2B | 2.1B | BF16 | 4.8 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-ASR-1.7B | 2.3B | BF16 | 5.3 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-VL-2B-Instruct-FP8 | 2.4B | F8_E4M3 | 2.7 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-Embedding-4B | 4.0B | BF16 | 9.0 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-Embedding-4B | 4.0B | BF16 | 9.0 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-Reranker-4B | 4.0B | BF16 | 9.0 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-4B | 4.0B | BF16 | 9.0 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-4B-Base | 4.0B | BF16 | 9.0 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-4B-Instruct-2507 | 4.0B | BF16 | 9.0 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-4B-Thinking-2507 | 4.0B | BF16 | 9.0 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-4B-Instruct-2507 | 4.0B | BF16 | 9.0 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3Guard-Gen-4B | 4.4B | BF16 | 9.9 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-4B-FP8 | 4.4B | F8_E4M3 | 4.9 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-4B-Instruct-2507-FP8 | 4.4B | F8_E4M3 | 4.9 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-4B-Thinking-2507-FP8 | 4.4B | F8_E4M3 | 4.9 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-VL-4B-Instruct | 4.4B | BF16 | 9.9 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-VL-4B-Instruct-FP8 | 4.8B | F8_E4M3 | 5.4 GB | RTX 5060 Ti | $0.110/hr |
| LightNav-0 | 4.8B | BF16 | 10.8 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-Embedding-8B | 7.6B | BF16 | 16.9 GB | RTX A5000 | $0.176/hr |
| avibe | 7.9B | BF16 | 17.7 GB | RTX A5000 | $0.176/hr |
| Qwen3-VL-Embedding-8B | 8.1B | BF16 | 18.2 GB | RTX A5000 | $0.176/hr |
| Qwen3-Reranker-8B | 8.2B | BF16 | 18.3 GB | RTX A5000 | $0.176/hr |
| T-lite-it-2.1 | 8.2B | BF16 | 18.3 GB | RTX A5000 | $0.176/hr |
| Goedel-Prover-V2-8B | 8.2B | BF16 | 18.3 GB | RTX A5000 | $0.176/hr |
| Qwen3-8B-FP8 | 8.2B | F8_E4M3 | 9.2 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-8B | 8.2B | BF16 | 18.3 GB | RTX A5000 | $0.176/hr |
| Qwen3-8B-Base | 8.2B | BF16 | 18.3 GB | RTX A5000 | $0.176/hr |
| Qwen3Guard-Gen-8B | 8.2B | BF16 | 18.3 GB | RTX A5000 | $0.176/hr |
| Qwen3-8B | 8.2B | BF16 | 18.3 GB | RTX A5000 | $0.176/hr |
| Qwen3-8B-FP8 | 8.2B | F8_E4M3 | 9.2 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-8B-FP8-dynamic | 8.2B | F8_E4M3 | 9.2 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-VL-8B-Instruct | 8.8B | BF16 | 19.6 GB | RTX A5000 | $0.176/hr |
| Qwen3-VL-8B-Thinking | 8.8B | BF16 | 19.6 GB | RTX A5000 | $0.176/hr |
| qwen3vl-resume-parser | 8.8B | BF16 | 19.6 GB | RTX A5000 | $0.176/hr |
| Qwen3-VL-8B-Instruct-FP8 | 8.8B | F8_E4M3 | 9.8 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-VL-Embedding-8B-FP8 | 8.8B | F8_E4M3 | 9.8 GB | RTX 5060 Ti | $0.110/hr |
| Qwen3-14B | 14.8B | BF16 | 33.0 GB | RTX A6000 | $0.363/hr |
| Qwen3-14B-Base | 14.8B | BF16 | 33.0 GB | RTX A6000 | $0.363/hr |
| ContextPilot-14B | 14.8B | BF16 | 33.0 GB | RTX A6000 | $0.363/hr |
| Qwen3-14B-FP8 | 14.8B | F8_E4M3 | 16.5 GB | RTX 4000 SFF Ada | $0.198/hr |
| lynx-instruct-30b | 30.5B | BF16 | 68.2 GB | A100 | $1.31/hr |
| Qwen3-30B-A3B-abliterated | 30.5B | F32 | 136 GB | V100 × 5 | $0.935/hr |
| Qwen3-30B-A3B | 30.5B | BF16 | 68.2 GB | A100 | $1.31/hr |
| Qwen3-30B-A3B-Base | 30.5B | BF16 | 68.2 GB | A100 | $1.31/hr |
| Qwen3-30B-A3B-Instruct-2507 | 30.5B | BF16 | 68.2 GB | A100 | $1.31/hr |
| Qwen3-30B-A3B-Thinking-2507 | 30.5B | BF16 | 68.2 GB | A100 | $1.31/hr |
| Qwen3-Coder-30B-A3B-Instruct | 30.5B | BF16 | 68.2 GB | A100 | $1.31/hr |
| Qwen3-30B-A3B-FP8 | 30.5B | F8_E4M3 | 34.1 GB | RTX 4090 | $0.441/hr |
| Qwen3-30B-A3B-Instruct-2507-FP8 | 30.5B | F8_E4M3 | 34.1 GB | RTX 4090 | $0.441/hr |
| Qwen3-30B-A3B-Thinking-2507-FP8 | 30.5B | F8_E4M3 | 34.1 GB | RTX 4090 | $0.441/hr |
| Qwen3-Coder-30B-A3B-Instruct-FP8 | 30.5B | F8_E4M3 | 34.1 GB | RTX 4090 | $0.441/hr |
| Qwen3-30B-A3B-FP8-Dynamic | 30.6B | F8_E4M3 | 34.1 GB | RTX 4090 | $0.441/hr |
| Qwen3-VL-30B-A3B-Instruct | 31.1B | BF16 | 69.4 GB | A100 | $1.31/hr |
| Qwen3-VL-30B-A3B-Instruct-FP8 | 31.1B | F8_E4M3 | 34.7 GB | RTX 4090 | $0.441/hr |
| Goedel-Prover-V2-32B | 32.8B | BF16 | 73.2 GB | A100 | $1.31/hr |
| Qwen3-32B | 32.8B | BF16 | 73.2 GB | A100 | $1.31/hr |
| Qwen3-32B-FP8 | 32.8B | F8_E4M3 | 36.6 GB | RTX 4090 | $0.441/hr |
| Qwen3-VL-32B-Instruct | 33.4B | BF16 | 74.6 GB | A100 | $1.31/hr |
| Qwen3-VL-32B-Instruct-FP8 | 33.4B | F8_E4M3 | 37.3 GB | RTX 4090 | $0.441/hr |
| Karnak-40B-v1.0 | 40.7B | BF16 | 90.9 GB | RTX PRO 6000 | $1.38/hr |
| Qwen3-Coder-Next | 79.7B | BF16 | 178 GB | RTX A5000 × 8 | $1.41/hr |
| Qwen3-Coder-Next-FP8 | 79.7B | F8_E4M3 | 89.0 GB | RTX PRO 6000 | $1.38/hr |
| Qwen3-Coder-Next-FP8 | 79.7B | F8_E4M3 | 89.0 GB | RTX PRO 6000 | $1.38/hr |
| Qwen3-Coder-Next-FP8-dynamic | 79.8B | F8_E4M3 | 89.1 GB | RTX PRO 6000 | $1.38/hr |
| Qwen3-Next-80B-A3B-Instruct | 81.3B | BF16 | 182 GB | RTX A5000 × 8 | $1.41/hr |
| Qwen3-Next-80B-A3B-Thinking | 81.3B | BF16 | 182 GB | RTX A5000 × 8 | $1.41/hr |
| Qwen3-Next-80B-A3B-Instruct-FP8 | 81.3B | F8_E4M3 | 90.9 GB | RTX PRO 6000 | $1.38/hr |
| Qwen3-235B-A22B | 235.1B | BF16 | 525 GB | RTX PRO 6000 × 6 | $8.25/hr |
| Qwen3-235B-A22B-Instruct-2507 | 235.1B | BF16 | 525 GB | RTX PRO 6000 × 6 | $8.25/hr |
| Qwen3-235B-A22B-Thinking-2507 | 235.1B | BF16 | 525 GB | RTX PRO 6000 × 6 | $8.25/hr |
| Qwen3-235B-A22B-FP8 | 235.1B | F8_E4M3 | 263 GB | RTX 4090 × 6 | $2.64/hr |
| Qwen3-235B-A22B-Instruct-2507-FP8 | 235.1B | F8_E4M3 | 263 GB | RTX 4090 × 6 | $2.64/hr |
| Qwen3-235B-A22B-Thinking-2507-FP8 | 235.1B | F8_E4M3 | 263 GB | RTX 4090 × 6 | $2.64/hr |
| Qwen3-VL-235B-A22B-Instruct | 235.7B | BF16 | 527 GB | RTX PRO 6000 × 6 | $8.25/hr |
| Qwen3-VL-235B-A22B-Instruct-FP8 | 235.7B | F8_E4M3 | 263 GB | RTX 4090 × 6 | $2.64/hr |
| Qwen3-VL-235B-A22B-Instruct-FP8-dynamic | 235.8B | F8_E4M3 | 263 GB | RTX 4090 × 6 | $2.64/hr |
| Qwen3-Coder-480B-A35B-Instruct | 480.2B | BF16 | 1073 GB | No live fit | – |
| Qwen3-Coder-480B-A35B-Instruct-FP8 | 480.2B | F8_E4M3 | 537 GB | RTX PRO 6000 × 6 | $8.25/hr |