What fits in a RTX PRO 6000's 96 GB?
Blackwell. 96 GB VRAM, verified from the vendor datasheet. Cheapest live rate from $0.590/hr across 4 providers.
96 GB
VRAM
Blackwell
Architecture
$0.590/hr
From
4
Providers
Models that fit at FP16 (96 GB)
- Qwen/Qwen3-0.6B (752M)
- openai-community/gpt2 (137M)
- Qwen/Qwen3-8B (8.2B)
- Qwen/Qwen3.6-35B-A3B-FP8 (36.0B)
- Qwen/Qwen3.5-9B (9.7B)
- Qwen/Qwen2.5-7B-Instruct (7.6B)
- Qwen/Qwen3-VL-8B-Instruct (8.8B)
- google/gemma-4-31B-it (31.3B)
- google/gemma-4-26B-A4B-it (25.8B)
- Qwen/Qwen3.6-27B-FP8 (27.8B)
- Qwen/Qwen2.5-VL-7B-Instruct (8.3B)
- Qwen/Qwen2.5-1.5B-Instruct (1.5B)
- Qwen/Qwen2.5-3B-Instruct (3.1B)
- Qwen/Qwen3.5-4B (4.7B)
- openai/whisper-large-v3-turbo (809M)
- Qwen/Qwen3-Embedding-0.6B (596M)
- farbodtavakkoli/OTel-2.0-LLM-31B-IT (32.1B)
- meta-llama/Llama-3.2-1B-Instruct (1.2B)
- Qwen/Qwen3-4B (4.0B)
- Qwen/Qwen2.5-0.5B-Instruct (494M)
- meta-llama/Llama-3.1-8B-Instruct (8.0B)
- Qwen/Qwen3.6-27B (27.8B)
- MiniMaxAI/MiniMax-H3 (33.1B)
- Qwen/Qwen3.8-27B-FP8 (27.8B)
- openai/whisper-large-v3 (1.5B)
- Qwen/Qwen3.8-27B (27.8B)
- google/gemma-4-E4B-it (8.0B)
- Qwen/Qwen3.6-35B-A3B (36.0B)
- Qwen/Qwen3-32B (32.8B)
- dphn/dolphin-2.9.1-yi-1.5-34b (34.4B)
- Qwen/Qwen3-ASR-1.7B (2.3B)
- Qwen/Qwen3-VL-4B-Instruct (4.4B)
- Qwen/Qwen2.5-VL-3B-Instruct (3.8B)
- Qwen/Qwen3-1.7B (2.0B)
- EleutherAI/pythia-160m (213M)
- Qwen/Qwen3-4B-Instruct-2507 (4.0B)
- google/gemma-4-E2B-it (5.1B)
- google/gemma-4-12B-it (12.0B)
- Qwen/Qwen3-Embedding-4B (4.0B)
- unsloth/Qwen3.6-27B-NVFP4 (21.2B)
Models that fit at INT4 (quantized, 96 GB)
- Qwen/Qwen3-0.6B (752M)
- openai-community/gpt2 (137M)
- Qwen/Qwen3-8B (8.2B)
- Qwen/Qwen3.6-35B-A3B-FP8 (36.0B)
- Qwen/Qwen3.5-9B (9.7B)
- Qwen/Qwen2.5-7B-Instruct (7.6B)
- Qwen/Qwen3-VL-8B-Instruct (8.8B)
- google/gemma-4-31B-it (31.3B)
- google/gemma-4-26B-A4B-it (25.8B)
- Qwen/Qwen3.6-27B-FP8 (27.8B)
- Qwen/Qwen2.5-VL-7B-Instruct (8.3B)
- Qwen/Qwen2.5-1.5B-Instruct (1.5B)
- Qwen/Qwen2.5-3B-Instruct (3.1B)
- Qwen/Qwen3.5-4B (4.7B)
- openai/whisper-large-v3-turbo (809M)
- Qwen/Qwen3-Embedding-0.6B (596M)
- farbodtavakkoli/OTel-2.0-LLM-31B-IT (32.1B)
- meta-llama/Llama-3.2-1B-Instruct (1.2B)
- Qwen/Qwen3-4B (4.0B)
- Qwen/Qwen2.5-0.5B-Instruct (494M)
- meta-llama/Llama-3.1-8B-Instruct (8.0B)
- Qwen/Qwen3.6-27B (27.8B)
- MiniMaxAI/MiniMax-H3 (33.1B)
- Qwen/Qwen3.8-27B-FP8 (27.8B)
- openai/whisper-large-v3 (1.5B)
- Qwen/Qwen3.8-27B (27.8B)
- google/gemma-4-E4B-it (8.0B)
- Qwen/Qwen3.6-35B-A3B (36.0B)
- Qwen/Qwen3-32B (32.8B)
- dphn/dolphin-2.9.1-yi-1.5-34b (34.4B)
- Qwen/Qwen3-ASR-1.7B (2.3B)
- Qwen/Qwen3-VL-4B-Instruct (4.4B)
- Qwen/Qwen2.5-VL-3B-Instruct (3.8B)
- Qwen/Qwen3-1.7B (2.0B)
- EleutherAI/pythia-160m (213M)
- Qwen/Qwen3-4B-Instruct-2507 (4.0B)
- google/gemma-4-E2B-it (5.1B)
- google/gemma-4-12B-it (12.0B)
- Qwen/Qwen-72B (72.3B)
- Qwen/Qwen3-Embedding-4B (4.0B)
Caveat: Requires a quantized checkpoint actually published for the model, check its Hugging Face page before relying on this.
Live offers
Provider
Region
$/hr
RunPod
eur-is-2
$0.590/hr
Verda
Finland 1
$1.89/hr
Massed Compute
us-east-1
$2.19/hr
Akash
ZRH
$2.36/hr