What fits in a RTX 4090's 24 GB?
Ada Lovelace. 24 GB VRAM, verified from the vendor datasheet. Cheapest live rate from $0.340/hr across 3 providers.
24 GB
VRAM
Ada Lovelace
Architecture
$0.340/hr
From
3
Providers
Models that fit at FP16 (24 GB)
- Qwen/Qwen3-0.6B (752M)
- openai-community/gpt2 (137M)
- Qwen/Qwen3-8B (8.2B)
- Qwen/Qwen3.5-9B (9.7B)
- Qwen/Qwen2.5-7B-Instruct (7.6B)
- Qwen/Qwen3-VL-8B-Instruct (8.8B)
- Qwen/Qwen2.5-VL-7B-Instruct (8.3B)
- Qwen/Qwen2.5-1.5B-Instruct (1.5B)
- Qwen/Qwen2.5-3B-Instruct (3.1B)
- Qwen/Qwen3.5-4B (4.7B)
- openai/whisper-large-v3-turbo (809M)
- Qwen/Qwen3-Embedding-0.6B (596M)
- meta-llama/Llama-3.2-1B-Instruct (1.2B)
- Qwen/Qwen3-4B (4.0B)
- Qwen/Qwen2.5-0.5B-Instruct (494M)
- meta-llama/Llama-3.1-8B-Instruct (8.0B)
- openai/whisper-large-v3 (1.5B)
- google/gemma-4-E4B-it (8.0B)
- Qwen/Qwen3-ASR-1.7B (2.3B)
- Qwen/Qwen3-VL-4B-Instruct (4.4B)
- Qwen/Qwen2.5-VL-3B-Instruct (3.8B)
- Qwen/Qwen3-1.7B (2.0B)
- EleutherAI/pythia-160m (213M)
- Qwen/Qwen3-4B-Instruct-2507 (4.0B)
- google/gemma-4-E2B-it (5.1B)
- Qwen/Qwen3-Embedding-4B (4.0B)
- google/gemma-3-1b-it (1000M)
- baidu/Unlimited-OCR (3.3B)
- RadixArk/Kimi-K3-DSpark (2.2B)
- openai/whisper-small (242M)
- datalab-to/chandra-ocr-2 (5.3B)
- Qwen/Qwen3-VL-2B-Instruct (2.1B)
- Qwen/Qwen3.5-2B (2.3B)
- microsoft/Florence-2-base (232M)
- HuggingFaceTB/SmolLM2-135M (135M)
- MahmoudAshraf/mms-300m-1130-forced-aligner (315M)
- deepseek-ai/DeepSeek-OCR (3.3B)
- Qwen/Qwen3.5-0.8B (873M)
- Qwen/Qwen2.5-Coder-7B-Instruct (7.6B)
- Qwen/Qwen3-Reranker-4B (4.0B)
Models that fit at INT4 (quantized, 24 GB)
- Qwen/Qwen3-0.6B (752M)
- openai-community/gpt2 (137M)
- Qwen/Qwen3-8B (8.2B)
- Qwen/Qwen3.6-35B-A3B-FP8 (36.0B)
- Qwen/Qwen3.5-9B (9.7B)
- Qwen/Qwen2.5-7B-Instruct (7.6B)
- Qwen/Qwen3-VL-8B-Instruct (8.8B)
- google/gemma-4-31B-it (31.3B)
- google/gemma-4-26B-A4B-it (25.8B)
- Qwen/Qwen3.6-27B-FP8 (27.8B)
- Qwen/Qwen2.5-VL-7B-Instruct (8.3B)
- Qwen/Qwen2.5-1.5B-Instruct (1.5B)
- Qwen/Qwen2.5-3B-Instruct (3.1B)
- Qwen/Qwen3.5-4B (4.7B)
- openai/whisper-large-v3-turbo (809M)
- Qwen/Qwen3-Embedding-0.6B (596M)
- farbodtavakkoli/OTel-2.0-LLM-31B-IT (32.1B)
- meta-llama/Llama-3.2-1B-Instruct (1.2B)
- Qwen/Qwen3-4B (4.0B)
- Qwen/Qwen2.5-0.5B-Instruct (494M)
- meta-llama/Llama-3.1-8B-Instruct (8.0B)
- Qwen/Qwen3.6-27B (27.8B)
- MiniMaxAI/MiniMax-H3 (33.1B)
- Qwen/Qwen3.8-27B-FP8 (27.8B)
- openai/whisper-large-v3 (1.5B)
- Qwen/Qwen3.8-27B (27.8B)
- google/gemma-4-E4B-it (8.0B)
- Qwen/Qwen3.6-35B-A3B (36.0B)
- Qwen/Qwen3-32B (32.8B)
- dphn/dolphin-2.9.1-yi-1.5-34b (34.4B)
- Qwen/Qwen3-ASR-1.7B (2.3B)
- Qwen/Qwen3-VL-4B-Instruct (4.4B)
- Qwen/Qwen2.5-VL-3B-Instruct (3.8B)
- Qwen/Qwen3-1.7B (2.0B)
- EleutherAI/pythia-160m (213M)
- Qwen/Qwen3-4B-Instruct-2507 (4.0B)
- google/gemma-4-E2B-it (5.1B)
- google/gemma-4-12B-it (12.0B)
- Qwen/Qwen3-Embedding-4B (4.0B)
- unsloth/Qwen3.6-27B-NVFP4 (21.2B)
Caveat: Requires a quantized checkpoint actually published for the model, check its Hugging Face page before relying on this.
Live offers
Provider
Region
$/hr
RunPod
Unknown
$0.340/hr
SimplePod
US
$0.360/hr
Akash
IEV
$0.452/hr