What fits in a RTX 5070 Ti's 16 GB?
Blackwell. 16 GB VRAM, verified from the vendor datasheet. No current live pricing to show.
16 GB
VRAM
Blackwell
Architecture
–
From
0
Providers
Models that fit at FP16 (16 GB)
- Qwen/Qwen3-0.6B (752M)
- openai-community/gpt2 (137M)
- Qwen/Qwen2.5-1.5B-Instruct (1.5B)
- Qwen/Qwen2.5-3B-Instruct (3.1B)
- Qwen/Qwen3.5-4B (4.7B)
- openai/whisper-large-v3-turbo (809M)
- Qwen/Qwen3-Embedding-0.6B (596M)
- meta-llama/Llama-3.2-1B-Instruct (1.2B)
- Qwen/Qwen3-4B (4.0B)
- Qwen/Qwen2.5-0.5B-Instruct (494M)
- openai/whisper-large-v3 (1.5B)
- Qwen/Qwen3-ASR-1.7B (2.3B)
- Qwen/Qwen3-VL-4B-Instruct (4.4B)
- Qwen/Qwen2.5-VL-3B-Instruct (3.8B)
- Qwen/Qwen3-1.7B (2.0B)
- EleutherAI/pythia-160m (213M)
- Qwen/Qwen3-4B-Instruct-2507 (4.0B)
- google/gemma-4-E2B-it (5.1B)
- Qwen/Qwen3-Embedding-4B (4.0B)
- google/gemma-3-1b-it (1000M)
- baidu/Unlimited-OCR (3.3B)
- RadixArk/Kimi-K3-DSpark (2.2B)
- openai/whisper-small (242M)
- datalab-to/chandra-ocr-2 (5.3B)
- Qwen/Qwen3-VL-2B-Instruct (2.1B)
- Qwen/Qwen3.5-2B (2.3B)
- microsoft/Florence-2-base (232M)
- HuggingFaceTB/SmolLM2-135M (135M)
- MahmoudAshraf/mms-300m-1130-forced-aligner (315M)
- deepseek-ai/DeepSeek-OCR (3.3B)
- Qwen/Qwen3.5-0.8B (873M)
- Qwen/Qwen3-Reranker-4B (4.0B)
- mistralai/Voxtral-Mini-4B-Realtime-2602 (4.4B)
- llava-hf/llava-1.5-7b-hf (7.1B)
- zai-org/GLM-OCR (1.3B)
- Qwen/Qwen3-VL-Reranker-2B (2.1B)
- mlx-community/parakeet-tdt-0.6b-v2 (618M)
- prism-ml/Bonsai-27B-mlx-1bit (1.7B)
- Qwen/Qwen3-1.7B-Base (1.7B)
- Qwen/Qwen3-4B-Base (4.0B)
Models that fit at INT4 (quantized, 16 GB)
- Qwen/Qwen3-0.6B (752M)
- openai-community/gpt2 (137M)
- Qwen/Qwen3-8B (8.2B)
- Qwen/Qwen3.5-9B (9.7B)
- Qwen/Qwen2.5-7B-Instruct (7.6B)
- Qwen/Qwen3-VL-8B-Instruct (8.8B)
- google/gemma-4-26B-A4B-it (25.8B)
- Qwen/Qwen3.6-27B-FP8 (27.8B)
- Qwen/Qwen2.5-VL-7B-Instruct (8.3B)
- Qwen/Qwen2.5-1.5B-Instruct (1.5B)
- Qwen/Qwen2.5-3B-Instruct (3.1B)
- Qwen/Qwen3.5-4B (4.7B)
- openai/whisper-large-v3-turbo (809M)
- Qwen/Qwen3-Embedding-0.6B (596M)
- meta-llama/Llama-3.2-1B-Instruct (1.2B)
- Qwen/Qwen3-4B (4.0B)
- Qwen/Qwen2.5-0.5B-Instruct (494M)
- meta-llama/Llama-3.1-8B-Instruct (8.0B)
- Qwen/Qwen3.6-27B (27.8B)
- Qwen/Qwen3.8-27B-FP8 (27.8B)
- openai/whisper-large-v3 (1.5B)
- Qwen/Qwen3.8-27B (27.8B)
- google/gemma-4-E4B-it (8.0B)
- Qwen/Qwen3-ASR-1.7B (2.3B)
- Qwen/Qwen3-VL-4B-Instruct (4.4B)
- Qwen/Qwen2.5-VL-3B-Instruct (3.8B)
- Qwen/Qwen3-1.7B (2.0B)
- EleutherAI/pythia-160m (213M)
- Qwen/Qwen3-4B-Instruct-2507 (4.0B)
- google/gemma-4-E2B-it (5.1B)
- google/gemma-4-12B-it (12.0B)
- Qwen/Qwen3-Embedding-4B (4.0B)
- unsloth/Qwen3.6-27B-NVFP4 (21.2B)
- google/gemma-3-1b-it (1000M)
- baidu/Unlimited-OCR (3.3B)
- RadixArk/Kimi-K3-DSpark (2.2B)
- openai/whisper-small (242M)
- datalab-to/chandra-ocr-2 (5.3B)
- Qwen/Qwen3-VL-2B-Instruct (2.1B)
- Qwen/Qwen3.5-2B (2.3B)
Caveat: Requires a quantized checkpoint actually published for the model, check its Hugging Face page before relying on this.
Live offers
No current live offer for this GPU, either there is no inventory listed right now, or the marketplace feed was briefly unreachable. This refreshes hourly; no price is shown rather than a stale or estimated one.