What fits in a T4's 16 GB?
Turing. 16 GB VRAM, verified from the vendor datasheet. No current live pricing to show.
16 GB
VRAM
Turing
Architecture
–
From
0
Providers
Models that fit at FP16 (16 GB)
- google-bert/bert-base-uncased (110M)
- Qwen/Qwen3-0.6B (752M)
- openai-community/gpt2 (137M)
- Qwen/Qwen2.5-1.5B-Instruct (1.5B)
- Qwen/Qwen2.5-3B-Instruct (3.1B)
- Qwen/Qwen3.5-4B (4.7B)
- openai/whisper-large-v3-turbo (809M)
- Qwen/Qwen3-Embedding-0.6B (596M)
- meta-llama/Llama-3.2-1B-Instruct (1.2B)
- Qwen/Qwen3-4B (4.0B)
- Qwen/Qwen2.5-0.5B-Instruct (494M)
- openai/whisper-large-v3 (1.5B)
- Qwen/Qwen3-ASR-1.7B (2.3B)
- Qwen/Qwen3-VL-4B-Instruct (4.4B)
- Qwen/Qwen2.5-VL-3B-Instruct (3.8B)
- Qwen/Qwen3-1.7B (2.0B)
- EleutherAI/pythia-160m (213M)
- Qwen/Qwen3-4B-Instruct-2507 (4.0B)
- google/gemma-4-E2B-it (5.1B)
- Qwen/Qwen3-Embedding-4B (4.0B)
- google/gemma-3-1b-it (1000M)
- baidu/Unlimited-OCR (3.3B)
- RadixArk/Kimi-K3-DSpark (2.2B)
- openai/whisper-small (242M)
- datalab-to/chandra-ocr-2 (5.3B)
- Qwen/Qwen3-VL-2B-Instruct (2.1B)
- Qwen/Qwen3.5-2B (2.3B)
- microsoft/Florence-2-base (232M)
- HuggingFaceTB/SmolLM2-135M (135M)
- MahmoudAshraf/mms-300m-1130-forced-aligner (315M)
- deepseek-ai/DeepSeek-OCR (3.3B)
- Qwen/Qwen3.5-0.8B (873M)
- Qwen/Qwen3-Reranker-4B (4.0B)
- facebook/sam3 (860M)
- mistralai/Voxtral-Mini-4B-Realtime-2602 (4.4B)
- llava-hf/llava-1.5-7b-hf (7.1B)
- zai-org/GLM-OCR (1.3B)
- Qwen/Qwen3-VL-Reranker-2B (2.1B)
- mlx-community/parakeet-tdt-0.6b-v2 (618M)
- prism-ml/Bonsai-27B-mlx-1bit (1.7B)
Models that fit at INT4 (quantized, 16 GB)
- google-bert/bert-base-uncased (110M)
- Qwen/Qwen3-0.6B (752M)
- openai-community/gpt2 (137M)
- Qwen/Qwen3-8B (8.2B)
- Qwen/Qwen3.5-9B (9.7B)
- Qwen/Qwen2.5-7B-Instruct (7.6B)
- Qwen/Qwen3-VL-8B-Instruct (8.8B)
- google/gemma-4-26B-A4B-it (25.8B)
- Qwen/Qwen3.6-27B-FP8 (27.8B)
- Qwen/Qwen2.5-VL-7B-Instruct (8.3B)
- Qwen/Qwen2.5-1.5B-Instruct (1.5B)
- Qwen/Qwen2.5-3B-Instruct (3.1B)
- Qwen/Qwen3.5-4B (4.7B)
- openai/whisper-large-v3-turbo (809M)
- Qwen/Qwen3-Embedding-0.6B (596M)
- meta-llama/Llama-3.2-1B-Instruct (1.2B)
- Qwen/Qwen3-4B (4.0B)
- Qwen/Qwen2.5-0.5B-Instruct (494M)
- meta-llama/Llama-3.1-8B-Instruct (8.0B)
- Qwen/Qwen3.6-27B (27.8B)
- Qwen/Qwen3.8-27B-FP8 (27.8B)
- openai/whisper-large-v3 (1.5B)
- Qwen/Qwen3.8-27B (27.8B)
- google/gemma-4-E4B-it (8.0B)
- Qwen/Qwen3-ASR-1.7B (2.3B)
- Qwen/Qwen3-VL-4B-Instruct (4.4B)
- Qwen/Qwen2.5-VL-3B-Instruct (3.8B)
- Qwen/Qwen3-1.7B (2.0B)
- EleutherAI/pythia-160m (213M)
- Qwen/Qwen3-4B-Instruct-2507 (4.0B)
- google/gemma-4-E2B-it (5.1B)
- google/gemma-4-12B-it (12.0B)
- Qwen/Qwen3-Embedding-4B (4.0B)
- unsloth/Qwen3.6-27B-NVFP4 (21.2B)
- google/gemma-3-1b-it (1000M)
- baidu/Unlimited-OCR (3.3B)
- RadixArk/Kimi-K3-DSpark (2.2B)
- openai/whisper-small (242M)
- datalab-to/chandra-ocr-2 (5.3B)
- Qwen/Qwen3-VL-2B-Instruct (2.1B)
Caveat: Requires a quantized checkpoint actually published for the model, check its Hugging Face page before relying on this.
Live pricing
No current live offer for this GPU, either there is no inventory listed right now, or the marketplace feed was briefly unreachable. This refreshes hourly; no price is shown rather than a stale or estimated one.