whichLlmmodel
Back to Hardware Index
Dedicated GPU Setup

Best local text models for 32gb vram

If you are searching for the best text model for 32GB VRAM, this compatibility index displays all open-source Large Language Models (LLMs) that fit your system at a baseline context length of 8,192 tokens. Compare quantization formats (FP16, Q8, Q4) to prevent CUDA OOM crashes.

Supported GPU Configurations & Tiers:
NVIDIA RTX 5000 Ada (32GB)Dual NVIDIA RTX 4080 (32GB)Dual NVIDIA RTX 3080 16GB

Compatible Local LLMs (25)

DeepSeek16B params

DeepSeek V2 Lite

FP16CPU Offload
Q8_0N/A
Q4_K_MN/A
Details
Meta70B params

Llama-3.3-70B

FP16OOM
Q8_0CPU Offload
Q4_K_MCPU Offload
Details
Meta30B params

Muse Glimmer 30B

FP16CPU Offload
Q8_0CPU Offload
Q4_K_MFits in VRAM
Details
Meta8B params

Llama-3.1 8B (Instruct)

FP16Fits in VRAM
Q8_0Fits in VRAM
Q4_K_MFits in VRAM
Details
Meta70B params

Llama-3.1 70B

FP16OOM
Q8_0CPU Offload
Q4_K_MCPU Offload
Details
Alibaba Cloud (Qwen)27B params

Qwen3.6-27B

FP16CPU Offload
Q8_0CPU Offload
Q4_K_MFits in VRAM
Details
Alibaba Cloud (Qwen)27B params

Qwen3.8-27B

FP16CPU Offload
Q8_0CPU Offload
Q4_K_MFits in VRAM
Details
Alibaba Cloud (Qwen)35B params

Qwen3.6-35B-A3B

FP16CPU Offload
Q8_0CPU Offload
Q4_K_MFits in VRAM
Details
Alibaba Cloud (Qwen)32B params

Qwen2.5-Coder 32B

FP16CPU Offload
Q8_0CPU Offload
Q4_K_MFits in VRAM
Details
Mistral AI7B params

Mistral 7B v0.3

FP16Fits in VRAM
Q8_0Fits in VRAM
Q4_K_MFits in VRAM
Details
Mistral AI46.7B params

Mixtral 8x7B v0.1

FP16OOM
Q8_0CPU Offload
Q4_K_MFits in VRAM
Details
Mistral AI22B params

Codestral 22B

FP16CPU Offload
Q8_0Fits in VRAM
Q4_K_MFits in VRAM
Details
Mistral AI3B params

Ministral 3 3B (Instruct)

FP16Fits in VRAM
Q8_0Fits in VRAM
Q4_K_MFits in VRAM
Details
Mistral AI8B params

Ministral 3 8B

FP16Fits in VRAM
Q8_0Fits in VRAM
Q4_K_MFits in VRAM
Details
Mistral AI14B params

Ministral 3 14B

FP16Fits in VRAM
Q8_0Fits in VRAM
Q4_K_MFits in VRAM
Details
Mistral AI119B params

Mistral Small 4

FP16OOM
Q8_0OOM
Q4_K_MCPU Offload
Details
Mistral AI128B params

Mistral Medium 3.5

FP16OOM
Q8_0OOM
Q4_K_MCPU Offload
Details
Google2.3B params

Gemma 4 E2B

FP16Fits in VRAM
Q8_0Fits in VRAM
Q4_K_MFits in VRAM
Details
Google4.5B params

Gemma 4 E4B

FP16Fits in VRAM
Q8_0Fits in VRAM
Q4_K_MFits in VRAM
Details
Google11.95B params

Gemma 4 12B

FP16Fits in VRAM
Q8_0Fits in VRAM
Q4_K_MFits in VRAM
Details
Google25.2B params

Gemma 4 26B A4B

FP16CPU Offload
Q8_0Fits in VRAM
Q4_K_MFits in VRAM
Details
Google30.7B params

Gemma 4 31B

FP16CPU Offload
Q8_0CPU Offload
Q4_K_MFits in VRAM
Details
Nvidia31.6B params

Nemotron-3 Nano 30B

FP16CPU Offload
Q8_0N/A
Q4_K_MN/A
Details
OpenAI117B params

gpt-oss-120b

FP16CPU Offload
Q8_0N/A
Q4_K_MN/A
Details
OpenAI21B params

gpt-oss-20b

FP16Fits in VRAM
Q8_0N/A
Q4_K_MN/A
Details