Home / AI GPUs / NVIDIA RTX 2080 Ti 11 GB

NVIDIA · GeForce

NVIDIA RTX 2080 Ti 11 GB

11 GB GDDR6 advertised VRAM. Usable memory for calculations is 90% of advertised capacity. This page is the chip + VRAM entity — not a single cooler SKU.

No fresh matched Amazon price is currently available for this canonical GPU.

What can I runCompare this GPUValue explorerFind a GPU for a model

What AI models can it run?

Calculated memory fit for catalog models on this chip. Defaults are Q4 and 8K when you do not change the controls. This is not a speed ranking.

Open full finder
GPU
NVIDIA RTX 2080 Ti 11 GB · 11 GB advertised
Usable VRAM
9.9 GB (advertised × 0.90)
Quantization
Q4 (default for this form)
Context
8K (default for this form)

43 of 82 catalog models calculate as a full VRAM fit under these assumptions.

Runs fully in GPU VRAM

43 models at the selected quantization and context. Memory fit only — not a speed ranking.

Mistral · 12B

Mistral Nemo 12B Instruct

Quantization
Q4
Context
8K
Required VRAM
9.7 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
0.2 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Offload Q5 Offload Q4 Fits Q3 Fits

Q4: 128K Limited context 16K Limited context 2K Fits 32K Limited context 4K Fits 64K Limited context 8K Fits

Full calculationFind a GPU

TII · 10B

Falcon 3 10B Instruct

Quantization
Q4
Context
8K
Required VRAM
8.5 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
1.4 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Offload Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 32K Limited context 4K Fits 8K Fits

Full calculationFind a GPU

Zhipu AI · 9.4B

GLM-4-9B-0414

Quantization
Q4
Context
8K
Required VRAM
7.0 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
2.9 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 32K Fits 4K Fits 8K Fits

Full calculationFind a GPU

Google · 9.2B

Gemma 2 9B Instruct

Quantization
Q4
Context
8K
Required VRAM
9.2 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
0.7 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Limited context Q5 Limited context Q4 Fits Q3 Fits

Q4: 2K Fits 4K Fits 8K Fits

Full calculationFind a GPU

Alibaba · 8.2B

Qwen3 8B

Quantization
Q4
Context
8K
Required VRAM
7.1 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
2.8 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 32K Limited context 4K Fits 40K Limited context 8K Fits

Full calculationFind a GPU

DeepSeek · 8.0B

DeepSeek R1 Distill Llama 8B

Quantization
Q4
Context
8K
Required VRAM
6.8 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
3.1 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 128K Limited context 16K Fits 2K Fits 32K Fits 4K Fits 64K Limited context 8K Fits

Full calculationFind a GPU

NousResearch · 8.0B

Hermes 3 Llama 3.1 8B

Quantization
Q4
Context
8K
Required VRAM
6.8 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
3.1 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 128K Limited context 16K Fits 2K Fits 32K Fits 4K Fits 64K Limited context 8K Fits

Full calculationFind a GPU

Meta · 8.0B

Llama 3.1 8B Instruct

Quantization
Q4
Context
8K
Required VRAM
6.8 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
3.1 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 128K Limited context 16K Fits 2K Fits 32K Fits 4K Fits 64K Limited context 8K Fits

Full calculationFind a GPU

Meta · 8.0B

Llama 3 8B Instruct

Quantization
Q4
Context
8K
Required VRAM
6.8 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
3.1 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 2K Fits 4K Fits 8K Fits

Full calculationFind a GPU

Mistral · 8.0B

Ministral 8B Instruct

Quantization
Q4
Context
8K
Required VRAM
7.0 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
2.9 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 32K Limited context 4K Fits 8K Fits

Full calculationFind a GPU

Google · 8.0B

Gemma 4 E4B Instruct

Quantization
Q4
Context
8K
Required VRAM
6.5 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
3.4 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 128K Limited context 16K Fits 2K Fits 32K Fits 4K Fits 64K Limited context 8K Fits

Full calculationFind a GPU

DeepSeek · 7.6B

DeepSeek R1 Distill Qwen 7B

Quantization
Q4
Context
8K
Required VRAM
6.0 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
3.9 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Limited context Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 128K Limited context 16K Fits 2K Fits 32K Fits 4K Fits 64K Fits 8K Fits

Full calculationFind a GPU

Alibaba · 7.6B

Qwen2.5 7B Instruct

Quantization
Q4
Context
8K
Required VRAM
6.0 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
3.9 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Limited context Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 32K Fits 4K Fits 8K Fits

Full calculationFind a GPU

Alibaba · 7.6B

Qwen2.5-Coder 7B Instruct

Quantization
Q4
Context
8K
Required VRAM
6.0 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
3.9 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Limited context Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 32K Fits 4K Fits 8K Fits

Full calculationFind a GPU

Qwen · 7.6B

Qwen2 7B Instruct

Quantization
Q4
Context
8K
Required VRAM
6.0 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
3.9 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Limited context Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 32K Fits 4K Fits 8K Fits

Full calculationFind a GPU

TII · 7.5B

Falcon 3 7B Instruct

Quantization
Q4
Context
8K
Required VRAM
6.4 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
3.5 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Limited context Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 32K Fits 4K Fits 8K Fits

Full calculationFind a GPU

Mistral · 7.3B

Mistral 7B Instruct v0.3

Quantization
Q4
Context
8K
Required VRAM
6.3 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
3.6 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Limited context Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 32K Fits 4K Fits 8K Fits

Full calculationFind a GPU

OpenChat · 7.2B

OpenChat 3.5 7B

Quantization
Q4
Context
8K
Required VRAM
6.3 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
3.6 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Limited context Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 2K Fits 4K Fits 8K Fits

Full calculationFind a GPU

TII · 7.2B

Falcon 7B Instruct

Quantization
Q4
Context
8K
Required VRAM
9.8 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
0.1 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Limited context Q5 Limited context Q4 Fits Q3 Fits

Q4: 128K Limited context 16K Limited context 2K Fits 32K Limited context 4K Fits 64K Limited context 8K Fits

Full calculationFind a GPU

BigCode · 7.2B

StarCoder2 7B

Quantization
Q4
Context
8K
Required VRAM
5.8 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
4.1 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Fits Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 4K Fits 8K Fits

Full calculationFind a GPU

23 more runs fully in gpu vram

Fits with a shorter context

3 models at the selected quantization and context. Memory fit only — not a speed ranking.

Google · 12B

Gemma 3 12B Instruct

Quantization
Q4
Context
8K
Required VRAM
11.5 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
1.6 GB over usable VRAM
Fit
Limited context Fits with a shorter context

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Offload Q5 Offload Q4 Limited context Q3 Limited context

Q4: 128K Limited context 16K Limited context 2K Fits 32K Limited context 4K Limited context 64K Limited context 8K Limited context

Full calculationFind a GPU

Google · 12B

Gemma 4 12B Instruct

Quantization
Q4
Context
8K
Required VRAM
11.3 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
1.4 GB over usable VRAM
Fit
Limited context Fits with a shorter context

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Offload Q5 Offload Q4 Limited context Q3 Fits

Q4: 128K Limited context 16K Limited context 2K Fits 256K Limited context 32K Limited context 4K Fits 64K Limited context 8K Limited context

Full calculationFind a GPU

Zhipu AI · 9.4B

GLM-4 9B Chat

Quantization
Q4
Context
8K
Required VRAM
11.7 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
1.8 GB over usable VRAM
Fit
Limited context Fits with a shorter context

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Offload Q5 Limited context Q4 Limited context Q3 Limited context

Q4: 128K Limited context 16K Limited context 2K Fits 32K Limited context 4K Fits 64K Limited context 8K Limited context

Full calculationFind a GPU

Requires CPU/RAM offload

25 models at the selected quantization and context. Memory fit only — not a speed ranking.

Meta · 34B

Code Llama 34B Instruct

Quantization
Q4
Context
8K
Required VRAM
23.6 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
13.7 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 No Q5 Offload Q4 Offload Q3 Offload

Q4: 16K Offload 2K Offload 4K Offload 8K Offload

Full calculationFind a GPU

DeepSeek · 33B

DeepSeek Coder 33B Instruct

Quantization
Q4
Context
8K
Required VRAM
23.8 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
13.9 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 No Q5 Offload Q4 Offload Q3 Offload

Q4: 16K Offload 2K Offload 4K Offload 8K Offload

Full calculationFind a GPU

Alibaba · 33B

Qwen3 32B

Quantization
Q4
Context
8K
Required VRAM
23.5 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
13.6 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 No Q5 Offload Q4 Offload Q3 Offload

Q4: 16K Offload 2K Offload 32K Offload 4K Offload 40K Offload 8K Offload

Full calculationFind a GPU

DeepSeek · 33B

DeepSeek R1 Distill Qwen 32B

Quantization
Q4
Context
8K
Required VRAM
23.3 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
13.4 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 No Q5 Offload Q4 Offload Q3 Offload

Q4: 128K Offload 16K Offload 2K Offload 32K Offload 4K Offload 64K Offload 8K Offload

Full calculationFind a GPU

Alibaba · 33B

Qwen2.5 32B Instruct

Quantization
Q4
Context
8K
Required VRAM
23.3 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
13.4 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 No Q5 Offload Q4 Offload Q3 Offload

Q4: 16K Offload 2K Offload 32K Offload 4K Offload 8K Offload

Full calculationFind a GPU

Alibaba · 33B

Qwen2.5-Coder 32B Instruct

Quantization
Q4
Context
8K
Required VRAM
23.3 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
13.4 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 No Q5 Offload Q4 Offload Q3 Offload

Q4: 16K Offload 2K Offload 32K Offload 4K Offload 8K Offload

Full calculationFind a GPU

Alibaba · 33B

QwQ 32B

Quantization
Q4
Context
8K
Required VRAM
23.3 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
13.4 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 No Q5 Offload Q4 Offload Q3 Offload

Q4: 16K Offload 2K Offload 32K Offload 4K Offload 40K Offload 8K Offload

Full calculationFind a GPU

Google · 31B

Gemma 4 31B Instruct

Quantization
Q4
Context
8K
Required VRAM
28.1 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
18.2 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 No Q5 Offload Q4 Offload Q3 Offload

Q4: 128K Offload 16K Offload 2K Offload 256K Offload 32K Offload 4K Offload 64K Offload 8K Offload

Full calculationFind a GPU

Alibaba · 31B

Qwen3 30B-A3B

Quantization
Q4
Context
8K
Required VRAM
20.8 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
10.9 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 No Q5 Offload Q4 Offload Q3 Offload

Q4: 16K Offload 2K Offload 32K Offload 4K Offload 40K Offload 8K Offload

Full calculationFind a GPU

Alibaba · 31B

Qwen3-Coder 30B-A3B Instruct

Quantization
Q4
Context
8K
Required VRAM
20.8 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
10.9 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 No Q5 Offload Q4 Offload Q3 Offload

Q4: 128K Offload 16K Offload 2K Offload 256K Offload 32K Offload 4K Offload 64K Offload 8K Offload

Full calculationFind a GPU

Google · 27B

Gemma 3 27B Instruct

Quantization
Q4
Context
8K
Required VRAM
22.0 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
12.1 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 Offload Q5 Offload Q4 Offload Q3 Offload

Q4: 128K Offload 16K Offload 2K Offload 32K Offload 4K Offload 64K Offload 8K Offload

Full calculationFind a GPU

Google · 27B

Gemma 2 27B Instruct

Quantization
Q4
Context
8K
Required VRAM
20.9 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
11.0 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 Offload Q5 Offload Q4 Offload Q3 Offload

Q4: 2K Offload 4K Offload 8K Offload

Full calculationFind a GPU

Google · 27B

Gemma 4 26B-A4B Instruct

Quantization
Q4
Context
8K
Required VRAM
19.4 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
9.5 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 Offload Q5 Offload Q4 Offload Q3 Offload

Q4: 128K Offload 16K Offload 2K Offload 256K Offload 32K Offload 4K Offload 64K Offload 8K Offload

Full calculationFind a GPU

Mistral · 24B

Mistral Small 3.2 24B Instruct

Quantization
Q4
Context
8K
Required VRAM
17.2 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
7.3 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 Offload Q5 Offload Q4 Offload Q3 Offload

Q4: 128K Offload 16K Offload 2K Offload 32K Offload 4K Offload 64K Offload 8K Offload

Full calculationFind a GPU

Mistral · 24B

Mistral Small 24B Instruct

Quantization
Q4
Context
8K
Required VRAM
17.0 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
7.1 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 Offload Q5 Offload Q4 Offload Q3 Offload

Q4: 16K Offload 2K Offload 32K Offload 4K Offload 8K Offload

Full calculationFind a GPU

Mistral · 24B

Magistral Small

Quantization
Q4
Context
8K
Required VRAM
16.9 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
7.0 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 Offload Q5 Offload Q4 Offload Q3 Offload

Q4: 16K Offload 2K Offload 32K Offload 4K Offload 40K Offload 8K Offload

Full calculationFind a GPU

OpenAI · 22B

GPT-OSS 20B

Quantization
Q4
Context
8K
Required VRAM
14.7 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
4.8 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 Offload Q6 Offload Q5 Offload Q4 Offload Q3 Offload

Q4: 128K Offload 16K Offload 2K Offload 32K Offload 4K Offload 64K Offload 8K Offload

Full calculationFind a GPU

BigCode · 16B

StarCoder2 15B

Quantization
Q4
Context
8K
Required VRAM
11.5 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
1.6 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 Offload Q6 Offload Q5 Offload Q4 Offload Q3 Fits

Q4: 16K Offload 2K Offload 4K Offload 8K Offload

Full calculationFind a GPU

Alibaba · 15B

Qwen3 14B

Quantization
Q4
Context
8K
Required VRAM
11.4 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
1.5 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 Offload Q6 Offload Q5 Offload Q4 Offload Q3 Fits

Q4: 16K Offload 2K Offload 32K Offload 4K Offload 40K Offload 8K Offload

Full calculationFind a GPU

DeepSeek · 15B

DeepSeek R1 Distill Qwen 14B

Quantization
Q4
Context
8K
Required VRAM
11.6 GB
Usable GPU VRAM
9.9 GB
VRAM headroom
1.7 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 Offload Q6 Offload Q5 Offload Q4 Offload Q3 Fits

Q4: 128K Offload 16K Offload 2K Offload 32K Offload 4K Offload 64K Offload 8K Offload

Full calculationFind a GPU

5 more requires cpu/ram offload

Does not fit

ModelRequired VRAMUsable VRAMStatus
GLM-4.5230.7 GB9.9 GBNo
Qwen3 235B-A22B151.2 GB9.9 GBNo
Mixtral 8x22B Instruct91.8 GB9.9 GBNo
GPT-OSS 120B75.5 GB9.9 GBNo
GLM-4.5 Air72.2 GB9.9 GBNo
Qwen2.5 72B Instruct49.3 GB9.9 GBNo
DeepSeek R1 Distill Llama 70B48.0 GB9.9 GBNo
Hermes 3 Llama 3.1 70B48.0 GB9.9 GBNo
Llama 3.1 70B Instruct48.0 GB9.9 GBNo
Llama 3.3 70B Instruct48.0 GB9.9 GBNo
Mixtral 8x7B Instruct31.3 GB9.9 GBNo

Q4 / Q8 / FP16 overview

Status below is the best calculated result across evaluated context lengths for each quantization. Open a model for the full table.

ModelParamsQ4Q8FP16Max context in VRAM
Qwen2.5 0.5B Instruct494MFitsFitsFits32K
Qwen3 0.6B752MFitsFitsFits40K
Gemma 3 1B Instruct1000MFitsFitsFits32K
TinyLlama 1.1B Chat v1.01.1BFitsFitsFits2K
Llama 3.2 1B Instruct1.2BFitsFitsFits128K
Qwen2.5 1.5B Instruct1.5BFitsFitsFits32K
Qwen2.5-Coder 1.5B Instruct1.5BFitsFitsFits32K
Falcon 3 1B Instruct1.7BFitsFitsFits8K
SmolLM2 1.7B Instruct1.7BFitsFitsFits8K
DeepSeek R1 Distill Qwen 1.5B1.8BFitsFitsFits128K
Qwen3 1.7B2.0BFitsFitsFits40K
Gemma 2 2B Instruct2.6BFitsFitsFits8K
SmolLM3 3B3.1BFitsFitsFits64K
Qwen2.5 3B Instruct3.1BFitsFitsFits32K
Llama 3.2 3B Instruct3.2BFitsFitsFits64K
Falcon 3 3B Instruct3.2BFitsFitsFits32K
Phi-3.5 Mini Instruct3.8BFitsFitsFits16K
Phi-3 Mini 128K Instruct3.8BFitsFitsFits16K
Phi-3 Mini 4K Instruct3.8BFitsFitsFits4K
Phi-4 Mini Reasoning3.8BFitsFitsFits32K
Phi-4 Mini Instruct3.8BFitsFitsFits32K
Qwen3 4B4.0BFitsFitsFits40K
Gemma 3 4B Instruct4.3BFitsFitsFits32K
Gemma 4 E2B Instruct5.1BFitsFitsOffload128K
Code Llama 7B Instruct6.7BFitsFitsOffload8K
Vicuna 7B v1.56.7BFitsFitsOffload4K
DeepSeek LLM 7B Chat6.9BFitsFitsOffload4K
OLMoE 1B-7B Instruct6.9BFitsFitsOffload4K
StarCoder2 7B7.2BFitsFitsOffload16K
Falcon 7B Instruct7.2BFitsOffloadOffload8K
OpenChat 3.5 7B7.2BFitsFitsOffload8K
Mistral 7B Instruct v0.37.3BFitsFitsOffload32K
OLMo 2 7B Instruct7.3BFitsOffloadOffload4K
Falcon 3 7B Instruct7.5BFitsFitsOffload32K
DeepSeek R1 Distill Qwen 7B7.6BFitsFitsOffload64K
Qwen2.5 7B Instruct7.6BFitsFitsOffload32K
Qwen2.5-Coder 7B Instruct7.6BFitsFitsOffload32K
Qwen2.5-Math 7B Instruct7.6BFitsFitsOffload4K
Qwen2 7B Instruct7.6BFitsFitsOffload32K
Gemma 4 E4B Instruct8.0BFitsOffloadOffload32K
Ministral 8B Instruct8.0BFitsOffloadOffload32K
DeepSeek R1 Distill Llama 8B8.0BFitsOffloadOffload32K
Hermes 3 Llama 3.1 8B8.0BFitsOffloadOffload32K
Llama 3.1 8B Instruct8.0BFitsOffloadOffload32K
Llama 3 8B Instruct8.0BFitsOffloadOffload8K
Qwen3 8B8.2BFitsOffloadOffload32K
Yi 1.5 9B Chat8.8BFitsOffloadOffload4K
Gemma 2 9B Instruct9.2BFitsOffloadOffload8K
GLM-4-9B-04149.4BFitsOffloadOffload32K
GLM-4 9B Chat9.4BFitsOffloadOffload4K
Falcon 3 10B Instruct10BFitsOffloadOffload16K
SOLAR 10.7B Instruct11BFitsOffloadOffload4K
Gemma 4 12B Instruct12BFitsOffloadOffload8K
Gemma 3 12B Instruct12BFitsOffloadOffload4K
Mistral Nemo 12B Instruct12BFitsOffloadOffload16K
Code Llama 13B Instruct13BOffloadOffloadOffload2K
Vicuna 13B v1.513BOffloadOffloadOffload2K
OLMo 2 13B Instruct14BOffloadOffloadNo2K
Phi-3 Medium 128K Instruct14BOffloadOffloadNo8K
Phi-3 Medium 4K Instruct14BOffloadOffloadNo4K
Phi-4 Reasoning15BOffloadOffloadNo8K
DeepSeek R1 Distill Qwen 14B15BOffloadOffloadNo8K
Phi-415BOffloadOffloadNo8K
Qwen2.5 14B Instruct15BOffloadOffloadNo8K
Qwen3 14B15BOffloadOffloadNo8K
StarCoder2 15B16BOffloadOffloadNo8K
GPT-OSS 20B22BOffloadOffloadNo—
Magistral Small24BOffloadNoNo—
Mistral Small 24B Instruct24BOffloadNoNo—
Mistral Small 3.2 24B Instruct24BOffloadNoNo—
Gemma 4 26B-A4B Instruct27BOffloadNoNo—
Gemma 2 27B Instruct27BOffloadNoNo—
Gemma 3 27B Instruct27BOffloadNoNo—
Qwen3-Coder 30B-A3B Instruct31BOffloadNoNo—
Qwen3 30B-A3B31BOffloadNoNo—
Gemma 4 31B Instruct31BOffloadNoNo—
OLMo 2 32B Instruct32BOffloadNoNo—
DeepSeek R1 Distill Qwen 32B33BOffloadNoNo—
Qwen2.5 32B Instruct33BOffloadNoNo—
Qwen2.5-Coder 32B Instruct33BOffloadNoNo—
QwQ 32B33BOffloadNoNo—
Qwen3 32B33BOffloadNoNo—
DeepSeek Coder 33B Instruct33BOffloadNoNo—
Code Llama 34B Instruct34BOffloadNoNo—
Yi 1.5 34B Chat34BOffloadNoNo—
Mixtral 8x7B Instruct47BNoNoNo—
DeepSeek R1 Distill Llama 70B71BNoNoNo—
Hermes 3 Llama 3.1 70B71BNoNoNo—
Llama 3.1 70B Instruct71BNoNoNo—
Llama 3.3 70B Instruct71BNoNoNo—
Qwen2.5 72B Instruct73BNoNoNo—
GLM-4.5 Air110BNoNoNo—
GPT-OSS 120B117BNoNoNo—
Mixtral 8x22B Instruct141BNoNoNo—
Qwen3 235B-A22B235BNoNoNo—
GLM-4.5358BNoNoNo—

Local AI performance

llama.cpp CUDA decode at Q4 under llama-bench tg128 conditions. Shown only for models that fit fully in VRAM. Not a ranking.

ModelDecodeStateConfidence
Mistral Nemo 12B Instruct~54 tok/sCalibrated estimateMEDIUM
Falcon 3 10B Instruct~64 tok/sCalibrated estimateMEDIUM
GLM-4-9B-0414~70 tok/sCalibrated estimateMEDIUM
Gemma 2 9B Instruct~72 tok/sCalibrated estimateMEDIUM
Qwen3 8B~81 tok/sCalibrated estimateHIGH
Hermes 3 Llama 3.1 8B~82 tok/sCalibrated estimateHIGH
Llama 3.1 8B Instruct~82 tok/sCalibrated estimateHIGH
Llama 3 8B Instruct~82 tok/sCalibrated estimateHIGH
DeepSeek R1 Distill Llama 8B~82 tok/sCalibrated estimateHIGH
Qwen2.5-Coder 7B Instruct~87 tok/sCalibrated estimateHIGH

Compare this GPU

Published local-AI comparisons involving this chip. Not a ranking.

Available graphics cards

These are Icecat product SKUs mapped to this chip. Different board-partner cards are not assumed to share a price. Amazon CTAs appear only for EXACT/HIGH matches that are not bundled accessories.

GIGABYTE

GIGABYTE GAMING GeForce RTX 2080 Ti OC 11G

11 GB · Amazon unmatched

Check availability
MSI

MSI VENTUS GeForce RTX 2080 Ti 11G

11 GB · Amazon unmatched

Check availability

Sources

GPU identity and VRAM: Icecat structured specifications. Compatibility: RigForAI calculated estimate. Amazon: live affiliate match on individual SKUs, via /go/amazon/.