Home / AI GPUs / NVIDIA Tesla V100S 32 GB

NVIDIA · Volta

NVIDIA Tesla V100S 32 GB

32 GB advertised VRAM. Usable memory for calculations is 90% of advertised capacity. This page is the chip + VRAM entity — not a single cooler SKU.

No fresh matched Amazon price is currently available for this canonical GPU.

What can I runCompare this GPUValue explorerFind a GPU for a model

What AI models can it run?

Calculated memory fit for catalog models on this chip. Defaults are Q4 and 8K when you do not change the controls. This is not a speed ranking.

Open full finder
GPU
NVIDIA Tesla V100S 32 GB · 32 GB advertised
Usable VRAM
28.8 GB (advertised × 0.90)
Quantization
Q4 (default for this form)
Context
8K (default for this form)

71 of 82 catalog models calculate as a full VRAM fit under these assumptions.

Runs fully in GPU VRAM

71 models at the selected quantization and context. Memory fit only — not a speed ranking.

Meta · 34B

Code Llama 34B Instruct

Quantization
Q4
Context
8K
Required VRAM
23.6 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
5.2 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Offload Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 4K Fits 8K Fits

Full calculationFind a GPU

DeepSeek · 33B

DeepSeek Coder 33B Instruct

Quantization
Q4
Context
8K
Required VRAM
23.8 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
5.0 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Offload Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 4K Fits 8K Fits

Full calculationFind a GPU

Alibaba · 33B

Qwen3 32B

Quantization
Q4
Context
8K
Required VRAM
23.5 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
5.3 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Offload Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 32K Limited context 4K Fits 40K Limited context 8K Fits

Full calculationFind a GPU

DeepSeek · 33B

DeepSeek R1 Distill Qwen 32B

Quantization
Q4
Context
8K
Required VRAM
23.3 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
5.5 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Offload Q5 Fits Q4 Fits Q3 Fits

Q4: 128K Limited context 16K Fits 2K Fits 32K Limited context 4K Fits 64K Limited context 8K Fits

Full calculationFind a GPU

Alibaba · 33B

Qwen2.5 32B Instruct

Quantization
Q4
Context
8K
Required VRAM
23.3 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
5.5 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Offload Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 32K Limited context 4K Fits 8K Fits

Full calculationFind a GPU

Alibaba · 33B

Qwen2.5-Coder 32B Instruct

Quantization
Q4
Context
8K
Required VRAM
23.3 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
5.5 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Offload Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 32K Limited context 4K Fits 8K Fits

Full calculationFind a GPU

Alibaba · 33B

QwQ 32B

Quantization
Q4
Context
8K
Required VRAM
23.3 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
5.5 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Offload Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 32K Limited context 4K Fits 40K Limited context 8K Fits

Full calculationFind a GPU

Google · 31B

Gemma 4 31B Instruct

Quantization
Q4
Context
8K
Required VRAM
28.1 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
0.7 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Offload Q5 Limited context Q4 Fits Q3 Fits

Q4: 128K Limited context 16K Limited context 2K Fits 256K Limited context 32K Limited context 4K Fits 64K Limited context 8K Fits

Full calculationFind a GPU

Alibaba · 31B

Qwen3 30B-A3B

Quantization
Q4
Context
8K
Required VRAM
20.8 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
8.0 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Limited context Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 32K Fits 4K Fits 40K Fits 8K Fits

Full calculationFind a GPU

Alibaba · 31B

Qwen3-Coder 30B-A3B Instruct

Quantization
Q4
Context
8K
Required VRAM
20.8 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
8.0 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Limited context Q5 Fits Q4 Fits Q3 Fits

Q4: 128K Limited context 16K Fits 2K Fits 256K Limited context 32K Fits 4K Fits 64K Fits 8K Fits

Full calculationFind a GPU

Google · 27B

Gemma 3 27B Instruct

Quantization
Q4
Context
8K
Required VRAM
22.0 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
6.8 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Limited context Q5 Fits Q4 Fits Q3 Fits

Q4: 128K Limited context 16K Fits 2K Fits 32K Limited context 4K Fits 64K Limited context 8K Fits

Full calculationFind a GPU

Google · 27B

Gemma 2 27B Instruct

Quantization
Q4
Context
8K
Required VRAM
20.9 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
7.9 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 2K Fits 4K Fits 8K Fits

Full calculationFind a GPU

Google · 27B

Gemma 4 26B-A4B Instruct

Quantization
Q4
Context
8K
Required VRAM
19.4 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
9.4 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Offload Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 128K Limited context 16K Fits 2K Fits 256K Limited context 32K Fits 4K Fits 64K Limited context 8K Fits

Full calculationFind a GPU

Mistral · 24B

Mistral Small 3.2 24B Instruct

Quantization
Q4
Context
8K
Required VRAM
17.2 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
11.6 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Limited context Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 128K Limited context 16K Fits 2K Fits 32K Fits 4K Fits 64K Fits 8K Fits

Full calculationFind a GPU

Mistral · 24B

Mistral Small 24B Instruct

Quantization
Q4
Context
8K
Required VRAM
17.0 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
11.8 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Limited context Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 32K Fits 4K Fits 8K Fits

Full calculationFind a GPU

Mistral · 24B

Magistral Small

Quantization
Q4
Context
8K
Required VRAM
16.9 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
11.9 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Limited context Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 32K Fits 4K Fits 40K Fits 8K Fits

Full calculationFind a GPU

OpenAI · 22B

GPT-OSS 20B

Quantization
Q4
Context
8K
Required VRAM
14.7 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
14.1 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Fits Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 128K Fits 16K Fits 2K Fits 32K Fits 4K Fits 64K Fits 8K Fits

Full calculationFind a GPU

BigCode · 16B

StarCoder2 15B

Quantization
Q4
Context
8K
Required VRAM
11.5 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
17.3 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Fits Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 4K Fits 8K Fits

Full calculationFind a GPU

Alibaba · 15B

Qwen3 14B

Quantization
Q4
Context
8K
Required VRAM
11.4 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
17.4 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Fits Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 16K Fits 2K Fits 32K Fits 4K Fits 40K Fits 8K Fits

Full calculationFind a GPU

DeepSeek · 15B

DeepSeek R1 Distill Qwen 14B

Quantization
Q4
Context
8K
Required VRAM
11.6 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
17.2 GB leftover after the calculated requirement
Fit
Fits Runs fully in GPU VRAM

At 8K: FP16 Offload BF16 Offload Q8 Fits Q6 Fits Q5 Fits Q4 Fits Q3 Fits

Q4: 128K Limited context 16K Fits 2K Fits 32K Fits 4K Fits 64K Fits 8K Fits

Full calculationFind a GPU

51 more runs fully in gpu vram

Requires CPU/RAM offload

8 models at the selected quantization and context. Memory fit only — not a speed ranking.

OpenAI · 117B

GPT-OSS 120B

Quantization
Q4
Context
8K
Required VRAM
75.5 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
46.7 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 No Q5 No Q4 Offload Q3 Offload

Q4: 128K Offload 16K Offload 2K Offload 32K Offload 4K Offload 64K Offload 8K Offload

Full calculationFind a GPU

Zhipu AI · 110B

GLM-4.5 Air

Quantization
Q4
Context
8K
Required VRAM
72.2 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
43.4 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 No Q5 No Q4 Offload Q3 Offload

Q4: 128K Offload 16K Offload 2K Offload 32K Offload 4K Offload 64K Offload 8K Offload

Full calculationFind a GPU

Alibaba · 73B

Qwen2.5 72B Instruct

Quantization
Q4
Context
8K
Required VRAM
49.3 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
20.5 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 Offload Q5 Offload Q4 Offload Q3 Offload

Q4: 16K Offload 2K Offload 32K Offload 4K Offload 8K Offload

Full calculationFind a GPU

DeepSeek · 71B

DeepSeek R1 Distill Llama 70B

Quantization
Q4
Context
8K
Required VRAM
48.0 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
19.2 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 Offload Q5 Offload Q4 Offload Q3 Offload

Q4: 128K Offload 16K Offload 2K Offload 32K Offload 4K Offload 64K Offload 8K Offload

Full calculationFind a GPU

NousResearch · 71B

Hermes 3 Llama 3.1 70B

Quantization
Q4
Context
8K
Required VRAM
48.0 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
19.2 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 Offload Q5 Offload Q4 Offload Q3 Offload

Q4: 128K Offload 16K Offload 2K Offload 32K Offload 4K Offload 64K Offload 8K Offload

Full calculationFind a GPU

Meta · 71B

Llama 3.1 70B Instruct

Quantization
Q4
Context
8K
Required VRAM
48.0 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
19.2 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 Offload Q5 Offload Q4 Offload Q3 Offload

Q4: 128K Offload 16K Offload 2K Offload 32K Offload 4K Offload 64K Offload 8K Offload

Full calculationFind a GPU

Meta · 71B

Llama 3.3 70B Instruct

Quantization
Q4
Context
8K
Required VRAM
48.0 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
19.2 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 No Q6 Offload Q5 Offload Q4 Offload Q3 Offload

Q4: 128K Offload 16K Offload 2K Offload 32K Offload 4K Offload 64K Offload 8K Offload

Full calculationFind a GPU

Mistral · 47B

Mixtral 8x7B Instruct

Quantization
Q4
Context
8K
Required VRAM
31.3 GB
Usable GPU VRAM
28.8 GB
VRAM headroom
2.5 GB over usable VRAM
Fit
Offload Requires CPU/RAM offload

At 8K: FP16 No BF16 No Q8 Offload Q6 Offload Q5 Offload Q4 Offload Q3 Fits

Q4: 16K Offload 2K Offload 32K Offload 4K Offload 8K Offload

Full calculationFind a GPU

Does not fit

ModelRequired VRAMUsable VRAMStatus
GLM-4.5230.7 GB28.8 GBNo
Qwen3 235B-A22B151.2 GB28.8 GBNo
Mixtral 8x22B Instruct91.8 GB28.8 GBNo

Q4 / Q8 / FP16 overview

Status below is the best calculated result across evaluated context lengths for each quantization. Open a model for the full table.

ModelParamsQ4Q8FP16Max context in VRAM

Available graphics cards

These are Icecat product SKUs mapped to this chip. Different board-partner cards are not assumed to share a price. Amazon CTAs appear only for EXACT/HIGH matches that are not bundled accessories.

No mapped product SKUs yet.

Sources

GPU identity and VRAM: Icecat structured specifications. Compatibility: RigForAI calculated estimate. Amazon: live affiliate match on individual SKUs, via /go/amazon/.