Home / Models
Calculated memory fit
AI models
Each page answers how much GPU memory a model needs, and which catalog GPUs can hold it at a given quantization and context length. Figures are estimates from official model configs, not measured benchmarks.
DeepSeek
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| DeepSeek R1 Distill Qwen 14B | DeepSeek | 15B | 131,072 | qwen2 |
| DeepSeek R1 Distill Qwen 32B | DeepSeek | 33B | 131,072 | qwen2 |
| DeepSeek LLM 7B Chat | DeepSeek | 6.9B | 4,096 | llama |
| DeepSeek R1 Distill Llama 70B | DeepSeek | 71B | 131,072 | llama |
| DeepSeek R1 Distill Qwen 7B | DeepSeek | 7.6B | 131,072 | qwen2 |
| DeepSeek R1 Distill Llama 8B | DeepSeek | 8.0B | 131,072 | llama |
Falcon
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| Falcon 3 10B Instruct | TII | 10B | 32,768 | llama |
| Falcon 7B Instruct | TII | 7.2B | — | falcon |
| Falcon 3 7B Instruct | TII | 7.5B | 32,768 | llama |
Gemma
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| Gemma 2 2B Instruct | 2.6B | 8,192 | gemma2 | |
| Gemma 2 27B Instruct | 27B | 8,192 | gemma2 | |
| Gemma 2 9B Instruct | 9.2B | 8,192 | gemma2 |
GLM
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| GLM-4-9B-0414 | Zhipu AI | 9.4B | 32,768 | glm4 |
| GLM-4 9B Chat | Zhipu AI | 9.4B | — | chatglm |
GPT-OSS
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| GPT-OSS 120B | OpenAI | 117B | 131,072 | gpt_oss |
| GPT-OSS 20B | OpenAI | 22B | 131,072 | gpt_oss |
Hermes
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| Hermes 3 Llama 3.1 70B | NousResearch | 71B | 131,072 | llama |
| Hermes 3 Llama 3.1 8B | NousResearch | 8.0B | 131,072 | llama |
Llama
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| Llama 3.2 1B Instruct | Meta | 1.2B | 131,072 | llama |
| Code Llama 13B Instruct | Meta | 13B | 16,384 | llama |
| Llama 3.2 3B Instruct | Meta | 3.2B | 131,072 | llama |
| Code Llama 34B Instruct | Meta | 34B | 16,384 | llama |
| Code Llama 7B Instruct | Meta | 6.7B | 16,384 | llama |
| Llama 3.1 70B Instruct | Meta | 71B | 131,072 | llama |
| Llama 3.3 70B Instruct | Meta | 71B | 131,072 | llama |
| Llama 3.1 8B Instruct | Meta | 8.0B | 131,072 | llama |
| Llama 3 8B Instruct | Meta | 8.0B | 8,192 | llama |
Mistral
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| Mistral Nemo 12B Instruct | Mistral | 12B | 131,072 | mistral |
| Mistral Small 24B Instruct | Mistral | 24B | 32,768 | mistral |
| Mistral 7B Instruct v0.3 | Mistral | 7.3B | 32,768 | mistral |
Mixtral
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| Mixtral 8x22B Instruct | Mistral | 141B | 65,536 | mixtral |
| Mixtral 8x7B Instruct | Mistral | 47B | 32,768 | mixtral |
OLMo
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| OLMo 2 13B Instruct | AllenAI | 14B | 4,096 | olmo2 |
| OLMo 2 7B Instruct | AllenAI | 7.3B | 4,096 | olmo2 |
OpenChat
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| OpenChat 3.5 7B | OpenChat | 7.2B | 8,192 | mistral |
Phi
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| Phi-3 Medium 128K Instruct | Microsoft | 14B | 131,072 | phi3 |
| Phi-3 Medium 4K Instruct | Microsoft | 14B | 4,096 | phi3 |
| Phi-4 | Microsoft | 15B | 16,384 | phi3 |
| Phi-3.5 Mini Instruct | Microsoft | 3.8B | 131,072 | phi3 |
| Phi-3 Mini 128K Instruct | Microsoft | 3.8B | 131,072 | phi3 |
| Phi-3 Mini 4K Instruct | Microsoft | 3.8B | 4,096 | phi3 |
| Phi-4 Mini Instruct | Microsoft | 3.8B | 131,072 | phi3 |
Qwen
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| Qwen2.5 14B Instruct | Alibaba | 15B | 32,768 | qwen2 |
| Qwen3 14B | Alibaba | 15B | 40,960 | qwen3 |
| Qwen2.5 1.5B Instruct | Qwen | 1.5B | 32,768 | qwen2 |
| Qwen2.5-Coder 1.5B Instruct | Qwen | 1.5B | 32,768 | qwen2 |
| Qwen2.5 3B Instruct | Alibaba | 3.1B | 32,768 | qwen2 |
| Qwen2.5 32B Instruct | Alibaba | 33B | 32,768 | qwen2 |
| Qwen2.5-Coder 32B Instruct | Alibaba | 33B | 32,768 | qwen2 |
| QwQ 32B | Alibaba | 33B | 40,960 | qwen2 |
| Qwen3 32B | Alibaba | 33B | 40,960 | qwen3 |
| Qwen2.5 0.5B Instruct | Qwen | 494M | 32,768 | qwen2 |
| Qwen2.5 72B Instruct | Alibaba | 73B | 32,768 | qwen2 |
| Qwen2.5 7B Instruct | Alibaba | 7.6B | 32,768 | qwen2 |
| Qwen2.5-Coder 7B Instruct | Alibaba | 7.6B | 32,768 | qwen2 |
| Qwen2.5-Math 7B Instruct | Qwen | 7.6B | 4,096 | qwen2 |
| Qwen2 7B Instruct | Qwen | 7.6B | 32,768 | qwen2 |
| Qwen3 8B | Alibaba | 8.2B | 40,960 | qwen3 |
SmolLM
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| SmolLM2 1.7B Instruct | HuggingFaceTB | 1.7B | 8,192 | llama |
Solar
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| SOLAR 10.7B Instruct | Upstage | 11B | 4,096 | llama |
StarCoder
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| StarCoder2 15B | BigCode | 16B | 16,384 | starcoder2 |
| StarCoder2 7B | BigCode | 7.2B | 16,384 | starcoder2 |
TinyLlama
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| TinyLlama 1.1B Chat v1.0 | TinyLlama | 1.1B | 2,048 | llama |
Vicuna
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| Vicuna 13B v1.5 | LMSYS | 13B | 4,096 | llama |
| Vicuna 7B v1.5 | LMSYS | 6.7B | 4,096 | llama |
Yi
| Model | Publisher | Parameters | Native context | Architecture |
|---|---|---|---|---|
| Yi 1.5 34B Chat | 01.AI | 34B | 4,096 | llama |
| Yi 1.5 9B Chat | 01.AI | 8.8B | 4,096 | llama |