Autor: Jakub Rusinowski · Ostatnia aktualizacja: 26 czerwca 2026
These are the strongest local models that fit entirely in 80 GB of VRAM, ranked by capability, with the quantization level and estimated tokens/sec needed to fit.
| Qwen 2.5 Family — Qwen 2.5 72B Instruct | Q4_K_M · 43.47 GB · ~25 tok/s on NVIDIA A100 80GB |
| Qwen 2.5 Family — Qwen 2.5 Coder 32B | Q4_K_M · 19.32 GB · ~52 tok/s on NVIDIA A100 80GB |
| Llama 3.3 — Llama 3.3 70B Instruct | Q2_K_XS (Tight) · 20.212500000000002 GB · ~50 tok/s on NVIDIA A100 80GB |
| Qwen 3 — Qwen 3 32B | Q4_K_M · 19.802999999999997 GB · ~51 tok/s on NVIDIA A100 80GB |
| DeepSeek R1 — DeepSeek R1 Distill Qwen 32B | Q4_K_M · 19.32 GB · ~52 tok/s on NVIDIA A100 80GB |
| Qwen 2.5 Family — Qwen 2.5 14B Instruct | Q4_K_M · 8.4525 GB · ~101 tok/s on NVIDIA A100 80GB |
| Nemotron 70B — Nemotron 70B Instruct | Q4_K_M · 42.62475 GB · ~26 tok/s on NVIDIA A100 80GB |
| Qwen 3.5 (Legacy Listing — Unverified) — Qwen 3.5 122B-A10B (MoE) | Q4_K_M · 73.6575 GB · ~118 tok/s on NVIDIA A100 80GB |
| Gemma 4 (Legacy Listing — Unverified) — Gemma 4 27B ⭐ | Q4_K_M · 16.30125 GB · ~61 tok/s on NVIDIA A100 80GB |
| Qwen 3 — Qwen 3 14B | Q4_K_M · 8.935500000000001 GB · ~98 tok/s on NVIDIA A100 80GB |
| Qwen 3.5 (Legacy Listing — Unverified) — Qwen 3.5 72B | Q4_K_M · 43.47 GB · ~25 tok/s on NVIDIA A100 80GB |
| Qwen 3.7 — Qwen 3.7 35B-A3B | Q4_K_M · 21.13125 GB · ~221 tok/s on NVIDIA A100 80GB |
| Qwen 3.5 — Qwen 3.5 122B-A10B | Q4_K_M · 73.6575 GB · ~118 tok/s on NVIDIA A100 80GB |
| GLM-5 / GLM-5.1 — GLM-5.1 72B | Q4_K_M · 43.47 GB · ~25 tok/s on NVIDIA A100 80GB |
| Codestral — Codestral 22B | Q4_K_M · 13.40325 GB · ~71 tok/s on NVIDIA A100 80GB |
or compare on Vast.ai from $0.77/hr (typical low · varies)
As an Amazon Associate we earn from qualifying purchases. Cloud GPU links are referral links — we may earn a commission at no extra cost to you.
Qwen 2.5 Family, Qwen 2.5 Family, Llama 3.3, Qwen 3, DeepSeek R1 all fit in 80 GB VRAM.
NVIDIA A100 80GB, NVIDIA H100 80GB, AMD Ryzen AI Max+ 395, Apple M2 Max.