作者: Jakub Rusinowski · 最后更新: 2026年6月26日
These are the strongest local models that fit entirely in 64 GB of VRAM, ranked by capability, with the quantization level and estimated tokens/sec needed to fit.
| Qwen 2.5 Family — Qwen 2.5 72B Instruct | Q4_K_M · 43.47 GB · ~4 tok/s on Apple M5 Pro |
| Qwen 2.5 Family — Qwen 2.5 Coder 32B | Q4_K_M · 19.32 GB · ~8 tok/s on Apple M5 Pro |
| Llama 3.3 — Llama 3.3 70B Instruct | Q2_K_XS (Tight) · 20.212500000000002 GB · ~8 tok/s on Apple M5 Pro |
| Qwen 3 — Qwen 3 32B | Q4_K_M · 19.802999999999997 GB · ~8 tok/s on Apple M5 Pro |
| DeepSeek R1 — DeepSeek R1 Distill Qwen 32B | Q4_K_M · 19.32 GB · ~8 tok/s on Apple M5 Pro |
| Qwen 2.5 Family — Qwen 2.5 14B Instruct | Q4_K_M · 8.4525 GB · ~17 tok/s on Apple M5 Pro |
| Nemotron 70B — Nemotron 70B Instruct | Q4_K_M · 42.62475 GB · ~4 tok/s on Apple M5 Pro |
| Gemma 4 (Legacy Listing — Unverified) — Gemma 4 27B ⭐ | Q4_K_M · 16.30125 GB · ~10 tok/s on Apple M5 Pro |
| Qwen 3 — Qwen 3 14B | Q4_K_M · 8.935500000000001 GB · ~17 tok/s on Apple M5 Pro |
| Qwen 3.5 (Legacy Listing — Unverified) — Qwen 3.5 72B | Q4_K_M · 43.47 GB · ~4 tok/s on Apple M5 Pro |
| Qwen 3.7 — Qwen 3.7 35B-A3B | Q4_K_M · 21.13125 GB · ~52 tok/s on Apple M5 Pro |
| GLM-5 / GLM-5.1 — GLM-5.1 72B | Q4_K_M · 43.47 GB · ~4 tok/s on Apple M5 Pro |
| Codestral — Codestral 22B | Q4_K_M · 13.40325 GB · ~11 tok/s on Apple M5 Pro |
| Qwen 3.6 — Qwen 3.6 35B-A3B | Q4_K_M · 21.13125 GB · ~52 tok/s on Apple M5 Pro |
| DeepSeek R1 — DeepSeek R1 Distill Qwen 14B | Q4_K_M · 8.4525 GB · ~17 tok/s on Apple M5 Pro |
or compare on Vast.ai from $0.77/hr (typical low · varies)
As an Amazon Associate we earn from qualifying purchases. Cloud GPU links are referral links — we may earn a commission at no extra cost to you.
Qwen 2.5 Family, Qwen 2.5 Family, Llama 3.3, Qwen 3, DeepSeek R1 all fit in 64 GB VRAM.
Apple M5 Pro, Apple M3 Max, Apple M1 Max, NVIDIA A100 80GB.