Autor: Jakub Rusinowski · Ostatnia aktualizacja: 24 kwietnia 2026
Wydanie zapowiadające DeepSeek z 24 kwietnia 2026, na licencji MIT, z oknem kontekstu 1 mln tokenów. V4-Pro (1,6T łącznie / 49B aktywnych) jest wyłącznie klasy serwerowej — nie da się go uruchomić na sprzęcie konsumenckim nawet przy mocnej kwantyzacji. V4-Flash (284B łącznie / 13B aktywnych) mieści się w klasie stacji roboczych, ale wsparcie lokalne wciąż jest w toku: na czerwiec 2026 llama.cpp nie ma scalonego wsparcia w gałęzi głównej (tylko eksperymentalne forki), a wpisy w Ollama zdają się kierować do wnioskowania w chmurze zamiast do prawdziwego pobrania lokalnego. DeepSeek R2 na 15 czerwca 2026 pozostaje niewydany i plotkowany, dlatego celowo go tu nie ma.
| Licence | What it permits | Applies to |
|---|---|---|
MIT | Commercial use permitted Commercial use permitted. No usage restrictions beyond attribution. | DeepSeek V4-Flash, DeepSeek V4-Pro |
| DeepSeek V4-Flash | Min 172 GB VRAM · Q4 (experimental) · 1,000,000 ctx · ollama run deepseek-v4-flash (cloud-hosted on Ollama; local = WIP llama.cpp forks only) |
| DeepSeek V4-Pro | Min 967 GB VRAM · Q2 (experimental, datacenter only) · 1,000,000 ctx · |
The cheapest GPU that runs DeepSeek V4 locally (min 172 GB VRAM) is the Apple M2 Ultra (192 GB).
Install Ollama then run: ollama run deepseek-v4-flash (cloud-hosted on Ollama; local = WIP llama.cpp forks only)
Minimum VRAM: 172 GB. For best results use Q4_K_M quantization.
DeepSeek V4 needs about 172 GB VRAM at Q4 (experimental) quantization for its smallest variant. Variants: DeepSeek V4-Flash (172 GB, Q4 (experimental)); DeepSeek V4-Pro (967 GB, Q2 (experimental, datacenter only)). On Apple Silicon, unified memory counts toward this requirement.
DeepSeek V4's smallest variant needs about 172 GB, which exceeds a single RTX 4090 (24 GB). Use multiple GPUs, a higher-VRAM card, or Apple Silicon with large unified memory.
Q4_K_M is the best balance of quality and VRAM for DeepSeek V4 in most cases. Choose Q8_0 for near-lossless quality if you have spare VRAM, or smaller quants (Q3/Q2) only when memory is tight.
Install Ollama, then run: ollama run deepseek-v4-flash (cloud-hosted on Ollama; local = WIP llama.cpp forks only). This downloads DeepSeek V4 and starts a local, OpenAI-compatible endpoint — no internet connection is needed after the initial download.