Start / Poradniki / Rozwiązywanie problemów / Windows
WindowsLinuxmacOS
Autor: Jakub Rusinowski · Ostatnia aktualizacja: 22 czerwca 2026
Edukator AI i prowadzący warsztaty z wdrażania lokalnych modeli LLM
Which GGUF quant should I download?
Znalazłeś model na Hugging Face, a w repozytorium czeka kilkanaście plików .gguf: Q2_K, Q3_K_M, Q4_K_M, Q5_K_M, Q6_K, Q8_0 i jeszcze kilka. Rozmiary od malutkich po ogromne, a nazwy na razie nic ci nie mówią. Chcesz tylko wiedzieć, w który kliknąć.
Kwantyzacja mówi, jak mocno skompresowano wagi modelu. Niższe liczby (Q2, Q3) dają pliki mniejsze i szybsze, ale mniej dokładne; wyższe (Q6, Q8) są bliższe oryginałowi, lecz większe i głodniejsze VRAM-u. Nie ma jednego „najlepszego” pliku — właściwa kwantyzacja to największa taka, która zmieści się na twoim sprzęcie z zapasem na kontekst. Pytanie „która kwantyzacja?” jest więc w istocie pytaniem „ile mam VRAM-u?”.
Reguła jest prosta: bierz najwyższą kwantyzację, jaką karta pomieści, zostawiając trochę zapasu na kontekst. U większości osób wypada to na Q4_K_M — to społecznościowy złoty środek, dość mały, by zmieścić się na typowych kartach, i dość bliski pełnej precyzji, byś nie zauważył różnicy przy czacie, kodowaniu czy streszczaniu. Wyżej (Q5_K_M, Q6_K) idź tylko wtedy, gdy masz zapas VRAM-u; niżej (Q3, Q2) — tylko gdy Q4 się nie mieści. Najszybciej trafisz we właściwy plik, sprawdzając, która kwantyzacja twojego modelu pasuje do twojej konkretnej karty.
Q8_0 — praktycznie bezstratna, duża, tylko przy sporym zapasie VRAM-u. Q6_K — znakomita jakość, sensowny krok w dół. Q5_K_M — wysoka jakość przy umiarkowanym rozmiarze. Q4_K_M — zalecany domyślny wybór; najlepszy balans dla większości zestawów. Q3_K_M — zauważalnie miększa, na ciasną pamięć. Q2_K — najmniejsza, z wyraźną stratą jakości; ostateczność. Warianty _K_M to nowoczesne k-kwanty i przy tym samym rozmiarze biją dawny styl Q4_0.
Zwykły czat dobrze znosi niższe kwantyzacje. Kodowanie, ustrukturyzowane wyjście i zadania wymagające precyzji zyskują na Q5 albo Q6, jeśli tylko się zmieszczą. Gdy obie kwantyzacje wchodzą, przy wymagającej pracy bezpieczniej wybrać większą.
Q4_K_M. To społecznościowy domyślny wybór, bo godzi rozmiar, szybkość i jakość — mieści się na popularnych kartach i przy codziennym użyciu jest bardzo blisko pełnego modelu. Wyżej wchodź tylko wtedy, gdy masz zapas VRAM-u.
Obie są mniej więcej czterobitowe, ale k-kwanty _K_M mądrzej rozkładają precyzję w całym modelu, dając lepszą jakość przy zbliżonym rozmiarze. Gdy masz wybór, bierz warianty _K_M.
Często tak — większy model w Q4 zwykle wygrywa ze znacznie mniejszym w Q8 o podobnym rozmiarze pliku. Ale oba muszą zmieścić się w twoim VRAM-ie z miejscem na kontekst, i to jest realne ograniczenie, które trzeba sprawdzić najpierw.
Porównaj rozmiar pliku i zapotrzebowanie modelu na pamięć ze swoim VRAM-em, zostawiając zapas na cache KV. Zamiast zgadywać po rozmiarach plików, zestaw swoją kartę z modelem i sprawdź, które kwantyzacje wchodzą.