Start / Poradniki / Rozwiązywanie problemów / Windows
WindowsLinuxmacOS
Autor: Jakub Rusinowski · Ostatnia aktualizacja: 22 czerwca 2026
Edukator AI i prowadzący warsztaty z wdrażania lokalnych modeli LLM
Error: model requires more system memory (9.2 GiB) than is available (7.6 GiB)
Uruchamiasz ollama run <model>, a zamiast znaku zachęty dostajesz tę jedną linijkę i natychmiastowe wyjście. Najczęściej zdarza się to na maszynach z 8 i 16 GB, a zwłaszcza na laptopach, gdzie część RAM-u jest już zajęta.
Ollama robi przed załadowaniem szybką kontrolę: szacuje, ile pamięci zajmie model razem z kontekstem, i porównuje to z tym, co jest realnie wolne w tej chwili — a nie z całkowitą zainstalowaną pamięcią. Jeśli szacunek przekracza wolną pulę, program woli nie startować, niż zaciąć maszynę albo zostać ubitym przez OOM w połowie ładowania. Liczba w komunikacie to właśnie ten szacunek; rośnie wraz z rozmiarem modelu i długością kontekstu.
Większość modeli w Ollamie publikuje kilka rozmiarów i poziomów kwantyzacji jako tagi. Jeśli llama3.1 (domyślnie 8B) jest za ciężki, prawie zawsze znajdziesz rodzeństwo :1b lub :3b albo ostrzejszą kwantyzację w rodzaju :q4_0. Zejście do mniejszego tagu to najczystsze rozwiązanie i zostawia cię w tej samej rodzinie modeli. Zanim pobierzesz, sprawdź, co twoja maszyna faktycznie udźwignie — ściągniesz wtedy tylko raz.
# instead of the heavy default tag:
ollama run llama3.2:3b
# or pick a smaller quant of the model you want:
ollama run llama3.1:8b-instruct-q4_0Kontrola dotyczy pamięci *wolnej*, więc przeglądarka z czterdziestoma kartami albo inny model wciąż siedzący w pamięci potrafią przesądzić sprawę. Zamknij oczywistych winowajców, a jeśli poprzedni model Ollamy nadal jest załadowany — najpierw go wyładuj.
ollama ps # see what is currently loaded
ollama stop <model> # unload it to free memoryDuża alokacja kontekstu zawyża szacunek. Jeśli nie potrzebujesz ogromnego okna, ogranicz je — to potrafi sprowadzić wymaganie z powrotem poniżej twojej wolnej pamięci.
# set a smaller context for this run
OLLAMA_CONTEXT_LENGTH=2048 ollama run llama3.2:3bNa Linuksie możesz dać systemowi przestrzeń swap, żeby loader miał dokąd się przelać. Zadziała, ale gdy tylko sięgnie po dysk, zrobi się wolno — traktuj to jako prowizorkę, nie rozwiązanie. Trwała odpowiedź to wciąż model, który mieści się w prawdziwym RAM-ie.
Zupełnie nie. To znaczy, że akurat ten model jest za duży na twoją wolną pamięć. Są sprawne modele 1B–3B, które działają wygodnie na maszynach z 8 GB — wystarczy wybrać taki, który pasuje do twojego sprzętu.
Możesz obniżyć wymaganie: mniejszy tag, mniejszy kontekst, zwolniony RAM. Nie powinieneś natomiast obchodzić samej kontroli — istnieje po to, żeby model nie został ubity w połowie ładowania i żeby maszyna się nie zawiesiła. Zamiast omijać zabezpieczenie, zmniejsz wymaganie.
Komunikat porównuje z pamięcią wolną w danej chwili, a nie z zainstalowaną. System, aplikacje w tle i każdy już załadowany model zajmują część puli. Zamknięcie programów albo restart uwalnia jej więcej.