Ile pamięci VRAM potrzebujesz, aby uruchamiać modele LLM lokalnie?

Główne pytanie przy uruchamianiu lokalnego modelu LLM jest proste: czy zmieści się w Twoim GPU? Odpowiedź zależy od rozmiaru modelu, kwantyzacji i długości kontekstu. Ten przewodnik daje praktyczny punkt wyjścia do wyboru odpowiedniej ilości pamięci VRAM.

Jak kwantyzacja wpływa na VRAM

Kwantyzacja zmniejsza precyzję używaną do przechowywania wag modelu. Kwantyzacja o niższej liczbie bitów sprawia, że model jest mniejszy i zużywa mniej VRAM, ale wiąże się to z pewną utratą jakości.

Kwantyzacja Bity na wagę Typowe zastosowanie
Q8_0 8 Bardzo wysoka jakość
Q6_K ~6.6 Bardzo dobra jakość
Q5_K_M ~5.5 Dobra jakość i rozmiar
Q4_K_M ~4.5 Dobry kompromis między rozmiarem a jakością
Q3_K_M ~3.5 Niższe zużycie VRAM, większa utrata jakości

Q4_K_M to częsty wybór, gdy VRAM jest ograniczona. Jeśli masz więcej dostępnej pamięci VRAM, Q5 lub Q6 pozwala uruchomić ten sam model z mniejszą kwantyzacją.

Przybliżone zapotrzebowanie na VRAM według rozmiaru modelu

To są orientacyjne szacunki dla wag modelu. Rzeczywista ilość wymaganej pamięci VRAM jest większa, ponieważ środowisko uruchomieniowe, pamięć podręczna KV i kontekst również zajmują pamięć.

Rozmiar modelu Q8_0 Q6_K Q4_K_M Q3_K_M
4B ~5 GB ~4 GB ~3 GB ~2,5 GB
8B ~9 GB ~7 GB ~5,5 GB ~4,5 GB
12B ~13 GB ~10 GB ~8 GB ~6,5 GB
14B ~16 GB ~12 GB ~9 GB ~7,5 GB
27B ~30 GB ~22 GB ~17 GB ~13 GB
32B ~36 GB ~27 GB ~20 GB ~16 GB
70B ~80 GB ~60 GB ~42 GB ~34 GB

To są szacunki, a nie sztywne limity. Różne architektury modeli i formaty kwantyzacji mogą zmienić rzeczywisty rozmiar.

Co mogą uruchomić różne ilości VRAM

VRAM Praktyczny zakres Aktualne przykłady
8 GB Małe modele około 4B do 9B Gemma 4 E4B, Qwen3.5 9B
12 GB Małe i średnie modele około 9B do 14B Gemma 4 12B, Qwen3.5 9B
16 GB 12B do 27B przy niższej kwantyzacji Gemma 4 26B-A4B, Qwen3.6 27B w Q4
24 GB 27B do 35B w Q4 do Q6 Qwen3.8 27B, Gemma 4 31B
32 GB 27B do 35B przy wyższej kwantyzacji Qwen3.8 27B, Gemma 4 31B
48 GB Duże modele gęste przy niższej kwantyzacji Modele klasy 70B w Q3 do Q4
80 GB Duże modele gęste przy wyższej kwantyzacji Modele klasy 70B w Q4 do Q6

Te zakresy dotyczą modeli, których wagi mogą zmieścić się na GPU. Duże modele MoE są inne: tylko część ich parametrów jest aktywna dla każdego tokena, ale model nadal musi przechowywać pełny zestaw wag. Model o łącznej liczbie 100B lub więcej parametrów nie zmieści się zatem w budżecie VRAM o wielkości 100B tylko dlatego, że ma mniej aktywnych parametrów.

Modele MoE

Modele typu Mixture-of-Experts zawierają wiele grup parametrów zwanych ekspertami. Dla każdego tokena używana jest tylko część ekspertów, co może sprawić, że wnioskowanie będzie bardziej wydajne niż w przypadku modelu gęstego o tej samej łącznej liczbie parametrów.

Jednak nieaktywni eksperci nadal są częścią modelu. Duże modele MoE mogą zatem wymagać znacznie więcej pamięci, niż sugeruje liczba ich aktywnych parametrów. Bardzo duże modele mogą potrzebować wielu GPU lub przeniesienia części obliczeń do pamięci RAM systemu.

Długość kontekstu również zużywa VRAM

Wagi modelu to tylko część zapotrzebowania na pamięć. Pamięć podręczna KV rośnie wraz z wydłużaniem się kontekstu, więc uruchomienie tego samego modelu przy kontekście 64K może wymagać znacznie więcej VRAM niż przy 4K.

  • Dłuższy kontekst wymaga więcej VRAM.
  • Precyzja pamięci podręcznej KV wpływa na zużycie pamięci.
  • Rozmiar partii i równocześni użytkownicy również zwiększają zużycie pamięci.
  • Pozostaw trochę VRAM dostępnej dla środowiska uruchomieniowego zamiast całkowicie zapełniać GPU wagami modelu.

Praktyczne wskazówki

  • Sprawdź rzeczywisty rozmiar skwantyzowanego modelu, który chcesz uruchomić.
  • Nie traktuj rozmiaru pliku modelu jako dokładnego zapotrzebowania na VRAM. Zostaw miejsce na pamięć podręczną KV i środowisko uruchomieniowe.
  • Jeśli model nie mieści się w całości w VRAM, część można przenieść do pamięci RAM systemu, ale wnioskowanie będzie zwykle wolniejsze.
  • W przypadku długich kontekstów lub obciążeń agentowych zaplanuj więcej VRAM, niż wymagają same wagi modelu.
  • Wiele GPU może podzielić model, gdy jedno GPU nie ma wystarczającej ilości VRAM.

Uruchom to na DaDesktop

Nie musisz kupować GPU, aby uruchomić lokalny model LLM. DaDesktop zapewnia pulpit w chmurze z potrzebną ilością VRAM, dzięki czemu możesz uruchomić model bezpośrednio bez posiadania sprzętu.

Wybierz poziom VRAM pasujący do Twojego modelu, załaduj go i zacznij go używać. Bez konfiguracji, bez zakupu sprzętu, bez problemów ze sterownikami. Zobacz dostępne GPU, aby poznać opcje.