Ile pamięci VRAM potrzebujesz, aby uruchamiać modele LLM lokalnie?
Główne pytanie przy uruchamianiu lokalnego modelu LLM jest proste: czy zmieści się w Twoim GPU? Odpowiedź zależy od rozmiaru modelu, kwantyzacji i długości kontekstu. Ten przewodnik daje praktyczny punkt wyjścia do wyboru odpowiedniej ilości pamięci VRAM.
Jak kwantyzacja wpływa na VRAM
Kwantyzacja zmniejsza precyzję używaną do przechowywania wag modelu. Kwantyzacja o niższej liczbie bitów sprawia, że model jest mniejszy i zużywa mniej VRAM, ale wiąże się to z pewną utratą jakości.
| Kwantyzacja | Bity na wagę | Typowe zastosowanie |
|---|---|---|
| Q8_0 | 8 | Bardzo wysoka jakość |
| Q6_K | ~6.6 | Bardzo dobra jakość |
| Q5_K_M | ~5.5 | Dobra jakość i rozmiar |
| Q4_K_M | ~4.5 | Dobry kompromis między rozmiarem a jakością |
| Q3_K_M | ~3.5 | Niższe zużycie VRAM, większa utrata jakości |
Q4_K_M to częsty wybór, gdy VRAM jest ograniczona. Jeśli masz więcej dostępnej pamięci VRAM, Q5 lub Q6 pozwala uruchomić ten sam model z mniejszą kwantyzacją.
Przybliżone zapotrzebowanie na VRAM według rozmiaru modelu
To są orientacyjne szacunki dla wag modelu. Rzeczywista ilość wymaganej pamięci VRAM jest większa, ponieważ środowisko uruchomieniowe, pamięć podręczna KV i kontekst również zajmują pamięć.
| Rozmiar modelu | Q8_0 | Q6_K | Q4_K_M | Q3_K_M |
|---|---|---|---|---|
| 4B | ~5 GB | ~4 GB | ~3 GB | ~2,5 GB |
| 8B | ~9 GB | ~7 GB | ~5,5 GB | ~4,5 GB |
| 12B | ~13 GB | ~10 GB | ~8 GB | ~6,5 GB |
| 14B | ~16 GB | ~12 GB | ~9 GB | ~7,5 GB |
| 27B | ~30 GB | ~22 GB | ~17 GB | ~13 GB |
| 32B | ~36 GB | ~27 GB | ~20 GB | ~16 GB |
| 70B | ~80 GB | ~60 GB | ~42 GB | ~34 GB |
To są szacunki, a nie sztywne limity. Różne architektury modeli i formaty kwantyzacji mogą zmienić rzeczywisty rozmiar.
Co mogą uruchomić różne ilości VRAM
| VRAM | Praktyczny zakres | Aktualne przykłady |
|---|---|---|
| 8 GB | Małe modele około 4B do 9B | Gemma 4 E4B, Qwen3.5 9B |
| 12 GB | Małe i średnie modele około 9B do 14B | Gemma 4 12B, Qwen3.5 9B |
| 16 GB | 12B do 27B przy niższej kwantyzacji | Gemma 4 26B-A4B, Qwen3.6 27B w Q4 |
| 24 GB | 27B do 35B w Q4 do Q6 | Qwen3.8 27B, Gemma 4 31B |
| 32 GB | 27B do 35B przy wyższej kwantyzacji | Qwen3.8 27B, Gemma 4 31B |
| 48 GB | Duże modele gęste przy niższej kwantyzacji | Modele klasy 70B w Q3 do Q4 |
| 80 GB | Duże modele gęste przy wyższej kwantyzacji | Modele klasy 70B w Q4 do Q6 |
Te zakresy dotyczą modeli, których wagi mogą zmieścić się na GPU. Duże modele MoE są inne: tylko część ich parametrów jest aktywna dla każdego tokena, ale model nadal musi przechowywać pełny zestaw wag. Model o łącznej liczbie 100B lub więcej parametrów nie zmieści się zatem w budżecie VRAM o wielkości 100B tylko dlatego, że ma mniej aktywnych parametrów.
Modele MoE
Modele typu Mixture-of-Experts zawierają wiele grup parametrów zwanych ekspertami. Dla każdego tokena używana jest tylko część ekspertów, co może sprawić, że wnioskowanie będzie bardziej wydajne niż w przypadku modelu gęstego o tej samej łącznej liczbie parametrów.
Jednak nieaktywni eksperci nadal są częścią modelu. Duże modele MoE mogą zatem wymagać znacznie więcej pamięci, niż sugeruje liczba ich aktywnych parametrów. Bardzo duże modele mogą potrzebować wielu GPU lub przeniesienia części obliczeń do pamięci RAM systemu.
Długość kontekstu również zużywa VRAM
Wagi modelu to tylko część zapotrzebowania na pamięć. Pamięć podręczna KV rośnie wraz z wydłużaniem się kontekstu, więc uruchomienie tego samego modelu przy kontekście 64K może wymagać znacznie więcej VRAM niż przy 4K.
- Dłuższy kontekst wymaga więcej VRAM.
- Precyzja pamięci podręcznej KV wpływa na zużycie pamięci.
- Rozmiar partii i równocześni użytkownicy również zwiększają zużycie pamięci.
- Pozostaw trochę VRAM dostępnej dla środowiska uruchomieniowego zamiast całkowicie zapełniać GPU wagami modelu.
Praktyczne wskazówki
- Sprawdź rzeczywisty rozmiar skwantyzowanego modelu, który chcesz uruchomić.
- Nie traktuj rozmiaru pliku modelu jako dokładnego zapotrzebowania na VRAM. Zostaw miejsce na pamięć podręczną KV i środowisko uruchomieniowe.
- Jeśli model nie mieści się w całości w VRAM, część można przenieść do pamięci RAM systemu, ale wnioskowanie będzie zwykle wolniejsze.
- W przypadku długich kontekstów lub obciążeń agentowych zaplanuj więcej VRAM, niż wymagają same wagi modelu.
- Wiele GPU może podzielić model, gdy jedno GPU nie ma wystarczającej ilości VRAM.
Uruchom to na DaDesktop
Nie musisz kupować GPU, aby uruchomić lokalny model LLM. DaDesktop zapewnia pulpit w chmurze z potrzebną ilością VRAM, dzięki czemu możesz uruchomić model bezpośrednio bez posiadania sprzętu.
Wybierz poziom VRAM pasujący do Twojego modelu, załaduj go i zacznij go używać. Bez konfiguracji, bez zakupu sprzętu, bez problemów ze sterownikami. Zobacz dostępne GPU, aby poznać opcje.