AirLLM: Kjør 70B-modeller på et 4GB grafikkort – med en viktig hake
AirLLM er et åpen kildekode Python-bibliotek som lar deg kjøre svært store språkmodeller på maskinvare som normalt ikke har nok VRAM til å laste dem. Prosjektet, startet av Gavin Li (tidligere AI-ingeniør hos Airbnb) i november 2023, har blitt stadig mer relevant i takt med at modellene vokser raskere enn forbruker-GPUer.
Slik fungerer trikset
I stedet for å laste hele modellen inn i GPU-minnet på én gang, laster AirLLM inn og kjører ett transformer-lag om gangen fra disk, lagrer mellomresultatet, og bytter så til neste lag. Det betyr at bare ett enkelt lag trenger å ligge i VRAM samtidig – resten venter på disken til det er dens tur. For MoE-modeller (mixture-of-experts) går triksene enda lenger: biblioteket streamer kun de spesifikke ekspertene et gitt token faktisk ruter til, ikke hele laget. Det er derfor Kimi K3 – med sine 2,8 billioner parametere – ifølge prosjektets egen dokumentasjon kan kjøres på under 4GB VRAM på et enkelt grafikkort.
Konkrete tall fra prosjektets egen dokumentasjon: Llama 3 70B på 4GB, Llama 3.1 405B på 8GB, og DeepSeek-V3 (671B) på rundt 12GB – alt uten kvantisering, som ellers er den vanlige måten å krympe modeller på bekostning av kvalitet.
Bakdelen råteksten ikke nevner: hastighet
Her er det viktig å være ærlig, siden dette er akkurat den typen ting du vil vite før du setter i gang på egen maskinvare. Denne teknikken handler om tilgang, ikke fart. Fordi data må flyttes frem og tilbake mellom disk og GPU for hvert eneste lag, er inferens mye tregere enn normal kjøring – reelle målinger varierer fra rundt 0,7 token per sekund på rask maskinvare til flere minutter per token på tregere oppsett. Dette er altså ikke noe for interaktiv chat i sanntid, men mer egnet til batch-jobber, eksperimentering og forskning der du kan la den stå og jobbe.
Du bør også regne med betydelig diskplass – rundt 130GB for en 70B-modell ved første nedlasting – og gjerne 16GB+ systemminne for mellomlagring.
Maskinvarestøtte
Biblioteket kjører på NVIDIA-GPUer fra 4GB VRAM og oppover, på ren CPU, og på Apple Silicon (M1 til M4, krever mlx-rammeverket). Det støtter modellfamilier som Llama, Qwen, Mistral, DeepSeek, Gemma, Phi og Kimi K3 gjennom et automatisk AutoModel-grensesnitt. Installasjon er som råteksten antyder: pip install airllm.
Konklusjon
AirLLM er ikke en erstatning for produksjonsverktøy som vLLM eller llama.cpp – det mangler blant annet strømming av svar og har begrenset verktøystøtte i noen integrasjoner. Men som et verktøy for å faktisk kunne teste og eksperimentere med modeller du ellers ikke ville hatt maskinvare til, er det et reelt og imponerende stykke ingeniørkunst. Se det som "kan jeg få den til å kjøre i det hele tatt", ikke "kan jeg bruke den daglig".
Ressurser
- AirLLM på PyPI – installasjon og oppdateringslogg
- AirLLM: Hype vs Reality – ærlig gjennomgang av styrker og svakheter