Norsk guide til Ollama: installer LLM-modeller som Llama 3 og Mistral lokalt på Windows og Mac. Krav til RAM og GPU, bruksscenarier og Open WebUI.
Innhold i artikkelen (7)
Hvorfor kjøre AI lokalt?
Skybaserte AI-tjenester som ChatGPT og Claude er kraftige, men de kommer med noen viktige begrensninger: all tekst du skriver sendes til servere i USA, du betaler månedlig abonnement, og du er avhengig av internettforbindelse. For mange norske brukere — særlig i helsevesenet, advokatbransjen, og offentlig sektor — er dette problematisk.
Ollama er et gratis, åpen kildekode-verktøy som lar deg laste ned og kjøre store språkmodeller (LLM-er) direkte på din egen PC eller Mac. Ingenting forlater maskinen din. Du kan bruke AI til å analysere sensitive dokumenter, skrive kode, oversette tekst og svare på spørsmål — helt offline, helt privat, helt gratis.

Hvilken hardware trenger du?
Størrelsen på modellen du kan kjøre avhenger primært av tilgjengelig RAM og GPU-minne (VRAM). Tommelfingerregel: en 7-milliarders parameter-modell krever ca. 8 GB RAM, en 13B-modell ca. 16 GB, og en 70B-modell ca. 48 GB eller en kraftig GPU.
GPU-akselerasjon er sterkt anbefalt for god ytelse. Nvidia GPU-er (RTX 3060 og nyere) fungerer best takket være CUDA-støtte. AMD GPU-er støttes via ROCm på Linux. Apple Silicon (M1/M2/M3/M4) er spesielt effektivt fordi minnearkitekturen deles mellom CPU og GPU, noe som gir svært god ytelse selv på MacBook Air.
- Minimumskonfigurasjon (7B modeller): 8 GB RAM, moderne CPU. Treg, men fungerer.
- Anbefalt konfigurasjon (13B modeller): 16 GB RAM, Nvidia RTX 3060 (12 GB VRAM) eller Apple M2.
- Kraftig konfigurasjon (34B modeller): 32 GB RAM, Nvidia RTX 4090 (24 GB VRAM) eller Apple M2 Max/Ultra.
- Serveroppsett (70B modeller): 64+ GB RAM, Nvidia RTX 4090 eller bedre, eventuelt to GPU-er.
Installasjon på Windows og Mac
Installasjon av Ollama er overraskende enkelt. På Windows: last ned installer fra ollama.com, kjør den, og Ollama starter som en bakgrunnstjeneste. På macOS: last ned .dmg-filen, dra til Applications-mappen, og start. På begge plattformer får du tilgang til Ollama via kommandolinjen.
Første modell lastes ned med kommandoen: ollama pull llama3. Dette laster ned Metas Llama 3 8B-modell (ca. 4,7 GB). Deretter kan du starte en chat direkte i terminalen med: ollama run llama3. Modellen lastes inn i RAM og kjører lokalt — ingen internett kreves.
- ollama pull llama3 — Last ned Meta Llama 3 8B (anbefalt startmodell)
- ollama pull mistral — Last ned Mistral 7B (sterk på europeiske språk)
- ollama pull gemma2 — Last ned Googles Gemma 2 9B
- ollama pull phi3 — Last ned Microsofts Phi-3 Mini (god ytelse, lite størrelse)
- ollama pull qwen2 — Last ned Alibabas Qwen 2 (sterk på koding)
- ollama list — Se alle nedlastede modeller
Ytelse og modellsammenligning
Tokens per sekund på en typisk norsk stasjonær PC med RTX 4070 (12 GB VRAM):
Open WebUI — ChatGPT-lignende grensesnitt
Å chatte i terminalen er upraktisk for daglig bruk. Open WebUI (tidligere Ollama WebUI) gir deg et fullverdig nettleserbasert grensesnitt som likner veldig på ChatGPT — komplett med samtalehistorikk, modellbytte, og støtte for filopplasting.
Enkleste måte å installere Open WebUI på er via Docker: docker run -d -p 3000:80 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data ghcr.io/open-webui/open-webui:main. Deretter åpner du nettleseren på localhost:3000 og har et komplett AI-grensesnitt. Open WebUI støtter også OpenAI-kompatible API-er, så du kan bytte mellom lokale Ollama-modeller og Claude/GPT-4 via API-nøkkel i samme grensesnitt.
Norske bruksscenarier
Lokal AI passer spesielt godt for norske aktører i regulerte bransjer. Et advokatkontor kan analysere kontrakter og juridiske dokumenter uten å sende klientdata til USA. En lege kan bruke AI til å formulere pasientnotater uten GDPR-bekymringer. En norsk forsvarsleverandør kan bruke kodeassistanse uten risiko for at proprietær kode lekker.
For privat bruk er lokal AI utmerket for å oversette norske dialekter og tekster (Llama 3 og Mistral har god norsk-forståelse), skrive e-poster og rapporter, hjelpe med koding i Python og JavaScript, og lage sammendrag av lange PDF-dokumenter. Med Open WebUI kan du laste opp PDF-er direkte for analyse.
Begrensninger og når du bør velge sky
Lokale modeller er ikke like kraftige som GPT-4o eller Claude 3.5 Sonnet på komplekse resonneringsoppgaver. En 7B-modell lokalt tilsvarer omtrent GPT-3.5 i kvalitet — svært brukbar for de fleste oppgaver, men ikke toppnivå. For avansert analyse, forskning og krevende kreativt arbeid vil skymodellene fortsatt gi bedre resultater i 2025.
Oppstart tar tid — første gang en modell lastes inn i RAM tar det 5–15 sekunder. Og maskinen din bruker mer strøm og kan bli varm under kjøring. På bærbare PC-er uten dedikert GPU er ytelsen begrenset. Men for mange norske brukere er byttet fra sky til lokal fullt akseptabelt — og besparelsen på abonnementskostnader (2 640 kr/år for Claude Pro) er et argument i seg selv.






