Norsk guide til Ollama: installer LLM-modeller som Llama 3 og Mistral lokalt på Windows og Mac. Krav til RAM og GPU, bruksscenarier og Open WebUI.

Innhold i artikkelen (7)
  1. Hvorfor kjøre AI lokalt?
  2. Hvilken hardware trenger du?
  3. Installasjon på Windows og Mac
  4. Ytelse og modellsammenligning
  5. Open WebUI — ChatGPT-lignende grensesnitt
  6. Norske bruksscenarier
  7. Begrensninger og når du bør velge sky

Hvorfor kjøre AI lokalt?

Skybaserte AI-tjenester som ChatGPT og Claude er kraftige, men de kommer med noen viktige begrensninger: all tekst du skriver sendes til servere i USA, du betaler månedlig abonnement, og du er avhengig av internettforbindelse. For mange norske brukere — særlig i helsevesenet, advokatbransjen, og offentlig sektor — er dette problematisk.

Ollama er et gratis, åpen kildekode-verktøy som lar deg laste ned og kjøre store språkmodeller (LLM-er) direkte på din egen PC eller Mac. Ingenting forlater maskinen din. Du kan bruke AI til å analysere sensitive dokumenter, skrive kode, oversette tekst og svare på spørsmål — helt offline, helt privat, helt gratis.

Lokal AI betyr full kontroll over data og ingen månedlige abonnementskostnader.
Lokal AI betyr full kontroll over data og ingen månedlige abonnementskostnader.

Hvilken hardware trenger du?

Størrelsen på modellen du kan kjøre avhenger primært av tilgjengelig RAM og GPU-minne (VRAM). Tommelfingerregel: en 7-milliarders parameter-modell krever ca. 8 GB RAM, en 13B-modell ca. 16 GB, og en 70B-modell ca. 48 GB eller en kraftig GPU.

GPU-akselerasjon er sterkt anbefalt for god ytelse. Nvidia GPU-er (RTX 3060 og nyere) fungerer best takket være CUDA-støtte. AMD GPU-er støttes via ROCm på Linux. Apple Silicon (M1/M2/M3/M4) er spesielt effektivt fordi minnearkitekturen deles mellom CPU og GPU, noe som gir svært god ytelse selv på MacBook Air.

  • Minimumskonfigurasjon (7B modeller): 8 GB RAM, moderne CPU. Treg, men fungerer.
  • Anbefalt konfigurasjon (13B modeller): 16 GB RAM, Nvidia RTX 3060 (12 GB VRAM) eller Apple M2.
  • Kraftig konfigurasjon (34B modeller): 32 GB RAM, Nvidia RTX 4090 (24 GB VRAM) eller Apple M2 Max/Ultra.
  • Serveroppsett (70B modeller): 64+ GB RAM, Nvidia RTX 4090 eller bedre, eventuelt to GPU-er.
Annonse

Installasjon på Windows og Mac

Installasjon av Ollama er overraskende enkelt. På Windows: last ned installer fra ollama.com, kjør den, og Ollama starter som en bakgrunnstjeneste. På macOS: last ned .dmg-filen, dra til Applications-mappen, og start. På begge plattformer får du tilgang til Ollama via kommandolinjen.

Første modell lastes ned med kommandoen: ollama pull llama3. Dette laster ned Metas Llama 3 8B-modell (ca. 4,7 GB). Deretter kan du starte en chat direkte i terminalen med: ollama run llama3. Modellen lastes inn i RAM og kjører lokalt — ingen internett kreves.

  • ollama pull llama3 — Last ned Meta Llama 3 8B (anbefalt startmodell)
  • ollama pull mistral — Last ned Mistral 7B (sterk på europeiske språk)
  • ollama pull gemma2 — Last ned Googles Gemma 2 9B
  • ollama pull phi3 — Last ned Microsofts Phi-3 Mini (god ytelse, lite størrelse)
  • ollama pull qwen2 — Last ned Alibabas Qwen 2 (sterk på koding)
  • ollama list — Se alle nedlastede modeller

Ytelse og modellsammenligning

Tokens per sekund på en typisk norsk stasjonær PC med RTX 4070 (12 GB VRAM):

Annonse

Open WebUI — ChatGPT-lignende grensesnitt

Å chatte i terminalen er upraktisk for daglig bruk. Open WebUI (tidligere Ollama WebUI) gir deg et fullverdig nettleserbasert grensesnitt som likner veldig på ChatGPT — komplett med samtalehistorikk, modellbytte, og støtte for filopplasting.

Enkleste måte å installere Open WebUI på er via Docker: docker run -d -p 3000:80 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data ghcr.io/open-webui/open-webui:main. Deretter åpner du nettleseren på localhost:3000 og har et komplett AI-grensesnitt. Open WebUI støtter også OpenAI-kompatible API-er, så du kan bytte mellom lokale Ollama-modeller og Claude/GPT-4 via API-nøkkel i samme grensesnitt.

Norske bruksscenarier

Lokal AI passer spesielt godt for norske aktører i regulerte bransjer. Et advokatkontor kan analysere kontrakter og juridiske dokumenter uten å sende klientdata til USA. En lege kan bruke AI til å formulere pasientnotater uten GDPR-bekymringer. En norsk forsvarsleverandør kan bruke kodeassistanse uten risiko for at proprietær kode lekker.

For privat bruk er lokal AI utmerket for å oversette norske dialekter og tekster (Llama 3 og Mistral har god norsk-forståelse), skrive e-poster og rapporter, hjelpe med koding i Python og JavaScript, og lage sammendrag av lange PDF-dokumenter. Med Open WebUI kan du laste opp PDF-er direkte for analyse.

Begrensninger og når du bør velge sky

Lokale modeller er ikke like kraftige som GPT-4o eller Claude 3.5 Sonnet på komplekse resonneringsoppgaver. En 7B-modell lokalt tilsvarer omtrent GPT-3.5 i kvalitet — svært brukbar for de fleste oppgaver, men ikke toppnivå. For avansert analyse, forskning og krevende kreativt arbeid vil skymodellene fortsatt gi bedre resultater i 2025.

Oppstart tar tid — første gang en modell lastes inn i RAM tar det 5–15 sekunder. Og maskinen din bruker mer strøm og kan bli varm under kjøring. På bærbare PC-er uten dedikert GPU er ytelsen begrenset. Men for mange norske brukere er byttet fra sky til lokal fullt akseptabelt — og besparelsen på abonnementskostnader (2 640 kr/år for Claude Pro) er et argument i seg selv.

Annonse

Emner

Olav Sie Rotvær
Skrevet avOlav Sie RotværSkribent og utvikler

Olav Sie Rotvær skriver og drifter Norsk Næring. Han er utvikler, ikke journalist, og har ingen fagutdanning innenfor teknologi & innovasjon. Artiklene bygger derfor på primærkilder som oppgis der påstanden gjøres.

Om forfatteren og hvordan artiklene kildebelegges →