1. Hvad Ollama gør

Ollama henter og kører AI-modeller på din computer. Når Ollama er startet, kan et lokalt program sende en opgave til API-adressen http://localhost:11434/api og modtage modellens svar.

Det betyder, at et program kan tilbyde AI-funktioner uden at vise en traditionel chatbot. Programmet kan eksempelvis sende en dikteret arbejdsnote til modellen og bruge svaret som et redigerbart forslag til arbejdsrapport, materialeliste eller kundemail.

En lokal model behandles på din computer. En cloudmodel behandles hos en ekstern tjeneste og kræver internetforbindelse samt tjenestens egne vilkår. De to driftsformer skal vælges og beskrives tydeligt i det enkelte program.

2. Windows, GPU og VRAM

Ollamas Windows-dokumentation angiver Windows 10 22H2 eller nyere. Ved NVIDIA-acceleration skal grafikkort og driver være understøttet; Ollamas GPU-dokumentation angiver NVIDIA compute capability 5.0 eller nyere og driver 531 eller nyere.

VRAM er grafikkortets egen hukommelse. En model skal helt eller delvist kunne være i GPU-hukommelsen for at få fuld GPU-acceleration. Større modeller og længere kontekst bruger mere hukommelse.

12 GB VRAM
Projektets anbefalede minimum til lokal AI.
Opdateret driver
Installer en aktuel NVIDIA-driver til kortet.
Ledig lagerplads
Modelfiler kan fylde mange gigabyte.

Kontrollér altid den konkrete programversions systemkrav. Et program kan vælge en anden model eller kontekst og dermed få andre krav.

3. Installer Ollama og hent en model

  1. Hent Ollama til Windows fra den officielle hjemmeside og gennemfør installationen.
  2. Åbn PowerShell eller Kommandoprompt.
  3. Kontrollér installationen med ollama --version.
  4. Hent en model. Projektets lokale standardmodel er aktuelt gemma3:12b.
  5. Start modellen og skriv en kort testbesked.
ollama --version
ollama pull gemma3:12b
ollama run gemma3:12b

Første download kan tage tid. Ollama gemmer som standard Windows-modeller i brugerens profil. Placeringen kan ændres med miljøvariablen OLLAMA_MODELS, hvis modellerne skal ligge på et andet drev.

4. Kontrollér at GPU'en bruges

NVIDIAs værktøj viser grafikkort, driver, belastning og hukommelsesforbrug:

nvidia-smi

Mens modellen kører, viser Ollama hvor modellen er placeret:

ollama ps

Se kolonnen PROCESSOR. 100% GPU betyder, at modellen er lagt helt på GPU'en. En kombination af CPU og GPU betyder, at arbejdet er fordelt, ofte fordi modellen eller den valgte kontekst kræver mere VRAM end tilgængeligt.

5. Test den lokale API

Ollamas lokale API kræver normalt ikke en API-nøgle. Følgende PowerShell-eksempel sender en enkelt opgave og beder om ét samlet svar:

$body = @{
    model = 'gemma3:12b'
    prompt = 'Svar kort på dansk: Forbindelsen virker.'
    stream = $false
} | ConvertTo-Json

Invoke-RestMethod `
    -Method Post `
    -Uri 'http://localhost:11434/api/generate' `
    -ContentType 'application/json' `
    -Body $body

Hvis modellen er hentet, returnerer Ollama et JSON-svar med blandt andet feltet response. Adressen bruger localhost, så forbindelsen bliver på den samme computer.

6. Sådan bruger programmerne Ollama

  1. Brugeren indtaster, indtaler eller importerer oplysninger i programmet.
  2. Programmet validerer data og sammensætter en afgrænset instruktion til modellen.
  3. Programmet sender instruktionen til Ollamas lokale API.
  4. Ollama kører den valgte model på CPU/GPU og returnerer et svar.
  5. Programmet strukturerer svaret og viser det som et forslag, der kan kontrolleres og redigeres af brugeren.

7. Lokal behandling og sikkerhed

Lokal modelkørsel kan holde selve AI-behandlingen på computeren, men det gør ikke automatisk hele programmet privat. Et program kan stadig bruge andre netværkstjenester, opdateringskontrol eller cloudfunktioner. Læs derfor altid dokumentationen til den konkrete programversion.

8. Almindelig fejlfinding

ProblemKontrol
ollama genkendes ikkeLuk og åbn terminalen efter installationen. Kontrollér derefter installationen og Windows PATH.
Modellen findes ikkeKør ollama list og hent det præcise modelnavn med ollama pull modelnavn.
AI'en svarer meget langsomtKør ollama ps. CPU-brug eller delvis GPU-placering kan indikere utilstrækkelig VRAM til model og kontekst.
GPU'en registreres ikkeKør nvidia-smi, kontrollér driveren, og sammenhold grafikkortet med Ollamas officielle GPU-liste.
API-forbindelsen afvisesKontrollér at Ollama kører, og at programmet bruger http://localhost:11434.
Disken er ved at være fuldBrug ollama list til overblik, og fjern kun modeller, du ikke skal bruge.

Officielle Ollama-kilder