# AI muistitikulla: Llama ja Qwen paikallisesti käynnissä

_2026-03-07_

> Kuinka ajaa LLM paikallisesti omalla laitteistolla. Llama 3, Qwen 2.5/3, ollama, llama.cpp, GGUF-kvantisointi. Kannettava asennus muistitikulle.

tech

2026-03-07

Pilvipohjaiset API:t ovat käteviä. Niin kauan kuin sinulla on internet, rahaa tilaukseen ja hyväksyt sen, että joku muu lukee jokaisen kehotteen. Jos yksikin kohta ei sovi – tervetuloa paikalliseen inferenssiin.

## Miksi ylipäätään

Neljä syytä ajaa LLM:ää omalla laitteistolla:

- **Yksityisyys.** Tiedot eivät poistu koneelta. Ei telemetriaa, ei lokitietoja vieraalla palvelimella. Kehote elää ja kuolee sinun luonasi.
- **Offline.** Lentokone, juna, bunkkeri ilman wifiä – malli toimii. Internetiä ei tarvita missään vaiheessa latauksen jälkeen.
- **Ilmainen.** Nolla dollaria tokenilta. Ikuisesti. Ainoa investointi on laitteisto, joka sinulla jo on.
- **Ilman sensuuria.** Paikallinen malli vastaa siihen, mihin se vastaa. Ilman yrityssuodattimia, ilman "I cannot help with that".

## Työkalut

Kaksi vaihtoehtoa. Molemmat toimivat, valinta riippuu siitä, kuinka paljon haluat hallita prosessia.

**llama.cpp** – inferenssimoottori puhtaalla C/C++:lla. Toimii CPU:lla, valinnaisesti GPU:lla (CUDA, Metal, Vulkan). Ei riippuvuuksia, ei Pythonia. Kääntö – käynnistys. Tukee GGUF-muotoa, josta on tullut kvantisoitujen mallien standardi.

**Ollama** – kääre llama.cpp:n ympärillä ihmisläheisellä käyttöliittymällä. Lataa malleja yhdellä komennolla, hallitsee niitä, tarjoaa API:n. Jos et halua säätää kääntämisen ja konfiguraatioiden kanssa – tämä on sinun vaihtoehtosi.

```
# Ollaman asennus (Linux/macOS)
curl -fsSL https://ollama.com/install.sh | sh

# Tai lataa binääri osoitteesta https://ollama.com/download
```

## Mallit

Kaksi perhettä, joita todella kannattaa ajaa paikallisesti vuonna 2026:

**Llama 3.x** (Meta) – työjuhta. Hyvä englanniksi, kohtalainen venäjäksi. 8B parametria – mahtuu 8GB RAM:iin. Saatavilla versiot 70B ja 405B niille, joilla on kunnon laitteisto.

**Qwen 2.5 / Qwen 3** (Alibaba) – paras valinta monikielisiin tehtäviin. Venäjä, kiina, koodi – huipputasoa. 7B-versio kilpailee Llama 3 8B:n kanssa ja paikoin päihittää sen. Qwen 3 lisäsi thinking mode -tilan – päättelyketjun suoraan malliin.

## GGUF ja kvantisointi

Alkuperäiset mallipainot painavat kymmeniä gigatavuja ja vaativat GPU:n. Kvantisointi pakkaa ne järkevään kokoon minimaalisella laadunmenetyksellä.

GGUF-muoto – yhtenäinen säiliö: painot + tokenisaattori + metadata yhdessä tiedostossa. Lataa – käynnistä.

| Kvantisointi | Koko (7B) | RAM | Laatu |
| --- | --- | --- | --- |
| `Q4_K_M` | ~4.1 GB | ~6 GB | Hyvä. Optimaalinen tasapaino |
| `Q5_K_M` | ~4.8 GB | ~7 GB | Erittäin hyvä. Hieman raskaampi |
| `Q8_0` | ~7.2 GB | ~9 GB | Lähes häviötön. Jos RAM sallii |

**Suositus:** `Q4_K_M` – kultainen keskitie. Laadunmenetys on minimaalinen, ja ero nopeudessa ja koossa on merkittävä. `Q5_K_M` – jos on ylimääräistä muistia ja haluaa hieman tarkempaa.

## Vähimmäislaitteisto

| Kokoonpano | Mitä pyörittää |
| --- | --- |
| **8 GB RAM**, mikä tahansa x86\_64 CPU | 7B-mallit (Q4\_K\_M). Perusvaihtoehto |
| **16 GB RAM**, 4+ ydintä | 13B-mallit. Mukava työskentely 7B:n kanssa |
| **32 GB RAM** tai GPU 12GB+ | 33B–70B-mallit. Vakava taso |

GPU nopeuttaa generointia moninkertaisesti, mutta ei ole pakollinen. CPU:llakin toimii – vain hitaammin. Apple Silicon (M1/M2/M3) – erinomainen vaihtoehto: unified memory mahdollistaa suurten mallien lataamisen ilman erillistä näytönohjainta.

## Pikakäynnistys

Nollasta toimivaan malliin – kaksi komentoa:

```
# Llama 3 8B
ollama run llama3

# Qwen 2.5 7B
ollama run qwen2.5

# Qwen 3 8B (thinking mode -tilalla)
ollama run qwen3

# Tietty kvantisointi
ollama run llama3:8b-instruct-q5_K_M
```

Ensimmäinen käynnistys lataa mallin (~4-5 GB). Sen jälkeen kaikki on paikallista.

Ollama nostaa API:n osoitteeseen `localhost:11434`. Sitä voi kutsua koodista:

```
curl http://localhost:11434/api/generate -d '{
  "model": "qwen2.5",
  "prompt": "Selitä neuroverkkojen kvantisointi kolmessa lauseessa",
  "stream": false
}'
```

## Koville tekijöille: llama.cpp suoraan

```
# Kloonaa ja rakenna
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp && make -j$(nproc)

# Käynnistä malli
./llama-cli -m /path/to/model.gguf \
  -p "Kirjoita lajittelufunktio Pythonilla" \
  -n 512 -t 4

# Tai nosta palvelin API:lla
./llama-server -m /path/to/model.gguf \
  --host 0.0.0.0 --port 8080
```

GGUF-tiedostot haetaan HuggingFacesta. Luotettavia kvantisointilähteitä: *bartowski*, *TheBloke* (legacy), *Qwen official*.

## Tekoäly tikulla

Kannettava asennus – kaikki yhdellä USB-tikulla. Työnnä mihin tahansa tietokoneeseen – käynnistä.

Mitä tarvitaan:

- USB 3.0+ -tikku tai ulkoinen SSD (vähintään 32 GB)
- Ollaman tai llama.cpp:n binäärit (staattinen kokoelma, ~50 MB)
- Yksi tai kaksi mallia GGUF-muodossa (~4-5 GB kukin)

```
# Tikun rakenne
/LLM/
├── ollama              # binääri
├── models/
│   ├── llama3-8b-q4_k_m.gguf
│   └── qwen2.5-7b-q4_k_m.gguf
└── run.sh              # käynnistysskripti
```

```
#!/bin/bash
# run.sh — käynnistys tikulta
export OLLAMA_MODELS="$(dirname "$0")/models"
export OLLAMA_HOST="127.0.0.1:11434"
"$(dirname "$0")/ollama" serve &
sleep 2
"$(dirname "$0")/ollama" run llama3
```

> Ulkoinen SSD tikun sijaan – moninkertaisesti nopeampi mallin lataus. Tavallinen USB-tikku toimii, mutta ensimmäinen käynnistys on hidas. Kun malli on ladattu RAM:iin, tallennusvälineen nopeudella ei ole enää väliä.

## Suorituskyky

Mitä todella voi odottaa. Malli 7B, kvantisointi Q4\_K\_M:

| Laitteisto | Tokenia/s | Tuntuma |
| --- | --- | --- |
| i5/Ryzen 5, 16GB, vain CPU | 8–15 | Kirjoittaa hitaasti, mutta luettavasti |
| Apple M1/M2, 16GB | 25–40 | Mukava. Kuin nopea tekstinsyöttö |
| RTX 3060 12GB | 40–60 | Nopea. Vastaus sekunneissa |
| RTX 4090 24GB | 80–120 | Välitön |

13B-malleille – jaa suunnilleen kahdella. 70B-malleille – tarvitaan GPU, jossa on 48GB VRAM:ia, tai paljon RAM:ia CPU-inferenssiin (hidas, mutta toimii).

Vielä yksi asia: ensimmäinen token on aina hitaampi (prompt processing). Pitkä kehote – tuntuva viive ennen vastauksen ensimmäistä sanaa. Lyhyet kehotteet – lähes välittömästi.

## Mitä valita

- **Teksteille ja chatille venäjäksi** – Qwen 2.5 7B. Paras venäjä tämän kokoluokan malleista.
- **Koodille** – Qwen 2.5 Coder 7B tai Llama 3 8B. Molemmat hyviä.
- **Päättelylle** – Qwen 3 8B thinking mode -tilalla. Hitaampi, mutta älykkäämpi.
- **Maksiminopeudelle** – Llama 3 8B Q4\_K\_M. Kevyt, nopea.

· · ·

Paikalliset LLM:t eivät ole korvike GPT-4:lle tai Claudelle. Ne ovat eri työkalu eri tehtäviin. Yksityinen avustaja, offline-apuri, kokeilualusta. Malli tikulla – kuin sveitsiläinen linkkuveitsi: ei korvaa verstasta, mutta maastossa korvaamaton.

Kaksi gigaa tikulla. Nolla riippuvuutta vieraista palvelimista. Oma tasku-AI.

[← Takaisin tietokantaan](../index.html)