2026-03-07

AI muistitikulla: Llama ja Qwen paikallisesti käynnissä

tech

2026-03-07

Pilvipohjaiset API:t ovat käteviä. Niin kauan kuin sinulla on internet, rahaa tilaukseen ja hyväksyt sen, että joku muu lukee jokaisen kehotteen. Jos yksikin kohta ei sovi – tervetuloa paikalliseen inferenssiin.

Miksi ylipäätään

Neljä syytä ajaa LLM:ää omalla laitteistolla:

Työkalut

Kaksi vaihtoehtoa. Molemmat toimivat, valinta riippuu siitä, kuinka paljon haluat hallita prosessia.

llama.cpp – inferenssimoottori puhtaalla C/C++:lla. Toimii CPU:lla, valinnaisesti GPU:lla (CUDA, Metal, Vulkan). Ei riippuvuuksia, ei Pythonia. Kääntö – käynnistys. Tukee GGUF-muotoa, josta on tullut kvantisoitujen mallien standardi.

Ollama – kääre llama.cpp:n ympärillä ihmisläheisellä käyttöliittymällä. Lataa malleja yhdellä komennolla, hallitsee niitä, tarjoaa API:n. Jos et halua säätää kääntämisen ja konfiguraatioiden kanssa – tämä on sinun vaihtoehtosi.

# Ollaman asennus (Linux/macOS)
curl -fsSL https://ollama.com/install.sh | sh

# Tai lataa binääri osoitteesta https://ollama.com/download

Mallit

Kaksi perhettä, joita todella kannattaa ajaa paikallisesti vuonna 2026:

Llama 3.x (Meta) – työjuhta. Hyvä englanniksi, kohtalainen venäjäksi. 8B parametria – mahtuu 8GB RAM:iin. Saatavilla versiot 70B ja 405B niille, joilla on kunnon laitteisto.

Qwen 2.5 / Qwen 3 (Alibaba) – paras valinta monikielisiin tehtäviin. Venäjä, kiina, koodi – huipputasoa. 7B-versio kilpailee Llama 3 8B:n kanssa ja paikoin päihittää sen. Qwen 3 lisäsi thinking mode -tilan – päättelyketjun suoraan malliin.

GGUF ja kvantisointi

Alkuperäiset mallipainot painavat kymmeniä gigatavuja ja vaativat GPU:n. Kvantisointi pakkaa ne järkevään kokoon minimaalisella laadunmenetyksellä.

GGUF-muoto – yhtenäinen säiliö: painot + tokenisaattori + metadata yhdessä tiedostossa. Lataa – käynnistä.

Kvantisointi Koko (7B) RAM Laatu
Q4_K_M ~4.1 GB ~6 GB Hyvä. Optimaalinen tasapaino
Q5_K_M ~4.8 GB ~7 GB Erittäin hyvä. Hieman raskaampi
Q8_0 ~7.2 GB ~9 GB Lähes häviötön. Jos RAM sallii

Suositus: Q4_K_M – kultainen keskitie. Laadunmenetys on minimaalinen, ja ero nopeudessa ja koossa on merkittävä. Q5_K_M – jos on ylimääräistä muistia ja haluaa hieman tarkempaa.

Vähimmäislaitteisto

Kokoonpano Mitä pyörittää
8 GB RAM, mikä tahansa x86_64 CPU 7B-mallit (Q4_K_M). Perusvaihtoehto
16 GB RAM, 4+ ydintä 13B-mallit. Mukava työskentely 7B:n kanssa
32 GB RAM tai GPU 12GB+ 33B–70B-mallit. Vakava taso

GPU nopeuttaa generointia moninkertaisesti, mutta ei ole pakollinen. CPU:llakin toimii – vain hitaammin. Apple Silicon (M1/M2/M3) – erinomainen vaihtoehto: unified memory mahdollistaa suurten mallien lataamisen ilman erillistä näytönohjainta.

Pikakäynnistys

Nollasta toimivaan malliin – kaksi komentoa:

# Llama 3 8B
ollama run llama3

# Qwen 2.5 7B
ollama run qwen2.5

# Qwen 3 8B (thinking mode -tilalla)
ollama run qwen3

# Tietty kvantisointi
ollama run llama3:8b-instruct-q5_K_M

Ensimmäinen käynnistys lataa mallin (~4-5 GB). Sen jälkeen kaikki on paikallista.

Ollama nostaa API:n osoitteeseen localhost:11434. Sitä voi kutsua koodista:

curl http://localhost:11434/api/generate -d '{
  "model": "qwen2.5",
  "prompt": "Selitä neuroverkkojen kvantisointi kolmessa lauseessa",
  "stream": false
}'

Koville tekijöille: llama.cpp suoraan

# Kloonaa ja rakenna
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp && make -j$(nproc)

# Käynnistä malli
./llama-cli -m /path/to/model.gguf \
  -p "Kirjoita lajittelufunktio Pythonilla" \
  -n 512 -t 4

# Tai nosta palvelin API:lla
./llama-server -m /path/to/model.gguf \
  --host 0.0.0.0 --port 8080

GGUF-tiedostot haetaan HuggingFacesta. Luotettavia kvantisointilähteitä: bartowski, TheBloke (legacy), Qwen official.

Tekoäly tikulla

Kannettava asennus – kaikki yhdellä USB-tikulla. Työnnä mihin tahansa tietokoneeseen – käynnistä.

Mitä tarvitaan:

# Tikun rakenne
/LLM/
├── ollama              # binääri
├── models/
│   ├── llama3-8b-q4_k_m.gguf
│   └── qwen2.5-7b-q4_k_m.gguf
└── run.sh              # käynnistysskripti
#!/bin/bash
# run.sh — käynnistys tikulta
export OLLAMA_MODELS="$(dirname "$0")/models"
export OLLAMA_HOST="127.0.0.1:11434"
"$(dirname "$0")/ollama" serve &
sleep 2
"$(dirname "$0")/ollama" run llama3

Ulkoinen SSD tikun sijaan – moninkertaisesti nopeampi mallin lataus. Tavallinen USB-tikku toimii, mutta ensimmäinen käynnistys on hidas. Kun malli on ladattu RAM:iin, tallennusvälineen nopeudella ei ole enää väliä.

Suorituskyky

Mitä todella voi odottaa. Malli 7B, kvantisointi Q4_K_M:

Laitteisto Tokenia/s Tuntuma
i5/Ryzen 5, 16GB, vain CPU 8–15 Kirjoittaa hitaasti, mutta luettavasti
Apple M1/M2, 16GB 25–40 Mukava. Kuin nopea tekstinsyöttö
RTX 3060 12GB 40–60 Nopea. Vastaus sekunneissa
RTX 4090 24GB 80–120 Välitön

13B-malleille – jaa suunnilleen kahdella. 70B-malleille – tarvitaan GPU, jossa on 48GB VRAM:ia, tai paljon RAM:ia CPU-inferenssiin (hidas, mutta toimii).

Vielä yksi asia: ensimmäinen token on aina hitaampi (prompt processing). Pitkä kehote – tuntuva viive ennen vastauksen ensimmäistä sanaa. Lyhyet kehotteet – lähes välittömästi.

Mitä valita

· · ·

Paikalliset LLM:t eivät ole korvike GPT-4:lle tai Claudelle. Ne ovat eri työkalu eri tehtäviin. Yksityinen avustaja, offline-apuri, kokeilualusta. Malli tikulla – kuin sveitsiläinen linkkuveitsi: ei korvaa verstasta, mutta maastossa korvaamaton.

Kaksi gigaa tikulla. Nolla riippuvuutta vieraista palvelimista. Oma tasku-AI.

← Takaisin tietokantaan