AI muistitikulla: Llama ja Qwen paikallisesti käynnissä
tech
2026-03-07
Pilvipohjaiset API:t ovat käteviä. Niin kauan kuin sinulla on internet, rahaa tilaukseen ja hyväksyt sen, että joku muu lukee jokaisen kehotteen. Jos yksikin kohta ei sovi – tervetuloa paikalliseen inferenssiin.
Miksi ylipäätään
Neljä syytä ajaa LLM:ää omalla laitteistolla:
- Yksityisyys. Tiedot eivät poistu koneelta. Ei telemetriaa, ei lokitietoja vieraalla palvelimella. Kehote elää ja kuolee sinun luonasi.
- Offline. Lentokone, juna, bunkkeri ilman wifiä – malli toimii. Internetiä ei tarvita missään vaiheessa latauksen jälkeen.
- Ilmainen. Nolla dollaria tokenilta. Ikuisesti. Ainoa investointi on laitteisto, joka sinulla jo on.
- Ilman sensuuria. Paikallinen malli vastaa siihen, mihin se vastaa. Ilman yrityssuodattimia, ilman “I cannot help with that”.
Työkalut
Kaksi vaihtoehtoa. Molemmat toimivat, valinta riippuu siitä, kuinka paljon haluat hallita prosessia.
llama.cpp – inferenssimoottori puhtaalla C/C++:lla. Toimii CPU:lla, valinnaisesti GPU:lla (CUDA, Metal, Vulkan). Ei riippuvuuksia, ei Pythonia. Kääntö – käynnistys. Tukee GGUF-muotoa, josta on tullut kvantisoitujen mallien standardi.
Ollama – kääre llama.cpp:n ympärillä ihmisläheisellä käyttöliittymällä. Lataa malleja yhdellä komennolla, hallitsee niitä, tarjoaa API:n. Jos et halua säätää kääntämisen ja konfiguraatioiden kanssa – tämä on sinun vaihtoehtosi.
# Ollaman asennus (Linux/macOS)
curl -fsSL https://ollama.com/install.sh | sh
# Tai lataa binääri osoitteesta https://ollama.com/download
Mallit
Kaksi perhettä, joita todella kannattaa ajaa paikallisesti vuonna 2026:
Llama 3.x (Meta) – työjuhta. Hyvä englanniksi, kohtalainen venäjäksi. 8B parametria – mahtuu 8GB RAM:iin. Saatavilla versiot 70B ja 405B niille, joilla on kunnon laitteisto.
Qwen 2.5 / Qwen 3 (Alibaba) – paras valinta monikielisiin tehtäviin. Venäjä, kiina, koodi – huipputasoa. 7B-versio kilpailee Llama 3 8B:n kanssa ja paikoin päihittää sen. Qwen 3 lisäsi thinking mode -tilan – päättelyketjun suoraan malliin.
GGUF ja kvantisointi
Alkuperäiset mallipainot painavat kymmeniä gigatavuja ja vaativat GPU:n. Kvantisointi pakkaa ne järkevään kokoon minimaalisella laadunmenetyksellä.
GGUF-muoto – yhtenäinen säiliö: painot + tokenisaattori + metadata yhdessä tiedostossa. Lataa – käynnistä.
| Kvantisointi | Koko (7B) | RAM | Laatu |
|---|---|---|---|
Q4_K_M |
~4.1 GB | ~6 GB | Hyvä. Optimaalinen tasapaino |
Q5_K_M |
~4.8 GB | ~7 GB | Erittäin hyvä. Hieman raskaampi |
Q8_0 |
~7.2 GB | ~9 GB | Lähes häviötön. Jos RAM sallii |
Suositus: Q4_K_M – kultainen keskitie. Laadunmenetys on minimaalinen, ja ero nopeudessa ja koossa on merkittävä. Q5_K_M – jos on ylimääräistä muistia ja haluaa hieman tarkempaa.
Vähimmäislaitteisto
| Kokoonpano | Mitä pyörittää |
|---|---|
| 8 GB RAM, mikä tahansa x86_64 CPU | 7B-mallit (Q4_K_M). Perusvaihtoehto |
| 16 GB RAM, 4+ ydintä | 13B-mallit. Mukava työskentely 7B:n kanssa |
| 32 GB RAM tai GPU 12GB+ | 33B–70B-mallit. Vakava taso |
GPU nopeuttaa generointia moninkertaisesti, mutta ei ole pakollinen. CPU:llakin toimii – vain hitaammin. Apple Silicon (M1/M2/M3) – erinomainen vaihtoehto: unified memory mahdollistaa suurten mallien lataamisen ilman erillistä näytönohjainta.
Pikakäynnistys
Nollasta toimivaan malliin – kaksi komentoa:
# Llama 3 8B
ollama run llama3
# Qwen 2.5 7B
ollama run qwen2.5
# Qwen 3 8B (thinking mode -tilalla)
ollama run qwen3
# Tietty kvantisointi
ollama run llama3:8b-instruct-q5_K_M
Ensimmäinen käynnistys lataa mallin (~4-5 GB). Sen jälkeen kaikki on paikallista.
Ollama nostaa API:n osoitteeseen localhost:11434. Sitä voi kutsua koodista:
curl http://localhost:11434/api/generate -d '{
"model": "qwen2.5",
"prompt": "Selitä neuroverkkojen kvantisointi kolmessa lauseessa",
"stream": false
}'
Koville tekijöille: llama.cpp suoraan
# Kloonaa ja rakenna
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp && make -j$(nproc)
# Käynnistä malli
./llama-cli -m /path/to/model.gguf \
-p "Kirjoita lajittelufunktio Pythonilla" \
-n 512 -t 4
# Tai nosta palvelin API:lla
./llama-server -m /path/to/model.gguf \
--host 0.0.0.0 --port 8080
GGUF-tiedostot haetaan HuggingFacesta. Luotettavia kvantisointilähteitä: bartowski, TheBloke (legacy), Qwen official.
Tekoäly tikulla
Kannettava asennus – kaikki yhdellä USB-tikulla. Työnnä mihin tahansa tietokoneeseen – käynnistä.
Mitä tarvitaan:
- USB 3.0+ -tikku tai ulkoinen SSD (vähintään 32 GB)
- Ollaman tai llama.cpp:n binäärit (staattinen kokoelma, ~50 MB)
- Yksi tai kaksi mallia GGUF-muodossa (~4-5 GB kukin)
# Tikun rakenne
/LLM/
├── ollama # binääri
├── models/
│ ├── llama3-8b-q4_k_m.gguf
│ └── qwen2.5-7b-q4_k_m.gguf
└── run.sh # käynnistysskripti
#!/bin/bash
# run.sh — käynnistys tikulta
export OLLAMA_MODELS="$(dirname "$0")/models"
export OLLAMA_HOST="127.0.0.1:11434"
"$(dirname "$0")/ollama" serve &
sleep 2
"$(dirname "$0")/ollama" run llama3
Ulkoinen SSD tikun sijaan – moninkertaisesti nopeampi mallin lataus. Tavallinen USB-tikku toimii, mutta ensimmäinen käynnistys on hidas. Kun malli on ladattu RAM:iin, tallennusvälineen nopeudella ei ole enää väliä.
Suorituskyky
Mitä todella voi odottaa. Malli 7B, kvantisointi Q4_K_M:
| Laitteisto | Tokenia/s | Tuntuma |
|---|---|---|
| i5/Ryzen 5, 16GB, vain CPU | 8–15 | Kirjoittaa hitaasti, mutta luettavasti |
| Apple M1/M2, 16GB | 25–40 | Mukava. Kuin nopea tekstinsyöttö |
| RTX 3060 12GB | 40–60 | Nopea. Vastaus sekunneissa |
| RTX 4090 24GB | 80–120 | Välitön |
13B-malleille – jaa suunnilleen kahdella. 70B-malleille – tarvitaan GPU, jossa on 48GB VRAM:ia, tai paljon RAM:ia CPU-inferenssiin (hidas, mutta toimii).
Vielä yksi asia: ensimmäinen token on aina hitaampi (prompt processing). Pitkä kehote – tuntuva viive ennen vastauksen ensimmäistä sanaa. Lyhyet kehotteet – lähes välittömästi.
Mitä valita
- Teksteille ja chatille venäjäksi – Qwen 2.5 7B. Paras venäjä tämän kokoluokan malleista.
- Koodille – Qwen 2.5 Coder 7B tai Llama 3 8B. Molemmat hyviä.
- Päättelylle – Qwen 3 8B thinking mode -tilalla. Hitaampi, mutta älykkäämpi.
- Maksiminopeudelle – Llama 3 8B Q4_K_M. Kevyt, nopea.
· · ·
Paikalliset LLM:t eivät ole korvike GPT-4:lle tai Claudelle. Ne ovat eri työkalu eri tehtäviin. Yksityinen avustaja, offline-apuri, kokeilualusta. Malli tikulla – kuin sveitsiläinen linkkuveitsi: ei korvaa verstasta, mutta maastossa korvaamaton.
Kaksi gigaa tikulla. Nolla riippuvuutta vieraista palvelimista. Oma tasku-AI.