AI uz zibatmiņas: palaižam Llama un Qwen lokāli
tech
2026-03-07
Mākoņa API ir ērti. Kamēr tev ir internets, nauda abonementam un tevi apmierina, ka katru promptu lasa vēl kāds cits. Ja kaut viens punkts neder — laipni lūdzam lokālajā inferencē.
Kāpēc vispār
Četri iemesli, lai palaistu LLM uz sava dzelža:
- Privātums. Dati nepamet mašīnu. Nekādas telemetrijas, nekādu žurnālu uz sveša servera. Prompts dzīvo un mirst pie tevis.
- Bezsaiste. Lidmašīna, vilciens, bunkurs bez wifi — modelis strādā. Internets nav vajadzīgs nevienā posmā pēc lejupielādes.
- Bezmaksas. Nulle dolāru par tokenu. Uz visiem laikiem. Vienīgais ieguldījums — dzelzs, kas tev jau ir.
- Bez cenzūras. Lokālais modelis atbild uz to, uz ko atbild. Bez korporatīvajiem filtriem, bez «I cannot help with that».
Rīki
Divi varianti. Abi strādājoši, izvēle atkarīga no tā, cik ļoti tu vēlies kontrolēt procesu.
llama.cpp — inferces dzinējs tīrā C/C++. Darbojas uz CPU, opcionāli GPU (CUDA, Metal, Vulkan). Nekādu atkarību, nekāda Python. Nokompilēji — palaid. Atbalsta GGUF formātu, kas kļuvis par standartu kvantizētiem modeļiem.
Ollama — aploksne virs llama.cpp ar cilvēcīgu saskarni. Lejupielādē modeļus ar vienu komandu, pārvalda tos, izliek API. Ja negribi ķēpāties ar kompilēšanu un konfigurācijām — šis ir tavs variants.
# Ollama instalēšana (Linux/macOS)
curl -fsSL https://ollama.com/install.sh | sh
# Vai lejupielādēt bināro failu no https://ollama.com/download
Modeļi
Divas saimes, kuras tiešām ir vērts palaist lokāli 2026. gadā:
Llama 3.x (Meta) — darba zirgs. Laba angļu valodai, pieņemami tiek galā ar krievu valodu. 8B parametri — ietilpst 8GB RAM. Ir versijas 70B un 405B tiem, kam ir nopietns dzelzs.
Qwen 2.5 / Qwen 3 (Alibaba) — labākā izvēle daudzvalodu uzdevumiem. Krievu, ķīniešu, kods — līmenī. 7B versija konkurē ar Llama 3 8B, un vietām apsteidz. Qwen 3 pievienoja thinking mode — spriešanas ķēdi tieši modelī.
GGUF un kvantizācijas
Oriģinālie modeļu svari sver desmitiem gigabaitu un prasa GPU. Kvantizācija tos saspiež līdz saprātīgam izmēram ar minimālu kvalitātes zudumu.
GGUF formāts — vienots konteiners: svari + tokenizators + metadati vienā failā. Lejupielādēji — palaid.
| Kvantizācija | Izmērs (7B) | RAM | Kvalitāte |
|---|---|---|---|
Q4_K_M |
~4.1 GB | ~6 GB | Laba. Optimāls līdzsvars |
Q5_K_M |
~4.8 GB | ~7 GB | Ļoti laba. Nedaudz smagāka |
Q8_0 |
~7.2 GB | ~9 GB | Gandrīz bez zudumiem. Ja RAM atļauj |
Ieteikums: Q4_K_M — zelta vidusceļš. Kvalitātes zudumi ir minimāli, bet atšķirība ātrumā un izmērā — būtiska. Q5_K_M — ja ir atmiņas rezerve un gribas nedaudz precīzāk.
Minimālais dzelzs
| Konfigurācija | Ko pavilks |
|---|---|
| 8 GB RAM, jebkurš x86_64 CPU | 7B modeļi (Q4_K_M). Pamata variants |
| 16 GB RAM, 4+ kodoli | 13B modeļi. Ērta darbība ar 7B |
| 32 GB RAM vai GPU 12GB+ | 33B–70B modeļi. Nopietns līmenis |
GPU daudzkārt paātrina ģenerēšanu, bet nav obligāts. Uz CPU arī darbojas — tikai lēnāk. Apple Silicon (M1/M2/M3) — lielisks variants: unified memory ļauj ielādēt lielus modeļus bez diskrētās videokartes.
Ātrs starts
No nulles līdz strādājošam modelim — divas komandas:
# Llama 3 8B
ollama run llama3
# Qwen 2.5 7B
ollama run qwen2.5
# Qwen 3 8B (ar thinking mode)
ollama run qwen3
# Konkrēta kvantizācija
ollama run llama3:8b-instruct-q5_K_M
Pirmā palaišana lejupielādēs modeli (~4-5 GB). Pēc tam viss lokāli.
Ollama paceļ API uz localhost:11434. Var izsaukt no koda:
curl http://localhost:11434/api/generate -d '{
"model": "qwen2.5",
"prompt": "Izskaidro neironu tīklu kvantizāciju trīs teikumos",
"stream": false
}'
Hardcore lietotājiem: llama.cpp tieši
# Noklonēt un salikt
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp && make -j$(nproc)
# Palaist modeli
./llama-cli -m /path/to/model.gguf \
-p "Uzraksti kārtošanas funkciju Python valodā" \
-n 512 -t 4
# Vai pacelt serveri ar API
./llama-server -m /path/to/model.gguf \
--host 0.0.0.0 --port 8080
GGUF failus ņemam no HuggingFace. Pārbaudīti kvantizāciju avoti: bartowski, TheBloke (legacy), Qwen official.
MI uz zibatmiņas
Pārnēsājama instalācija — viss uz viena USB datu nesēja. Iespraudi jebkurā datorā — palaid.
Kas nepieciešams:
- USB 3.0+ zibatmiņa vai ārējais SSD (no 32 GB)
- Ollama vai llama.cpp binārie faili (statiskā būve, ~50 MB)
- Viens vai divi modeļi GGUF formātā (~4-5 GB katrs)
# Zibatmiņas struktūra
/LLM/
├── ollama # binārais fails
├── models/
│ ├── llama3-8b-q4_k_m.gguf
│ └── qwen2.5-7b-q4_k_m.gguf
└── run.sh # palaišanas skripts
#!/bin/bash
# run.sh — palaišana no zibatmiņas
export OLLAMA_MODELS="$(dirname "$0")/models"
export OLLAMA_HOST="127.0.0.1:11434"
"$(dirname "$0")/ollama" serve &
sleep 2
"$(dirname "$0")/ollama" run llama3
Ārējais SSD zibatmiņas vietā — daudzkārt ātrāka modeļa ielāde. Parasta USB zibatmiņa pavilks, bet pirmā palaišana būs ilga. Pēc ielādes RAM atmiņā, datu nesēja ātrums vairs nav svarīgs.
Veiktspēja
Ko reāli gaidīt. Modelis 7B, kvantizācija Q4_K_M:
| Dzelzs | Tokeni/sek | Sajūta |
|---|---|---|
| i5/Ryzen 5, 16GB, tikai CPU | 8–15 | Raksta lēni, bet lasāmi |
| Apple M1/M2, 16GB | 25–40 | Ērti. Kā ātra teksta ievade |
| RTX 3060 12GB | 40–60 | Ātri. Atbilde sekundēs |
| RTX 4090 24GB | 80–120 | Momentāni |
13B modeļiem — dalām aptuveni uz diviem. 70B — nepieciešams GPU ar 48GB VRAM vai daudz RAM CPU inferencei (lēni, bet strādā).
Vēl moments: pirmais tokens vienmēr ir lēnāks (prompt processing). Garš prompts — jūtama aizkave pirms pirmā atbildes vārda. Īsi prompti — gandrīz momentāni.
Ko izvēlēties
- Tekstiem un tērzēšanai krievu valodā — Qwen 2.5 7B. Labākā krievu valoda starp šāda izmēra modeļiem.
- Kodam — Qwen 2.5 Coder 7B vai Llama 3 8B. Abi labi.
- Spriešanai — Qwen 3 8B ar thinking mode. Lēnāks, bet gudrāks.
- Maksimālam ātrumam — Llama 3 8B Q4_K_M. Viegls, ātrs.
· · ·
Lokālie LLM nav GPT-4 vai Claude aizstājējs. Tas ir cits instruments citiem uzdevumiem. Privāts asistents, bezsaistes palīgs, eksperimentāla platforma. Modelis uz zibatmiņas — kā Šveices nazis: neaizstās darbnīcu, bet laukā ir neaizstājams.
Divi gigabaiti uz zibatmiņas. Nulle atkarību no svešiem serveriem. Savs kabatas MI.