2026-03-07

AI uz zibatmiņas: palaižam Llama un Qwen lokāli

tech

2026-03-07

Mākoņa API ir ērti. Kamēr tev ir internets, nauda abonementam un tevi apmierina, ka katru promptu lasa vēl kāds cits. Ja kaut viens punkts neder — laipni lūdzam lokālajā inferencē.

Kāpēc vispār

Četri iemesli, lai palaistu LLM uz sava dzelža:

Rīki

Divi varianti. Abi strādājoši, izvēle atkarīga no tā, cik ļoti tu vēlies kontrolēt procesu.

llama.cpp — inferces dzinējs tīrā C/C++. Darbojas uz CPU, opcionāli GPU (CUDA, Metal, Vulkan). Nekādu atkarību, nekāda Python. Nokompilēji — palaid. Atbalsta GGUF formātu, kas kļuvis par standartu kvantizētiem modeļiem.

Ollama — aploksne virs llama.cpp ar cilvēcīgu saskarni. Lejupielādē modeļus ar vienu komandu, pārvalda tos, izliek API. Ja negribi ķēpāties ar kompilēšanu un konfigurācijām — šis ir tavs variants.

# Ollama instalēšana (Linux/macOS)
curl -fsSL https://ollama.com/install.sh | sh

# Vai lejupielādēt bināro failu no https://ollama.com/download

Modeļi

Divas saimes, kuras tiešām ir vērts palaist lokāli 2026. gadā:

Llama 3.x (Meta) — darba zirgs. Laba angļu valodai, pieņemami tiek galā ar krievu valodu. 8B parametri — ietilpst 8GB RAM. Ir versijas 70B un 405B tiem, kam ir nopietns dzelzs.

Qwen 2.5 / Qwen 3 (Alibaba) — labākā izvēle daudzvalodu uzdevumiem. Krievu, ķīniešu, kods — līmenī. 7B versija konkurē ar Llama 3 8B, un vietām apsteidz. Qwen 3 pievienoja thinking mode — spriešanas ķēdi tieši modelī.

GGUF un kvantizācijas

Oriģinālie modeļu svari sver desmitiem gigabaitu un prasa GPU. Kvantizācija tos saspiež līdz saprātīgam izmēram ar minimālu kvalitātes zudumu.

GGUF formāts — vienots konteiners: svari + tokenizators + metadati vienā failā. Lejupielādēji — palaid.

Kvantizācija Izmērs (7B) RAM Kvalitāte
Q4_K_M ~4.1 GB ~6 GB Laba. Optimāls līdzsvars
Q5_K_M ~4.8 GB ~7 GB Ļoti laba. Nedaudz smagāka
Q8_0 ~7.2 GB ~9 GB Gandrīz bez zudumiem. Ja RAM atļauj

Ieteikums: Q4_K_M — zelta vidusceļš. Kvalitātes zudumi ir minimāli, bet atšķirība ātrumā un izmērā — būtiska. Q5_K_M — ja ir atmiņas rezerve un gribas nedaudz precīzāk.

Minimālais dzelzs

Konfigurācija Ko pavilks
8 GB RAM, jebkurš x86_64 CPU 7B modeļi (Q4_K_M). Pamata variants
16 GB RAM, 4+ kodoli 13B modeļi. Ērta darbība ar 7B
32 GB RAM vai GPU 12GB+ 33B–70B modeļi. Nopietns līmenis

GPU daudzkārt paātrina ģenerēšanu, bet nav obligāts. Uz CPU arī darbojas — tikai lēnāk. Apple Silicon (M1/M2/M3) — lielisks variants: unified memory ļauj ielādēt lielus modeļus bez diskrētās videokartes.

Ātrs starts

No nulles līdz strādājošam modelim — divas komandas:

# Llama 3 8B
ollama run llama3

# Qwen 2.5 7B
ollama run qwen2.5

# Qwen 3 8B (ar thinking mode)
ollama run qwen3

# Konkrēta kvantizācija
ollama run llama3:8b-instruct-q5_K_M

Pirmā palaišana lejupielādēs modeli (~4-5 GB). Pēc tam viss lokāli.

Ollama paceļ API uz localhost:11434. Var izsaukt no koda:

curl http://localhost:11434/api/generate -d '{
  "model": "qwen2.5",
  "prompt": "Izskaidro neironu tīklu kvantizāciju trīs teikumos",
  "stream": false
}'

Hardcore lietotājiem: llama.cpp tieši

# Noklonēt un salikt
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp && make -j$(nproc)

# Palaist modeli
./llama-cli -m /path/to/model.gguf \
  -p "Uzraksti kārtošanas funkciju Python valodā" \
  -n 512 -t 4

# Vai pacelt serveri ar API
./llama-server -m /path/to/model.gguf \
  --host 0.0.0.0 --port 8080

GGUF failus ņemam no HuggingFace. Pārbaudīti kvantizāciju avoti: bartowski, TheBloke (legacy), Qwen official.

MI uz zibatmiņas

Pārnēsājama instalācija — viss uz viena USB datu nesēja. Iespraudi jebkurā datorā — palaid.

Kas nepieciešams:

# Zibatmiņas struktūra
/LLM/
├── ollama              # binārais fails
├── models/
│   ├── llama3-8b-q4_k_m.gguf
│   └── qwen2.5-7b-q4_k_m.gguf
└── run.sh              # palaišanas skripts
#!/bin/bash
# run.sh — palaišana no zibatmiņas
export OLLAMA_MODELS="$(dirname "$0")/models"
export OLLAMA_HOST="127.0.0.1:11434"
"$(dirname "$0")/ollama" serve &
sleep 2
"$(dirname "$0")/ollama" run llama3

Ārējais SSD zibatmiņas vietā — daudzkārt ātrāka modeļa ielāde. Parasta USB zibatmiņa pavilks, bet pirmā palaišana būs ilga. Pēc ielādes RAM atmiņā, datu nesēja ātrums vairs nav svarīgs.

Veiktspēja

Ko reāli gaidīt. Modelis 7B, kvantizācija Q4_K_M:

Dzelzs Tokeni/sek Sajūta
i5/Ryzen 5, 16GB, tikai CPU 8–15 Raksta lēni, bet lasāmi
Apple M1/M2, 16GB 25–40 Ērti. Kā ātra teksta ievade
RTX 3060 12GB 40–60 Ātri. Atbilde sekundēs
RTX 4090 24GB 80–120 Momentāni

13B modeļiem — dalām aptuveni uz diviem. 70B — nepieciešams GPU ar 48GB VRAM vai daudz RAM CPU inferencei (lēni, bet strādā).

Vēl moments: pirmais tokens vienmēr ir lēnāks (prompt processing). Garš prompts — jūtama aizkave pirms pirmā atbildes vārda. Īsi prompti — gandrīz momentāni.

Ko izvēlēties

· · ·

Lokālie LLM nav GPT-4 vai Claude aizstājējs. Tas ir cits instruments citiem uzdevumiem. Privāts asistents, bezsaistes palīgs, eksperimentāla platforma. Modelis uz zibatmiņas — kā Šveices nazis: neaizstās darbnīcu, bet laukā ir neaizstājams.

Divi gigabaiti uz zibatmiņas. Nulle atkarību no svešiem serveriem. Savs kabatas MI.

← Uz bāzi