2026-03-07

IA sur clé USB : lancer Llama et Qwen localement

tech

2026-03-07

Les API cloud, c’est pratique. Tant que tu as Internet, de l’argent pour l’abonnement, et que ça ne te dérange pas que quelqu’un d’autre lise chaque prompt. Si au moins un de ces points ne te convient pas — bienvenue dans l’inférence locale.

Pourquoi faire

Quatre raisons de lancer un LLM sur ton propre matériel :

Outils

Deux options. Les deux fonctionnent, le choix dépend de ton degré de contrôle souhaité sur le processus.

llama.cpp — un moteur d’inférence en C/C++ pur. Fonctionne sur CPU, optionnellement GPU (CUDA, Metal, Vulkan). Aucune dépendance, aucun Python. Tu compiles, tu lances. Supporte le format GGUF, devenu le standard pour les modèles quantifiés.

Ollama — une surcouche de llama.cpp avec une interface humaine. Télécharge les modèles en une commande, les gère, expose une API. Si tu ne veux pas te soucier de la compilation et de la configuration, c’est ton option.

# Installation d'ollama (Linux/macOS)
curl -fsSL https://ollama.com/install.sh | sh

# Ou télécharge le binaire depuis https://ollama.com/download

Modèles

Deux familles qui valent vraiment la peine d’être exécutées localement en 2026 :

Llama 3.x (Meta) — le cheval de bataille. Bon pour l’anglais, se débrouille correctement avec le russe. 8B paramètres — tient dans 8 Go de RAM. Il existe des versions 70B et 405B pour ceux qui ont du matériel sérieux.

Qwen 2.5 / Qwen 3 (Alibaba) — le meilleur choix pour les tâches multilingues. Russe, chinois, code — de niveau. La version 7B rivalise avec Llama 3 8B, et la surpasse par endroits. Qwen 3 a ajouté un mode de réflexion — une chaîne de raisonnement directement dans le modèle.

GGUF et quantifications

Les poids originaux des modèles pèsent des dizaines de gigaoctets et nécessitent un GPU. La quantification les compresse à une taille raisonnable avec une perte de qualité minimale.

Le format GGUF — un conteneur unique : poids + tokenizer + métadonnées dans un seul fichier. Tu télécharges, tu lances.

Quantification Taille (7B) RAM Qualité
Q4_K_M ~4.1 Go ~6 Go Bonne. Équilibre optimal
Q5_K_M ~4.8 Go ~7 Go Très bonne. Un peu plus lourd
Q8_0 ~7.2 Go ~9 Go Quasi sans perte. Si la RAM le permet

Recommandation : Q4_K_M — le juste milieu. Les pertes de qualité sont minimes, et la différence de vitesse et de taille est significative. Q5_K_M — si tu as de la mémoire de réserve et que tu veux un peu plus de précision.

Matériel minimum

Configuration Ce qu’elle peut gérer
8 Go de RAM, CPU x86_64 quelconque Modèles 7B (Q4_K_M). Option de base
16 Go de RAM, 4+ cœurs Modèles 13B. Travail confortable avec 7B
32 Go de RAM ou GPU 12 Go+ Modèles 33B–70B. Niveau sérieux

Le GPU accélère considérablement la génération, mais n’est pas obligatoire. Sur CPU, ça fonctionne aussi — juste plus lentement. Apple Silicon (M1/M2/M3) — une excellente option : la mémoire unifiée permet de charger de gros modèles sans carte graphique dédiée.

Démarrage rapide

De zéro à un modèle fonctionnel — deux commandes :

# Llama 3 8B
ollama run llama3

# Qwen 2.5 7B
ollama run qwen2.5

# Qwen 3 8B (avec mode de réflexion)
ollama run qwen3

# Quantification spécifique
ollama run llama3:8b-instruct-q5_K_M

Le premier lancement téléchargera le modèle (~4-5 Go). Ensuite, tout est local.

Ollama monte une API sur localhost:11434. Tu peux l’appeler depuis du code :

curl http://localhost:11434/api/generate -d '{
  "model": "qwen2.5",
  "prompt": "Explique la quantification des réseaux de neurones en trois phrases",
  "stream": false
}'

Pour les puristes : llama.cpp directement

# Cloner et compiler
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp && make -j$(nproc)

# Lancer le modèle
./llama-cli -m /chemin/vers/modele.gguf \
  -p "Écris une fonction de tri en Python" \
  -n 512 -t 4

# Ou monter un serveur avec API
./llama-server -m /chemin/vers/modele.gguf \
  --host 0.0.0.0 --port 8080

Les fichiers GGUF se trouvent sur HuggingFace. Sources de quantification fiables : bartowski, TheBloke (legacy), Qwen official.

L’IA sur une clé USB

Installation portable — tout sur une seule clé USB. Tu la branches sur n’importe quel ordinateur, tu lances.

Ce qu’il faut :

# Structure de la clé USB
/LLM/
├── ollama              # binaire
├── models/
│   ├── llama3-8b-q4_k_m.gguf
│   └── qwen2.5-7b-q4_k_m.gguf
└── run.sh              # script de lancement
#!/bin/bash
# run.sh — lancement depuis la clé USB
export OLLAMA_MODELS="$(dirname "$0")/models"
export OLLAMA_HOST="127.0.0.1:11434"
"$(dirname "$0")/ollama" serve &
sleep 2
"$(dirname "$0")/ollama" run llama3

Un SSD externe plutôt qu’une clé USB — chargement du modèle bien plus rapide. Une clé USB classique fera l’affaire, mais le premier lancement sera long. Une fois chargé en RAM, la vitesse du support de stockage n’a plus d’importance.

Performances

À quoi s’attendre réellement. Modèle 7B, quantification Q4_K_M :

Matériel Tokens/s Sensation
i5/Ryzen 5, 16 Go, CPU uniquement 8–15 Tape lentement, mais lisible
Apple M1/M2, 16 Go 25–40 Confortable. Comme une frappe rapide
RTX 3060 12 Go 40–60 Rapide. Réponse en quelques secondes
RTX 4090 24 Go 80–120 Instantané

Pour les modèles 13B — divise environ par deux. Pour les 70B — il faut un GPU avec 48 Go de VRAM ou beaucoup de RAM pour l’inférence CPU (lent, mais ça marche).

Autre point : le premier token est toujours plus lent (traitement du prompt). Un prompt long — un délai notable avant le premier mot de la réponse. Les prompts courts — presque instantanés.

Que choisir

· · ·

Les LLM locaux ne remplacent pas GPT-4 ou Claude. C’est un outil différent pour des tâches différentes. Assistant privé, aide hors ligne, terrain d’expérimentation. Un modèle sur une clé USB — comme un couteau suisse : il ne remplace pas un atelier, mais sur le terrain, il est indispensable.

Deux gigas sur une clé USB. Zéro dépendance aux serveurs des autres. Ton propre IA de poche.

← Vers la base