# IA sur clé USB : lancer Llama et Qwen localement

_2026-03-07_

> Comment exécuter un LLM localement sur son propre matériel. Llama 3, Qwen 2.5/3, ollama, llama.cpp, quantifications GGUF. Installation portable sur clé USB.

tech

2026-03-07

Les API cloud, c'est pratique. Tant que tu as Internet, de l'argent pour l'abonnement, et que ça ne te dérange pas que quelqu'un d'autre lise chaque prompt. Si au moins un de ces points ne te convient pas — bienvenue dans l'inférence locale.

## Pourquoi faire

Quatre raisons de lancer un LLM sur ton propre matériel :

- **Confidentialité.** Les données ne quittent pas la machine. Pas de télémétrie, pas de logs sur un serveur tiers. Le prompt vit et meurt chez toi.
- **Hors ligne.** Avion, train, bunker sans Wi-Fi — le modèle fonctionne. Internet n'est nécessaire à aucune étape après le téléchargement.
- **Gratuit.** Zéro dollar par token. Pour toujours. Le seul investissement, c'est le matériel que tu possèdes déjà.
- **Sans censure.** Un modèle local répond à ce à quoi il répond. Pas de filtres d'entreprise, pas de « Je ne peux pas vous aider avec ça ».

## Outils

Deux options. Les deux fonctionnent, le choix dépend de ton degré de contrôle souhaité sur le processus.

**llama.cpp** — un moteur d'inférence en C/C++ pur. Fonctionne sur CPU, optionnellement GPU (CUDA, Metal, Vulkan). Aucune dépendance, aucun Python. Tu compiles, tu lances. Supporte le format GGUF, devenu le standard pour les modèles quantifiés.

**Ollama** — une surcouche de llama.cpp avec une interface humaine. Télécharge les modèles en une commande, les gère, expose une API. Si tu ne veux pas te soucier de la compilation et de la configuration, c'est ton option.

```
# Installation d'ollama (Linux/macOS)
curl -fsSL https://ollama.com/install.sh | sh

# Ou télécharge le binaire depuis https://ollama.com/download
```

## Modèles

Deux familles qui valent vraiment la peine d'être exécutées localement en 2026 :

**Llama 3.x** (Meta) — le cheval de bataille. Bon pour l'anglais, se débrouille correctement avec le russe. 8B paramètres — tient dans 8 Go de RAM. Il existe des versions 70B et 405B pour ceux qui ont du matériel sérieux.

**Qwen 2.5 / Qwen 3** (Alibaba) — le meilleur choix pour les tâches multilingues. Russe, chinois, code — de niveau. La version 7B rivalise avec Llama 3 8B, et la surpasse par endroits. Qwen 3 a ajouté un mode de réflexion — une chaîne de raisonnement directement dans le modèle.

## GGUF et quantifications

Les poids originaux des modèles pèsent des dizaines de gigaoctets et nécessitent un GPU. La quantification les compresse à une taille raisonnable avec une perte de qualité minimale.

Le format GGUF — un conteneur unique : poids + tokenizer + métadonnées dans un seul fichier. Tu télécharges, tu lances.

| Quantification | Taille (7B) | RAM | Qualité |
| --- | --- | --- | --- |
| `Q4_K_M` | ~4.1 Go | ~6 Go | Bonne. Équilibre optimal |
| `Q5_K_M` | ~4.8 Go | ~7 Go | Très bonne. Un peu plus lourd |
| `Q8_0` | ~7.2 Go | ~9 Go | Quasi sans perte. Si la RAM le permet |

**Recommandation :** `Q4_K_M` — le juste milieu. Les pertes de qualité sont minimes, et la différence de vitesse et de taille est significative. `Q5_K_M` — si tu as de la mémoire de réserve et que tu veux un peu plus de précision.

## Matériel minimum

| Configuration | Ce qu'elle peut gérer |
| --- | --- |
| **8 Go de RAM**, CPU x86\_64 quelconque | Modèles 7B (Q4\_K\_M). Option de base |
| **16 Go de RAM**, 4+ cœurs | Modèles 13B. Travail confortable avec 7B |
| **32 Go de RAM** ou GPU 12 Go+ | Modèles 33B–70B. Niveau sérieux |

Le GPU accélère considérablement la génération, mais n'est pas obligatoire. Sur CPU, ça fonctionne aussi — juste plus lentement. Apple Silicon (M1/M2/M3) — une excellente option : la mémoire unifiée permet de charger de gros modèles sans carte graphique dédiée.

## Démarrage rapide

De zéro à un modèle fonctionnel — deux commandes :

```
# Llama 3 8B
ollama run llama3

# Qwen 2.5 7B
ollama run qwen2.5

# Qwen 3 8B (avec mode de réflexion)
ollama run qwen3

# Quantification spécifique
ollama run llama3:8b-instruct-q5_K_M
```

Le premier lancement téléchargera le modèle (~4-5 Go). Ensuite, tout est local.

Ollama monte une API sur `localhost:11434`. Tu peux l'appeler depuis du code :

```
curl http://localhost:11434/api/generate -d '{
  "model": "qwen2.5",
  "prompt": "Explique la quantification des réseaux de neurones en trois phrases",
  "stream": false
}'
```

## Pour les puristes : llama.cpp directement

```
# Cloner et compiler
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp && make -j$(nproc)

# Lancer le modèle
./llama-cli -m /chemin/vers/modele.gguf \
  -p "Écris une fonction de tri en Python" \
  -n 512 -t 4

# Ou monter un serveur avec API
./llama-server -m /chemin/vers/modele.gguf \
  --host 0.0.0.0 --port 8080
```

Les fichiers GGUF se trouvent sur HuggingFace. Sources de quantification fiables : *bartowski*, *TheBloke* (legacy), *Qwen official*.

## L'IA sur une clé USB

Installation portable — tout sur une seule clé USB. Tu la branches sur n'importe quel ordinateur, tu lances.

Ce qu'il faut :

- Clé USB 3.0+ ou SSD externe (à partir de 32 Go)
- Binaires d'ollama ou llama.cpp (compilation statique, ~50 Mo)
- Un ou deux modèles en GGUF (~4-5 Go chacun)

```
# Structure de la clé USB
/LLM/
├── ollama              # binaire
├── models/
│   ├── llama3-8b-q4_k_m.gguf
│   └── qwen2.5-7b-q4_k_m.gguf
└── run.sh              # script de lancement
```

```
#!/bin/bash
# run.sh — lancement depuis la clé USB
export OLLAMA_MODELS="$(dirname "$0")/models"
export OLLAMA_HOST="127.0.0.1:11434"
"$(dirname "$0")/ollama" serve &
sleep 2
"$(dirname "$0")/ollama" run llama3
```

> Un SSD externe plutôt qu'une clé USB — chargement du modèle bien plus rapide. Une clé USB classique fera l'affaire, mais le premier lancement sera long. Une fois chargé en RAM, la vitesse du support de stockage n'a plus d'importance.

## Performances

À quoi s'attendre réellement. Modèle 7B, quantification Q4\_K\_M :

| Matériel | Tokens/s | Sensation |
| --- | --- | --- |
| i5/Ryzen 5, 16 Go, CPU uniquement | 8–15 | Tape lentement, mais lisible |
| Apple M1/M2, 16 Go | 25–40 | Confortable. Comme une frappe rapide |
| RTX 3060 12 Go | 40–60 | Rapide. Réponse en quelques secondes |
| RTX 4090 24 Go | 80–120 | Instantané |

Pour les modèles 13B — divise environ par deux. Pour les 70B — il faut un GPU avec 48 Go de VRAM ou beaucoup de RAM pour l'inférence CPU (lent, mais ça marche).

Autre point : le premier token est toujours plus lent (traitement du prompt). Un prompt long — un délai notable avant le premier mot de la réponse. Les prompts courts — presque instantanés.

## Que choisir

- **Pour le texte et le chat en russe** — Qwen 2.5 7B. Le meilleur russe parmi les modèles de cette taille.
- **Pour le code** — Qwen 2.5 Coder 7B ou Llama 3 8B. Les deux sont bons.
- **Pour le raisonnement** — Qwen 3 8B avec mode de réflexion. Plus lent, mais plus intelligent.
- **Pour une vitesse maximale** — Llama 3 8B Q4\_K\_M. Léger, rapide.

· · ·

Les LLM locaux ne remplacent pas GPT-4 ou Claude. C'est un outil différent pour des tâches différentes. Assistant privé, aide hors ligne, terrain d'expérimentation. Un modèle sur une clé USB — comme un couteau suisse : il ne remplace pas un atelier, mais sur le terrain, il est indispensable.

Deux gigas sur une clé USB. Zéro dépendance aux serveurs des autres. Ton propre IA de poche.

[← Vers la base](../index.html)