Inférence locale · mesures réelles
Quel GPU pour vos LLM en local ?
Tokens/s, VRAM occupée, consommation réelle : chaque carte est mesurée avec le même protocole llama.cpp. Des chiffres enfin comparables, pour choisir avant d'acheter.
3
GPU mesurés
21
Runs vérifiés
6
Modèles testés
Notre modèle de référence : Meta Llama 3.1 8B Instruct Q4_K_M — testé par toutes les cartes, c'est lui qui rend le classement comparable.
Classement génération
Tokens/s moyens · sélectionne un ou plusieurs modèles
| GPU | VRAM | Génération | Prompt | Conso moy. | VRAM utilisée | Runs | Prix |
|---|---|---|---|---|---|---|---|
| 1RTX 5070 Ti | 16 Go | 151 tok/s | 6 818 tok/s | 161 W | 5,4 Go | 1 | 1 200 € (04/08/26)LDLC |
| 2RTX 4090démo | 24 Go | 132 tok/s | 5 900 tok/s | 285 W | 6,2 Go | 1 | |
| 3RTX 5080démo | 16 Go | 124 tok/s | 5 100 tok/s | 250 W | 6,0 Go | 1 | 1 600 € (04/08/26)LDLC |
| 4RTX 4080démo | 16 Go | 103 tok/s | 4 700 tok/s | 230 W | 6,1 Go | 1 | 780 € (04/08/26)LDLC |
| 5RTX 4070 Ti | 12 Go | 89,6 tok/s | 5 960 tok/s | 158 W | 5,6 Go | 2 | 927 € (04/08/26)LDLC |
| 6RTX 4070 | 12 Go | 82,3 tok/s | 4 336 tok/s | 138 W | 6,8 Go | 1 | 595 € (04/08/26)LDLC |
| 7RTX 3060démo | 12 Go | 48,0 tok/s | 1 500 tok/s | 155 W | 5,9 Go | 1 | 260 € (04/08/26)LDLC |
Génération = vitesse d'écriture de la réponse (la métrique que tu ressens). Un « — » = carte non testée sur ce modèle (souvent : il ne tient pas dans sa VRAM). Liens LDLC = recherche filtrée cartes graphiques.
90 tok/s, ça fait quoi en vrai ? Mets les cartes côte à côte et regarde la même réponse s'écrire à leur vitesse réelle.Un protocole, trois étapes
Pas de saisie manuelle : le CLI exécute le benchmark et relève la télémétrie lui-même. Ce qui entre en base est mesuré, jamais déclaré.
Télécharge
llama.cpp (binaire officiel) et le modèle GGUF de référence.
Lance le CLI
Une commande : il mesure tokens/s, VRAM, températures et consommation.
Publie
Le run vérifié rejoint la base et apparaît dans le classement.