Inférence locale · mesures réelles

Quel GPU pour vos LLM en local ?

Tokens/s, VRAM occupée, consommation réelle : chaque carte est mesurée avec le même protocole llama.cpp. Des chiffres enfin comparables, pour choisir avant d'acheter.

3

GPU mesurés

21

Runs vérifiés

6

Modèles testés

Notre modèle de référence : Meta Llama 3.1 8B Instruct Q4_K_M — testé par toutes les cartes, c'est lui qui rend le classement comparable.

Classement génération

Tokens/s moyens · sélectionne un ou plusieurs modèles

GPUVRAMGénérationPromptConso moy.VRAM utiliséeRunsPrix
1RTX 5070 Ti16 Go151 tok/s6 818 tok/s161 W5,4 Go1
1 200 € (04/08/26)LDLC
2RTX 4090démo24 Go132 tok/s5 900 tok/s285 W6,2 Go1
3RTX 5080démo16 Go124 tok/s5 100 tok/s250 W6,0 Go1
1 600 € (04/08/26)LDLC
4RTX 4080démo16 Go103 tok/s4 700 tok/s230 W6,1 Go1
780 € (04/08/26)LDLC
5RTX 4070 Ti12 Go89,6 tok/s5 960 tok/s158 W5,6 Go2
927 € (04/08/26)LDLC
6RTX 407012 Go82,3 tok/s4 336 tok/s138 W6,8 Go1
595 € (04/08/26)LDLC
7RTX 3060démo12 Go48,0 tok/s1 500 tok/s155 W5,9 Go1
260 € (04/08/26)LDLC

Génération = vitesse d'écriture de la réponse (la métrique que tu ressens). Un « — » = carte non testée sur ce modèle (souvent : il ne tient pas dans sa VRAM). Liens LDLC = recherche filtrée cartes graphiques.

90 tok/s, ça fait quoi en vrai ? Mets les cartes côte à côte et regarde la même réponse s'écrire à leur vitesse réelle.

Un protocole, trois étapes

Pas de saisie manuelle : le CLI exécute le benchmark et relève la télémétrie lui-même. Ce qui entre en base est mesuré, jamais déclaré.

Télécharge

llama.cpp (binaire officiel) et le modèle GGUF de référence.

Lance le CLI

Une commande : il mesure tokens/s, VRAM, températures et consommation.

Publie

Le run vérifié rejoint la base et apparaît dans le classement.

Guide complet