NVIDIA
RTX 3060
260 € relevé le 04/08/26
12 Go
VRAM
48,0 tok/s
Meilleure génération
0,31 tok/s/W
Efficacité (réf.)
0,22 €/M tok
Coût élec. / M tokens (réf.)
Ce que cette carte fait tourner
Llama 3.2 3B Instruct Q4_K_M
2.02 Go
Qwen2.5 7B Instruct Q4_K_M
4.68 Go
Meta Llama 3.1 8B Instruct Q4_K_M★
4.92 Go · 48,0 tok/s mesurés
Qwen2.5 14B Instruct Q4_K_M
8.99 Go
DeepSeek R1 Distill Qwen 14B Q4_K_M
8.99 Go
Phi-4 Q4_K_M
9.05 Go
Fluide ≥ 60 tok/s (plus vite qu'on ne lit) · Confortable 30-60 · Lent < 30 · « Ne tient pas » = taille du modèle + 2 Go de marge > VRAM (le déchargement CPU est exclu du protocole : les chiffres n'auraient plus de sens).
Mesures par modèle
48,0 tok/s
Génération (moy.)
0,31 tok/s/W
Efficacité
0,22 €/M tok
Coût électrique
1
Runs
Coût = électricité seule (0,25 €/kWh), pour générer 1 million de tokens à la vitesse mesurée — l'unité de facturation des API cloud, la comparaison est volontaire.
Évolution dans le temps
Chaque point = un run (version de llama.cpp au survol). L'historique se construit en re-benchant la même carte au fil des versions — les drivers et llama.cpp font bouger les chiffres.
| Date | Version | Génération | Prompt | VRAM pic | Temp. max | Conso | Contexte | Source |
|---|---|---|---|---|---|---|---|---|
| 04/08 | — | 48,0 | 1 500 | 5,9 Go | 68 °C | 155 W | — | démo |
VRAM utilisée = pic de mémoire GPU système pendant le run (inclut l'OS, compte ~0,5 à 1 Go de plus que le modèle seul).