Classement

NVIDIA

RTX 5070 Ti

1 200 € relevé le 04/08/26

16 Go

VRAM

297 tok/s

Meilleure génération

0,94 tok/s/W

Efficacité (réf.)

0,07 €/M tok

Coût élec. / M tokens (réf.)

Ce que cette carte fait tourner

Llama 3.2 3B Instruct Q4_K_M

2.02 Go · 297 tok/s mesurés

Fluide

Qwen2.5 7B Instruct Q4_K_M

4.68 Go · 160 tok/s mesurés

Fluide

Meta Llama 3.1 8B Instruct Q4_K_M

4.92 Go · 151 tok/s mesurés

Fluide

Qwen2.5 14B Instruct Q4_K_M

8.99 Go · 82,5 tok/s mesurés

Fluide

DeepSeek R1 Distill Qwen 14B Q4_K_M

8.99 Go · 82,5 tok/s mesurés

Fluide

Phi-4 Q4_K_M

9.05 Go · 84,0 tok/s mesurés

Fluide

Fluide ≥ 60 tok/s (plus vite qu'on ne lit) · Confortable 30-60 · Lent < 30 · « Ne tient pas » = taille du modèle + 2 Go de marge > VRAM (le déchargement CPU est exclu du protocole : les chiffres n'auraient plus de sens).

Mesures par modèle

297 tok/s

Génération (moy.)

2,32 tok/s/W

Efficacité

0,03 €/M tok

Coût électrique

1

Runs

Coût = électricité seule (0,25 €/kWh), pour générer 1 million de tokens à la vitesse mesurée — l'unité de facturation des API cloud, la comparaison est volontaire.

Évolution dans le temps

Chaque point = un run (version de llama.cpp au survol). L'historique se construit en re-benchant la même carte au fil des versions — les drivers et llama.cpp font bouger les chiffres.

DateVersionGénérationPromptVRAM picTemp. maxConsoContexteSource
04/08llama.cpp 96278e39f29715 1883,0 Go53 °C128 Wmesuré

VRAM utilisée = pic de mémoire GPU système pendant le run (inclut l'OS, compte ~0,5 à 1 Go de plus que le modèle seul).