Quel GPU pour ce LLM ?
Choisissez le modèle que vous voulez servir. Nous le dimensionnons à partir du checkpoint publié et listons les configurations les moins chères que vous pouvez louer aujourd'hui pour l'accueillir — avec le tarif à la demande et Serverless de chacune.
1 · Choisissez un modèle
2 · Ce qu'il lui faut
Qwen3 8B en 16 bits
20 GB de VRAM
avec un contexte court — mesuré à partir du checkpoint publié, et non estimé d'après le nombre de paramètres.
- Poids du modèle
- 16 GB
- Cache KVinclus dans le surcoût
- —
- Surcoût d'exécution20 % des poids
- 3,3 GB
À propos de ce modèle
- Paramètres
- 8,2B
- Publié en
- 16 bits
- Poids mesurés
- 16 GB
3 · Où l'exécuter
Configurations réservables
Les moins chères d'abord, parmi 96 types de GPU avec capacité réservable en temps réel.
| Configuration | VRAM totale | À la demande | Serverless | Détails du GPU |
|---|---|---|---|---|
| 2× NVIDIA RTX A2000 | 24 GB 4,3 GB libres | 0,05 €/h 0,03 €/GPU/h | — | Voir tous les prix |
| 4× NVIDIA GTX 1660 Super | 24 GB 4,3 GB libres | 0,07 €/h 0,02 €/GPU/h | — | Voir tous les prix |
| 1× NVIDIA RTX 3090 | 24 GB 4,3 GB libres | 0,08 €/h | 0,61 €/h Runpod | Voir tous les prix |
| 2× NVIDIA RTX 3060 | 24 GB 4,3 GB libres | 0,09 €/h 0,04 €/GPU/h | — | Voir tous les prix |
| 2× NVIDIA Titan Xp | 24 GB 4,3 GB libres | 0,09 €/h 0,04 €/GPU/h | — | Voir tous les prix |
| 2× NVIDIA Tesla V100 16GB | 32 GB 12 GB libres | 0,11 €/h 0,05 €/GPU/h | — | Voir tous les prix |
| 2× NVIDIA GTX Titan X | 24 GB 4,3 GB libres | 0,11 €/h 0,05 €/GPU/h | — | Voir tous les prix |
| 1× NVIDIA RTX 6000 | 24 GB 4,3 GB libres | 0,12 €/h | — | Voir tous les prix |
Affichage des 8 moins chères. Poids du modèle plus 20 % de surcoût d'exécution, d'après la taille mesurée des checkpoints ; une longueur de contexte indiquée ajoute son cache KV. Chaque prix est le tarif réservable le plus bas pour cette taille d'instance exacte, pour l'ensemble de la configuration — le moins cher des deux est mis en évidence et détermine l'ordre du tableau. Un chiffre ×N correspond à la VRAM totale sur N cartes et ne préjuge en rien du débit d'interconnexion.
Méthode de calcul
La taille des poids est mesurée à partir des fichiers de checkpoint réels sur Hugging Face — jamais déduite du nombre de paramètres, qui fausse le calcul pour les versions quantifiées. Aux poids, nous ajoutons 20 % pour les activations, le contexte CUDA et la marge de l'allocateur. Indiquer une longueur de contexte ajoute explicitement son cache KV, calculé uniquement pour les architectures dont la configuration décrit la forme du cache sans ambiguïté.
Une configuration qui peut contenir les poids et le cache, mais pas toute cette marge, est signalée comme tenant de justesse plutôt que masquée — le modèle se chargera et pourra très bien tourner avec un batch de taille un, mais attendez-vous à des difficultés sous charge.
Les prix correspondent au tarif réservable le plus bas pour cette taille d'instance exacte, actualisés avec le reste du catalogue.
