Quel GPU pour ce LLM ?

Choisissez le modèle que vous voulez servir. Nous le dimensionnons à partir du checkpoint publié et listons les configurations les moins chères que vous pouvez louer aujourd'hui pour l'accueillir — avec le tarif à la demande et Serverless de chacune.

1 · Choisissez un modèle

Modèle
Précision
Contexte

2 · Ce qu'il lui faut

Qwen3 8B en 16 bits

20 GB de VRAM

avec un contexte court — mesuré à partir du checkpoint publié, et non estimé d'après le nombre de paramètres.

Poids du modèle
16 GB
Cache KVinclus dans le surcoût
—
Surcoût d'exécution20 % des poids
3,3 GB

À propos de ce modèle

Qwen3 8BAlibaba
Paramètres
8,2B
Publié en
16 bits
Poids mesurés
16 GB
Checkpoint sourceQwen/Qwen3-8B

3 · Où l'exécuter

Configurations réservables

Les moins chères d'abord, parmi 96 types de GPU avec capacité réservable en temps réel.

ConfigurationVRAM totaleÀ la demandeServerlessDétails du GPU
2× NVIDIA RTX A2000
24 GB
4,3 GB libres
0,05 €/h
0,03 €/GPU/h
Vast.ai
—Voir tous les prix
4× NVIDIA GTX 1660 Super
24 GB
4,3 GB libres
0,07 €/h
0,02 €/GPU/h
Vast.ai
—Voir tous les prix
1× NVIDIA RTX 3090
24 GB
4,3 GB libres
0,08 €/h
Akash Network
0,61 €/h
Runpod
Voir tous les prix
2× NVIDIA RTX 3060
24 GB
4,3 GB libres
0,09 €/h
0,04 €/GPU/h
Vast.ai
—Voir tous les prix
2× NVIDIA Titan Xp
24 GB
4,3 GB libres
0,09 €/h
0,04 €/GPU/h
Vast.ai
—Voir tous les prix
2× NVIDIA Tesla V100 16GB
32 GB
12 GB libres
0,11 €/h
0,05 €/GPU/h
Vast.ai
—Voir tous les prix
2× NVIDIA GTX Titan X
24 GB
4,3 GB libres
0,11 €/h
0,05 €/GPU/h
Vast.ai
—Voir tous les prix
1× NVIDIA RTX 6000
24 GB
4,3 GB libres
0,12 €/h
Vast.ai
—Voir tous les prix

Affichage des 8 moins chères. Poids du modèle plus 20 % de surcoût d'exécution, d'après la taille mesurée des checkpoints ; une longueur de contexte indiquée ajoute son cache KV. Chaque prix est le tarif réservable le plus bas pour cette taille d'instance exacte, pour l'ensemble de la configuration — le moins cher des deux est mis en évidence et détermine l'ordre du tableau. Un chiffre ×N correspond à la VRAM totale sur N cartes et ne préjuge en rien du débit d'interconnexion.

Méthode de calcul

La taille des poids est mesurée à partir des fichiers de checkpoint réels sur Hugging Face — jamais déduite du nombre de paramètres, qui fausse le calcul pour les versions quantifiées. Aux poids, nous ajoutons 20 % pour les activations, le contexte CUDA et la marge de l'allocateur. Indiquer une longueur de contexte ajoute explicitement son cache KV, calculé uniquement pour les architectures dont la configuration décrit la forme du cache sans ambiguïté.

Une configuration qui peut contenir les poids et le cache, mais pas toute cette marge, est signalée comme tenant de justesse plutôt que masquée — le modèle se chargera et pourra très bien tourner avec un batch de taille un, mais attendez-vous à des difficultés sous charge.

Les prix correspondent au tarif réservable le plus bas pour cette taille d'instance exacte, actualisés avec le reste du catalogue.

Continuer l'exploration