Quel LLM à poids ouverts choisir ?

Comparez 23 modèles par taille, licence et VRAM réellement nécessaire, et trouvez le GPU cloud le moins cher pour servir chacun dès maintenant.

23 modèles96 types de GPU avec capacité réservable
Taille
23 modèles affichés sur 23Cochez jusqu'à 4 modèles pour les comparer côte à côte.
ComparerModèleLicenceVRAM nécessaireLe moins cher à servirContexte max.Actions
Qwen3 8BAlibaba8,2Bpublié en 16 bitsApache 2.0
16 bits
20 GB
8 bits
11 GB
4 bits
6,3 GB
1× NVIDIA GTX 1060en 4 bits0,03 €/h à la demandechez Vast.aiJuste6 GB
40KSur quoi le faire tourner ?
Gemma 4 31BGoogle31,3Bpublié en 16 bitsApache 2.0
16 bits
75 GB
8 bits
41 GB
4 bits
24 GB
2× NVIDIA RTX A2000en 4 bits0,05 €/h à la demandechez Vast.aiJuste24 GB
256KSur quoi le faire tourner ?
gpt-oss-20bOpenAI21B3,6B actifspublié en 4 bitsApache 2.0
16 bits
—
8 bits
—
4 bits
17 GB
1× NVIDIA Quadro RTX 50000,04 €/h à la demandechez Vast.aiJuste16 GB
128KSur quoi le faire tourner ?
Qwen3 4BAlibaba4Bpublié en 16 bitsApache 2.0
16 bits
9,7 GB
8 bits
5,3 GB
4 bits
3,1 GB
1× NVIDIA GTX 1660 Superen 8 bits0,02 €/h à la demandechez Vast.ai
40KSur quoi le faire tourner ?
Llama 3.1 8B InstructMeta8Bpublié en 16 bitsLlama 3.1 Community
16 bits
19 GB
8 bits
11 GB
4 bits
6,2 GB
1× NVIDIA GTX 1060en 4 bits0,03 €/h à la demandechez Vast.aiJuste6 GB
—Sur quoi le faire tourner ?
gpt-oss-120bOpenAI117B5,1B actifspublié en 4 bitsApache 2.0
16 bits
—
8 bits
—
4 bits
78 GB
128KSur quoi le faire tourner ?
Qwen3 32BAlibaba32,8Bpublié en 16 bitsApache 2.0
16 bits
79 GB
8 bits
43 GB
4 bits
25 GB
2× NVIDIA RTX A2000en 4 bits0,05 €/h à la demandechez Vast.aiJuste24 GB
40KSur quoi le faire tourner ?
Qwen3.6 35B-A3BAlibaba35B3B actifspublié en 16 bitsApache 2.0
16 bits
86 GB
8 bits
47 GB
4 bits
28 GB
2× NVIDIA RTX A2000en 4 bits0,05 €/h à la demandechez Vast.aiJuste24 GB
256KSur quoi le faire tourner ?
Qwen3.6 27BAlibaba27,8Bpublié en 16 bitsApache 2.0
16 bits
67 GB
8 bits
37 GB
4 bits
21 GB
2× NVIDIA RTX A2000en 4 bits0,05 €/h à la demandechez Vast.ai
256KSur quoi le faire tourner ?
Mistral 7B Instruct v0.3Mistral AI7,2Bpublié en 16 bitsApache 2.0
16 bits
17 GB
8 bits
9,6 GB
4 bits
5,6 GB
1× NVIDIA GTX 1660 Superen 4 bits0,02 €/h à la demandechez Vast.ai
32KSur quoi le faire tourner ?
GLM-4.7 FlashZ.ai31,2Bpublié en 16 bitsMIT
16 bits
75 GB
8 bits
41 GB
4 bits
24 GB
2× NVIDIA RTX A2000en 4 bits0,05 €/h à la demandechez Vast.ai
198KSur quoi le faire tourner ?
Kimi K3Moonshot AI2,8T104B actifspublié en 4 bitsKimi K3 License
16 bits
—
8 bits
—
4 bits
1 873 GB
8× AMD Instinct MI325X21,16 €/h à la demandechez Cyfuture AI
1 024KSur quoi le faire tourner ?
DeepSeek V4 FlashDeepSeek284Bpublié en 4 bitsMIT
16 bits
—
8 bits
—
4 bits
192 GB
2× NVIDIA A800 80GB PCIe0,82 €/h à la demandechez Vast.aiJuste160 GB
1 024KSur quoi le faire tourner ?
GLM-5.2Z.ai753Bpublié en 16 bitsMIT
16 bits
1 808 GB
8 bits
994 GB
4 bits
579 GB
8× NVIDIA A100 80GBen 4 bits2,81 €/h à la demandechez Vast.ai
1 024KSur quoi le faire tourner ?
DeepSeek R1DeepSeek671B37B actifspublié en 8 bitsMIT
16 bits
—
8 bits
826 GB
4 bits
481 GB
8× NVIDIA A100 80GBen 4 bits2,81 €/h à la demandechez Vast.ai
160KSur quoi le faire tourner ?
Gemma 3 12BGoogle12,2Bpublié en 16 bitsGemma Terms of Use
16 bits
29 GB
8 bits
16 GB
4 bits
9,4 GB
2× NVIDIA GTX 1660 Superen 4 bits0,04 €/h à la demandechez Vast.ai
—Sur quoi le faire tourner ?
DeepSeek V4 ProDeepSeek1,6T49B actifspublié en 4 bitsMIT
16 bits
—
8 bits
—
4 bits
1 038 GB
8× AMD Instinct MI300X19,46 €/h à la demandechez Cyfuture AI
1 024KSur quoi le faire tourner ?
Qwen3 235B-A22BAlibaba235B22B actifspublié en 16 bitsApache 2.0
16 bits
564 GB
8 bits
310 GB
4 bits
181 GB
2× NVIDIA A800 80GB PCIeen 4 bits0,82 €/h à la demandechez Vast.aiJuste160 GB
40KSur quoi le faire tourner ?
Kimi K2.5Moonshot AI1T32B actifspublié en 4 bitsModified MIT
16 bits
—
8 bits
—
4 bits
714 GB
8× NVIDIA A100 80GB2,81 €/h à la demandechez Vast.aiJuste640 GB
256KSur quoi le faire tourner ?
Mistral Small 3.2 24BMistral AI24Bpublié en 16 bitsApache 2.0
16 bits
58 GB
8 bits
32 GB
4 bits
18 GB
1× NVIDIA Quadro RTX 5000en 4 bits0,04 €/h à la demandechez Vast.aiJuste16 GB
128KSur quoi le faire tourner ?
Granite 4.1 8BIBM8,8Bpublié en 16 bitsApache 2.0
16 bits
21 GB
8 bits
12 GB
4 bits
6,8 GB
1× NVIDIA GTX 1060en 4 bits0,03 €/h à la demandechez Vast.aiJuste6 GB
128KSur quoi le faire tourner ?
Laguna-S 2.1Poolside118B8B actifspublié en 16 bitsOpenMDW 1.1
16 bits
282 GB
8 bits
155 GB
4 bits
90 GB
8× NVIDIA Tesla V100 16GBen 4 bits0,21 €/h à la demandechez Vast.ai
1 024KSur quoi le faire tourner ?
Solar Open2 250BUpstage250B15B actifspublié en 16 bitsUpstage Solar License
16 bits
601 GB
8 bits
330 GB
4 bits
192 GB
11× NVIDIA RTX A4000en 4 bits1,25 €/h à la demandechez Vast.aiJuste176 GB
1 024KSur quoi le faire tourner ?

Comment ce tableau est construit

Chaque taille est mesurée à partir des fichiers de poids du checkpoint publié sur Hugging Face — jamais déduite du nombre de paramètres, qui fausse les versions quantifiées. La VRAM nécessaire correspond à ces poids plus 20 % pour les activations, le contexte CUDA et la marge de l'allocateur, avec un contexte court. Un modèle n'est jamais dimensionné au-dessus de la précision à laquelle il a été publié.

« Le moins cher à servir » désigne le tarif réservable le plus bas, à la demande ou Serverless, pour la plus petite configuration réellement vendue par un fournisseur qui contient le modèle — toujours accompagné de son type de location, car un tarif avec mise à l'échelle à zéro n'est pas un tarif horaire. Le prix couvre l'ensemble de la configuration.

La licence est le seul champ que nous n'avons pas mesuré : c'est ce que déclare la fiche du modèle, et elle est présentée comme telle. Il n'y a volontairement aucun score de benchmark ici — les évaluations de qualité sont des données tierces sélectionnées, et ce catalogue ne contient que des chiffres que nous pouvons garantir.

Pour aller plus loin

Questions fréquentes

Comment la VRAM nécessaire pour faire tourner chaque modèle est-elle calculée ?
À partir du checkpoint publié, pas du nombre de paramètres. Nous additionnons les fichiers de poids du dépôt Hugging Face de chaque modèle, déterminons la précision à partir du nombre d'octets mesuré par paramètre, et ajoutons 20 % pour les activations, le contexte CUDA et la marge de l'allocateur. Les tailles quantifiées ne sont indiquées qu'à la précision de publication du modèle ou en dessous, et un modèle que nous ne pouvons pas mesurer de façon fiable est mis de côté plutôt qu'estimé.
Quelle est la façon la moins chère de servir Qwen3 8B en ce moment ?
En 8 bits, Qwen3 8B nécessite 11 GB de VRAM et tient confortablement dans 2× GTX 1660 Super, réservable à la demande à partir de 0,04 € de l'heure chez Vast.ai. C'est la configuration de ce type la moins chère parmi les offres réservables que nous suivons, actualisée avec le reste du catalogue ; les configurations qui tiennent de justesse sont exclues de cette réponse.
Quels modèles sont répertoriés ?
23 LLM à poids ouverts, sélectionnés pour leur popularité et mesurés à partir de leurs checkpoints publiés. Pour chacun, le catalogue indique le nombre de paramètres, la licence déclarée sur la fiche du modèle, la VRAM nécessaire à chaque précision de publication, et la configuration GPU cloud la moins chère qui le fait tenir aujourd'hui, Serverless compris.
Pourquoi n'y a-t-il pas de scores de benchmark ?
Parce que nous ne les avons pas mesurés. Les résultats de benchmarks et les classements d'arènes sont des données tierces qui changent avec chaque protocole d'évaluation, et ce catalogue ne contient que des chiffres que nous pouvons garantir : taille, VRAM et prix pour servir le modèle. Utilisez-le pour présélectionner les modèles que vous pouvez vous permettre de faire tourner, puis jugez la qualité sur votre propre tâche.