Quel LLM à poids ouverts choisir ?
Comparez 23 modèles par taille, licence et VRAM réellement nécessaire, et trouvez le GPU cloud le moins cher pour servir chacun dès maintenant.
| Comparer | Modèle | Licence | VRAM nécessaire | Le moins cher à servir | Contexte max. | Actions |
|---|---|---|---|---|---|---|
| Qwen3 8BAlibaba8,2Bpublié en 16 bits | Apache 2.0 |
| 40K | Sur quoi le faire tourner ? | ||
| Gemma 4 31BGoogle31,3Bpublié en 16 bits | Apache 2.0 |
| 256K | Sur quoi le faire tourner ? | ||
| gpt-oss-20bOpenAI21B3,6B actifspublié en 4 bits | Apache 2.0 |
| 128K | Sur quoi le faire tourner ? | ||
| Qwen3 4BAlibaba4Bpublié en 16 bits | Apache 2.0 |
| 40K | Sur quoi le faire tourner ? | ||
| Llama 3.1 8B InstructMeta8Bpublié en 16 bits | Llama 3.1 Community |
| — | Sur quoi le faire tourner ? | ||
| gpt-oss-120bOpenAI117B5,1B actifspublié en 4 bits | Apache 2.0 |
| 128K | Sur quoi le faire tourner ? | ||
| Qwen3 32BAlibaba32,8Bpublié en 16 bits | Apache 2.0 |
| 40K | Sur quoi le faire tourner ? | ||
| Qwen3.6 35B-A3BAlibaba35B3B actifspublié en 16 bits | Apache 2.0 |
| 256K | Sur quoi le faire tourner ? | ||
| Qwen3.6 27BAlibaba27,8Bpublié en 16 bits | Apache 2.0 |
| 256K | Sur quoi le faire tourner ? | ||
| Mistral 7B Instruct v0.3Mistral AI7,2Bpublié en 16 bits | Apache 2.0 |
| 32K | Sur quoi le faire tourner ? | ||
| GLM-4.7 FlashZ.ai31,2Bpublié en 16 bits | MIT |
| 198K | Sur quoi le faire tourner ? | ||
| Kimi K3Moonshot AI2,8T104B actifspublié en 4 bits | Kimi K3 License |
| 1 024K | Sur quoi le faire tourner ? | ||
| DeepSeek V4 FlashDeepSeek284Bpublié en 4 bits | MIT |
| 1 024K | Sur quoi le faire tourner ? | ||
| GLM-5.2Z.ai753Bpublié en 16 bits | MIT |
| 1 024K | Sur quoi le faire tourner ? | ||
| DeepSeek R1DeepSeek671B37B actifspublié en 8 bits | MIT |
| 160K | Sur quoi le faire tourner ? | ||
| Gemma 3 12BGoogle12,2Bpublié en 16 bits | Gemma Terms of Use |
| — | Sur quoi le faire tourner ? | ||
| DeepSeek V4 ProDeepSeek1,6T49B actifspublié en 4 bits | MIT |
| 1 024K | Sur quoi le faire tourner ? | ||
| Qwen3 235B-A22BAlibaba235B22B actifspublié en 16 bits | Apache 2.0 |
| 40K | Sur quoi le faire tourner ? | ||
| Kimi K2.5Moonshot AI1T32B actifspublié en 4 bits | Modified MIT |
| 256K | Sur quoi le faire tourner ? | ||
| Mistral Small 3.2 24BMistral AI24Bpublié en 16 bits | Apache 2.0 |
| 128K | Sur quoi le faire tourner ? | ||
| Granite 4.1 8BIBM8,8Bpublié en 16 bits | Apache 2.0 |
| 128K | Sur quoi le faire tourner ? | ||
| Laguna-S 2.1Poolside118B8B actifspublié en 16 bits | OpenMDW 1.1 |
| 1 024K | Sur quoi le faire tourner ? | ||
| Solar Open2 250BUpstage250B15B actifspublié en 16 bits | Upstage Solar License |
| 1 024K | Sur quoi le faire tourner ? |
Comment ce tableau est construit
Chaque taille est mesurée à partir des fichiers de poids du checkpoint publié sur Hugging Face — jamais déduite du nombre de paramètres, qui fausse les versions quantifiées. La VRAM nécessaire correspond à ces poids plus 20 % pour les activations, le contexte CUDA et la marge de l'allocateur, avec un contexte court. Un modèle n'est jamais dimensionné au-dessus de la précision à laquelle il a été publié.
« Le moins cher à servir » désigne le tarif réservable le plus bas, à la demande ou Serverless, pour la plus petite configuration réellement vendue par un fournisseur qui contient le modèle — toujours accompagné de son type de location, car un tarif avec mise à l'échelle à zéro n'est pas un tarif horaire. Le prix couvre l'ensemble de la configuration.
La licence est le seul champ que nous n'avons pas mesuré : c'est ce que déclare la fiche du modèle, et elle est présentée comme telle. Il n'y a volontairement aucun score de benchmark ici — les évaluations de qualité sont des données tierces sélectionnées, et ce catalogue ne contient que des chiffres que nous pouvons garantir.