Les pages GPU listent des LLM à poids ouverts populaires et la VRAM que nous estimons nécessaire pour chacun. La taille des poids de chaque modèle est mesurée à partir des fichiers de son checkpoint publié sur Hugging Face, et non déduite de son nombre de paramètres — un calcul fondé sur les paramètres n'est pas fiable pour les modèles publiés dans des formats quantifiés récents. Un checkpoint dont la taille mesurée ne correspond à aucune précision connue est mis de côté plutôt que publié sur une supposition.
Aux poids, nous ajoutons 20 % pour le cache KV, les activations et la surcharge du framework, en supposant des contextes courts. Les contextes longs, les grands batchs, le décodage spéculatif et le service de plusieurs modèles demandent tous davantage. Les tailles pour une précision à laquelle un modèle n'a pas été publié (par exemple une version 4 bits d'un modèle publié en 16 bits) sont estimées à partir de quantifications communautaires mesurées, puis arrondies à la hausse. Un modèle dont les poids tiennent, mais pas la surcharge, est indiqué comme tenant de justesse, avec la marge que cette configuration laisse réellement : il se chargera, mais un contexte long ou un grand batch peut encore saturer la carte.
Une valeur « ×N » signifie que le modèle tient dans la VRAM totale de N de ces GPU. Elle ne dit rien de la bande passante d'interconnexion, que nous ne suivons pas et qui détermine si la répartition d'un modèle sur plusieurs cartes est réellement rapide. Considérez chaque valeur comme un point de départ et vérifiez avant de vous engager dans une location.