Las páginas de GPU muestran LLM populares de pesos abiertos y la VRAM que estimamos que necesitan. El tamaño de los pesos se mide a partir de los archivos del checkpoint publicado en Hugging Face, no se deduce del número de parámetros: el cálculo basado en parámetros no es fiable para los modelos publicados en formatos cuantizados recientes. Un checkpoint cuyo tamaño medido no coincide con ninguna precisión conocida se retiene en lugar de publicarse con una estimación.
Sobre los pesos añadimos un 20 % para la caché KV, las activaciones y la sobrecarga del framework, asumiendo contextos cortos. Los contextos largos, los lotes grandes, la decodificación especulativa y servir varios modelos a la vez necesitan más. Los tamaños de una precisión en la que un modelo no se publicó (por ejemplo, una versión de 4 bits de una publicación de 16 bits) se estiman a partir de cuantizaciones de la comunidad ya medidas y se redondean al alza. Cuando los pesos caben pero la sobrecarga no, el modelo se muestra como un ajuste ajustado, con el margen que esa configuración deja realmente: se carga, pero un contexto largo o un lote grande aún pueden agotar la tarjeta.
Una cifra «×N» significa que el modelo cabe en la VRAM total de N de estas GPU. No dice nada sobre el ancho de banda de la interconexión, que no registramos y que determina si repartir un modelo entre varias tarjetas es realmente rápido. Considera cada cifra un punto de partida y verifícala antes de contratar.