¿Qué LLM de pesos abiertos deberías ejecutar?

Compara 23 modelos por tamaño, licencia y la VRAM que realmente necesitan, y descubre la GPU en la nube más barata que sirve cada uno ahora mismo.

23 modelos98 tipos de GPU con capacidad reservable
Tamaño
Mostrando 23 de 23 modelosMarca hasta 4 modelos para verlos lado a lado.
CompararModeloLicenciaVRAM para servirMás barato de servirContexto máx.Acciones
Qwen3 8BAlibaba8,2Bpublicado en 16 bitsNo declarada
16 bits
20 GB
8 bits
11 GB
4 bits
6,3 GB
1× NVIDIA Tesla P4en 4 bits0,02 €/h bajo demandaVast.ai logoen Vast.ai
40K¿Qué lo ejecuta?
Gemma 4 31BGoogle31,3Bpublicado en 16 bitsNo declarada
16 bits
75 GB
8 bits
41 GB
4 bits
24 GB
2× NVIDIA Tesla V100 16GBen 4 bits0,05 €/h bajo demandaVast.ai logoen Vast.ai
256K¿Qué lo ejecuta?
Qwen3 4BAlibaba4Bpublicado en 16 bitsNo declarada
16 bits
9,7 GB
8 bits
5,3 GB
4 bits
3,1 GB
1× NVIDIA GTX 1050 Tien 4 bits0,01 €/h bajo demandaVast.ai logoen Vast.ai
40K¿Qué lo ejecuta?
gpt-oss-20bOpenAI21B3,6B activospublicado en 4 bitsNo declarada
16 bits
8 bits
4 bits
17 GB
2× NVIDIA Tesla V100 16GB0,05 €/h bajo demandaVast.ai logoen Vast.ai
128K¿Qué lo ejecuta?
Llama 3.1 8B InstructMeta8Bpublicado en 16 bitsNo declarada
16 bits
19 GB
8 bits
11 GB
4 bits
6,2 GB
1× NVIDIA Tesla P4en 4 bits0,02 €/h bajo demandaVast.ai logoen Vast.ai
¿Qué lo ejecuta?
Qwen3.6 27BAlibaba27,8Bpublicado en 16 bitsNo declarada
16 bits
67 GB
8 bits
37 GB
4 bits
21 GB
2× NVIDIA Tesla V100 16GBen 4 bits0,05 €/h bajo demandaVast.ai logoen Vast.ai
256K¿Qué lo ejecuta?
gpt-oss-120bOpenAI117B5,1B activospublicado en 4 bitsNo declarada
16 bits
8 bits
4 bits
78 GB
8× NVIDIA Tesla V100 16GB0,21 €/h bajo demandaVast.ai logoen Vast.ai
128K¿Qué lo ejecuta?
Qwen3 32BAlibaba32,8Bpublicado en 16 bitsNo declarada
16 bits
79 GB
8 bits
43 GB
4 bits
25 GB
2× NVIDIA Tesla V100 16GBen 4 bits0,05 €/h bajo demandaVast.ai logoen Vast.ai
40K¿Qué lo ejecuta?
Qwen3.6 35B-A3BAlibaba35B3B activospublicado en 16 bitsNo declarada
16 bits
86 GB
8 bits
47 GB
4 bits
28 GB
2× NVIDIA Tesla V100 16GBen 4 bits0,05 €/h bajo demandaVast.ai logoen Vast.ai
256K¿Qué lo ejecuta?
Mistral 7B Instruct v0.3Mistral AI7,2Bpublicado en 16 bitsNo declarada
16 bits
17 GB
8 bits
9,6 GB
4 bits
5,6 GB
1× NVIDIA Tesla P4en 8 bits0,02 €/h bajo demandaVast.ai logoen Vast.aiAjustado8 GB
32K¿Qué lo ejecuta?
Kimi K3Moonshot AI2,8T104B activospublicado en 4 bitsNo declarada
16 bits
8 bits
4 bits
1873 GB
8× AMD Instinct MI325X21,05 €/h bajo demandaCyfuture AI logoen Cyfuture AI
1024K¿Qué lo ejecuta?
GLM-4.7 FlashZ.ai31,2Bpublicado en 16 bitsNo declarada
16 bits
75 GB
8 bits
41 GB
4 bits
24 GB
2× NVIDIA Tesla V100 16GBen 4 bits0,05 €/h bajo demandaVast.ai logoen Vast.ai
198K¿Qué lo ejecuta?
DeepSeek V4 FlashDeepSeek284Bpublicado en 4 bitsNo declarada
16 bits
8 bits
4 bits
192 GB
8× NVIDIA RTX 30900,62 €/h bajo demandaVast.ai logoen Vast.ai
1024K¿Qué lo ejecuta?
GLM-5.2Z.ai753Bpublicado en 16 bitsNo declarada
16 bits
1808 GB
8 bits
994 GB
4 bits
579 GB
8× NVIDIA A100 80GBen 4 bits4,89 €/h bajo demandaVast.ai logoen Vast.ai
1024K¿Qué lo ejecuta?
DeepSeek R1DeepSeek671B37B activospublicado en 8 bitsNo declarada
16 bits
8 bits
826 GB
4 bits
481 GB
8× NVIDIA A100 80GBen 4 bits4,89 €/h bajo demandaVast.ai logoen Vast.ai
160K¿Qué lo ejecuta?
Granite 4.1 8BIBM8,8Bpublicado en 16 bitsNo declarada
16 bits
21 GB
8 bits
12 GB
4 bits
6,8 GB
1× NVIDIA Tesla P4en 4 bits0,02 €/h bajo demandaVast.ai logoen Vast.ai
128K¿Qué lo ejecuta?
Gemma 3 12BGoogle12,2Bpublicado en 16 bitsNo declarada
16 bits
29 GB
8 bits
16 GB
4 bits
9,4 GB
1× NVIDIA Tesla P4en 4 bits0,02 €/h bajo demandaVast.ai logoen Vast.aiAjustado8 GB
¿Qué lo ejecuta?
DeepSeek V4 ProDeepSeek1,6T49B activospublicado en 4 bitsNo declarada
16 bits
8 bits
4 bits
1038 GB
8× AMD Instinct MI300X19,36 €/h bajo demandaCyfuture AI logoen Cyfuture AI
1024K¿Qué lo ejecuta?
Kimi K2.5Moonshot AI1T32B activospublicado en 4 bitsNo declarada
16 bits
8 bits
4 bits
714 GB
8× NVIDIA A100 80GB4,89 €/h bajo demandaVast.ai logoen Vast.aiAjustado640 GB
256K¿Qué lo ejecuta?
Qwen3 235B-A22BAlibaba235B22B activospublicado en 16 bitsNo declarada
16 bits
564 GB
8 bits
310 GB
4 bits
181 GB
8× NVIDIA RTX 3090en 4 bits0,62 €/h bajo demandaVast.ai logoen Vast.ai
40K¿Qué lo ejecuta?
Mistral Small 3.2 24BMistral AI24Bpublicado en 16 bitsNo declarada
16 bits
58 GB
8 bits
32 GB
4 bits
18 GB
2× NVIDIA Tesla V100 16GBen 8 bits0,05 €/h bajo demandaVast.ai logoen Vast.ai
128K¿Qué lo ejecuta?
Laguna-S 2.1Poolside118B8B activospublicado en 16 bitsNo declarada
16 bits
282 GB
8 bits
155 GB
4 bits
90 GB
8× NVIDIA Tesla V100 16GBen 4 bits0,21 €/h bajo demandaVast.ai logoen Vast.ai
1024K¿Qué lo ejecuta?
Solar Open2 250BUpstage250B15B activospublicado en 16 bitsNo declarada
16 bits
601 GB
8 bits
330 GB
4 bits
192 GB
8× NVIDIA RTX 3090en 4 bits0,62 €/h bajo demandaVast.ai logoen Vast.aiAjustado192 GB
1024K¿Qué lo ejecuta?

Cómo se elabora esta tabla

Cada tamaño se mide a partir de los archivos de pesos del checkpoint publicado en Hugging Face, nunca se deriva del número de parámetros, que falla con las versiones cuantizadas. La VRAM para servir son esos pesos más un 20% para activaciones, contexto CUDA y margen del asignador, con contexto corto. Un modelo nunca se dimensiona por encima de la precisión con la que se publicó.

Más barato de servir es la tarifa reservable más baja, bajo demanda o serverless, para la configuración más pequeña que un proveedor vende realmente y que alberga el modelo, siempre etiquetada con su tipo de alquiler, porque una tarifa de escala a cero no es una tarifa por hora. El precio corresponde a la configuración completa.

La licencia es el único campo que no medimos: es lo que declara la tarjeta del modelo, y así se indica. Aquí no hay puntuaciones de benchmarks a propósito: las valoraciones de calidad son datos de terceros, y este catálogo solo recoge cifras que podemos respaldar.

Sigue explorando

Preguntas frecuentes

¿Cómo se calcula la VRAM necesaria para ejecutar cada modelo?
A partir del checkpoint publicado, no del número de parámetros. Sumamos los archivos de pesos del repositorio de Hugging Face de cada modelo, clasificamos la precisión según los bytes por parámetro medidos y añadimos un 20% para activaciones, contexto CUDA y margen del asignador. Los tamaños cuantizados solo se listan hasta la precisión con la que el modelo se publicó realmente, y un modelo que no podemos medir con confianza se retiene en lugar de estimarse.
¿Cuál es la forma más barata de servir Qwen3 8B ahora mismo?
En 4 bits, Qwen3 8B necesita 6,3 GB de VRAM y cabe con holgura en 1× Tesla P4, reservable bajo demanda desde 0,02 € por hora en Vast.ai. Es la configuración más barata de ese tipo entre las ofertas reservables que seguimos, actualizada junto con el resto del catálogo; los ajustes justos quedan fuera de esta respuesta.
¿Qué modelos aparecen?
23 LLM de pesos abiertos, seleccionados por popularidad y medidos a partir de sus checkpoints publicados. Para cada uno, el catálogo muestra el número de parámetros, la licencia declarada en la tarjeta del modelo, la VRAM necesaria en cada precisión publicada y la configuración de GPU en la nube más barata que lo alberga hoy, serverless incluido.
¿Por qué no hay puntuaciones de benchmarks?
Porque no las medimos nosotros. Los resultados de benchmarks y las valoraciones de arena son datos de terceros que cambian con cada marco de evaluación, y este catálogo solo recoge cifras que podemos respaldar: tamaño, VRAM y precio de servicio. Úsalo para preseleccionar modelos que puedas permitirte ejecutar y juzga la calidad en tu propia tarea.