¿Qué LLM de pesos abiertos deberías ejecutar?
Compara 23 modelos por tamaño, licencia y la VRAM que realmente necesitan, y descubre la GPU en la nube más barata que sirve cada uno ahora mismo.
| Comparar | Modelo | Licencia | VRAM para servir | Más barato de servir | Contexto máx. | Acciones |
|---|---|---|---|---|---|---|
| Qwen3 8BAlibaba8,2Bpublicado en 16 bits | No declarada |
| 40K | ¿Qué lo ejecuta? | ||
| Gemma 4 31BGoogle31,3Bpublicado en 16 bits | No declarada |
| 256K | ¿Qué lo ejecuta? | ||
| Qwen3 4BAlibaba4Bpublicado en 16 bits | No declarada |
| 40K | ¿Qué lo ejecuta? | ||
| gpt-oss-20bOpenAI21B3,6B activospublicado en 4 bits | No declarada |
| 128K | ¿Qué lo ejecuta? | ||
| Llama 3.1 8B InstructMeta8Bpublicado en 16 bits | No declarada |
| — | ¿Qué lo ejecuta? | ||
| Qwen3.6 27BAlibaba27,8Bpublicado en 16 bits | No declarada |
| 256K | ¿Qué lo ejecuta? | ||
| gpt-oss-120bOpenAI117B5,1B activospublicado en 4 bits | No declarada |
| 128K | ¿Qué lo ejecuta? | ||
| Qwen3 32BAlibaba32,8Bpublicado en 16 bits | No declarada |
| 40K | ¿Qué lo ejecuta? | ||
| Qwen3.6 35B-A3BAlibaba35B3B activospublicado en 16 bits | No declarada |
| 256K | ¿Qué lo ejecuta? | ||
| Mistral 7B Instruct v0.3Mistral AI7,2Bpublicado en 16 bits | No declarada |
| 32K | ¿Qué lo ejecuta? | ||
| Kimi K3Moonshot AI2,8T104B activospublicado en 4 bits | No declarada |
| 1024K | ¿Qué lo ejecuta? | ||
| GLM-4.7 FlashZ.ai31,2Bpublicado en 16 bits | No declarada |
| 198K | ¿Qué lo ejecuta? | ||
| DeepSeek V4 FlashDeepSeek284Bpublicado en 4 bits | No declarada |
| 1024K | ¿Qué lo ejecuta? | ||
| GLM-5.2Z.ai753Bpublicado en 16 bits | No declarada |
| 1024K | ¿Qué lo ejecuta? | ||
| DeepSeek R1DeepSeek671B37B activospublicado en 8 bits | No declarada |
| 160K | ¿Qué lo ejecuta? | ||
| Granite 4.1 8BIBM8,8Bpublicado en 16 bits | No declarada |
| 128K | ¿Qué lo ejecuta? | ||
| Gemma 3 12BGoogle12,2Bpublicado en 16 bits | No declarada |
| — | ¿Qué lo ejecuta? | ||
| DeepSeek V4 ProDeepSeek1,6T49B activospublicado en 4 bits | No declarada |
| 1024K | ¿Qué lo ejecuta? | ||
| Kimi K2.5Moonshot AI1T32B activospublicado en 4 bits | No declarada |
| 256K | ¿Qué lo ejecuta? | ||
| Qwen3 235B-A22BAlibaba235B22B activospublicado en 16 bits | No declarada |
| 40K | ¿Qué lo ejecuta? | ||
| Mistral Small 3.2 24BMistral AI24Bpublicado en 16 bits | No declarada |
| 128K | ¿Qué lo ejecuta? | ||
| Laguna-S 2.1Poolside118B8B activospublicado en 16 bits | No declarada |
| 1024K | ¿Qué lo ejecuta? | ||
| Solar Open2 250BUpstage250B15B activospublicado en 16 bits | No declarada |
| 1024K | ¿Qué lo ejecuta? |
Cómo se elabora esta tabla
Cada tamaño se mide a partir de los archivos de pesos del checkpoint publicado en Hugging Face, nunca se deriva del número de parámetros, que falla con las versiones cuantizadas. La VRAM para servir son esos pesos más un 20% para activaciones, contexto CUDA y margen del asignador, con contexto corto. Un modelo nunca se dimensiona por encima de la precisión con la que se publicó.
Más barato de servir es la tarifa reservable más baja, bajo demanda o serverless, para la configuración más pequeña que un proveedor vende realmente y que alberga el modelo, siempre etiquetada con su tipo de alquiler, porque una tarifa de escala a cero no es una tarifa por hora. El precio corresponde a la configuración completa.
La licencia es el único campo que no medimos: es lo que declara la tarjeta del modelo, y así se indica. Aquí no hay puntuaciones de benchmarks a propósito: las valoraciones de calidad son datos de terceros, y este catálogo solo recoge cifras que podemos respaldar.