¿Qué hace falta para este LLM?
Elige el modelo que quieres servir. Lo dimensionamos a partir del checkpoint publicado y listamos las configuraciones más baratas que puedes alquilar hoy y que lo albergan, con la tarifa bajo demanda y serverless de cada una.
1 · Elige un modelo
Publicado solo en 4 bits: nunca lo dimensionamos por encima del checkpoint con el que se lanzó.
No publicamos estimaciones por longitud de contexto para esta arquitectura.
2 · Qué necesita
DeepSeek V4 Pro con 4 bits
1038 GB de VRAM
con contexto corto: medido a partir del checkpoint publicado, no estimado desde el número de parámetros.
- Pesos del modelo
- 865 GB
- Caché KVincluida en la sobrecarga
- —
- Sobrecarga de ejecución20 % de los pesos
- 173 GB
Sobre este modelo
- Parámetros
- 1,6T
- Activos por token
- 49B
- Publicado en
- 4 bits
- Pesos medidos
- 865 GB
3 · Dónde ejecutarlo
Configuraciones reservables
Las más baratas primero, comprobadas contra 98 tipos de GPU con capacidad reservable en vivo.
| Configuración | VRAM total | Bajo demanda | Serverless | Detalles de la GPU |
|---|---|---|---|---|
| 8× AMD Instinct MI300X | 1536 GB 498 GB libres | 19,36 €/h 2,42 €/GPU-h | — | Ver todos los precios |
| 8× AMD Instinct MI325X | 2048 GB 1010 GB libres | 21,05 €/h 2,63 €/GPU-h | — | Ver todos los precios |
| 4× NVIDIA B300 | 1152 GB 114 GB libres | 25,83 €/h 6,46 €/GPU-h | 28,41 €/h 7,10 €/GPU-h | Ver todos los precios |
| 4× NVIDIA B300 CC | 1152 GB 114 GB libres | 26,35 €/h 6,59 €/GPU-h | — | Ver todos los precios |
| 8× NVIDIA H200 | 1128 GB 90 GB libres | 27,55 €/h 3,44 €/GPU-h | 30,31 €/h 3,79 €/GPU-h | Ver todos los precios |
| 4× NVIDIA GB300 | 1152 GB 114 GB libres | 29,69 €/h 7,42 €/GPU-h | — | Ver todos los precios |
| 8× NVIDIA B200 | 1440 GB 402 GB libres | 35,13 €/h 4,39 €/GPU-h Beyond.pl | 46,29 €/h 5,79 €/GPU-h | Ver todos los precios |
| 8× NVIDIA B200 CC | 1440 GB 402 GB libres | 42,93 €/h 5,37 €/GPU-h | — | Ver todos los precios |
Pesos del modelo más un 20 % de sobrecarga de ejecución, a partir de tamaños de checkpoint medidos; una longitud de contexto declarada añade su caché KV. Cada precio es la tarifa reservable más barata para ese tamaño exacto de instancia, para la configuración completa: el más barato de los dos se resalta y ordena la tabla. Una cifra ×N es la VRAM total de N tarjetas y no afirma nada sobre el rendimiento de la interconexión.
Cómo se calcula
Los tamaños de los pesos se miden sobre los archivos reales del checkpoint en Hugging Face, nunca se derivan del número de parámetros, que falla con los lanzamientos cuantizados. Sobre los pesos asumimos un 20 % para activaciones, contexto CUDA y holgura del asignador. Declarar una longitud de contexto añade su caché KV de forma explícita, calculada solo para arquitecturas cuya forma de caché indica la configuración sin ambigüedad.
Una configuración que alberga los pesos y la caché pero no ese margen completo se marca como ajustada en lugar de ocultarse: cargará, e incluso puede funcionar con lote de tamaño uno, pero es previsible que falle bajo carga.
Los precios son la tarifa reservable más barata para ese tamaño exacto de instancia, actualizada con el resto del catálogo.
