¿Qué hace falta para este LLM?

Elige el modelo que quieres servir. Lo dimensionamos a partir del checkpoint publicado y listamos las configuraciones más baratas que puedes alquilar hoy y que lo albergan, con la tarifa bajo demanda y serverless de cada una.

1 · Elige un modelo

Modelo
Precisión
Contexto

No publicamos estimaciones por longitud de contexto para esta arquitectura.

2 · Qué necesita

Solar Open2 250B con 16 bits

601 GB de VRAM

con contexto corto: medido a partir del checkpoint publicado, no estimado desde el número de parámetros.

Pesos del modelo
501 GB
Caché KVincluida en la sobrecarga
Sobrecarga de ejecución20 % de los pesos
100 GB

Sobre este modelo

Solar Open2 250BUpstage
Parámetros
250B
Activos por token
15B
Publicado en
16 bits
Pesos medidos
501 GB
Checkpoint de origenupstage/Solar-Open2-250B

3 · Dónde ejecutarlo

Configuraciones reservables

Las más baratas primero, comprobadas contra 98 tipos de GPU con capacidad reservable en vivo.

ConfiguraciónVRAM totalBajo demandaServerlessDetalles de la GPU
8× NVIDIA A100 80GB
640 GB
39 GB libres
4,89 €/h
0,61 €/GPU-h
Vast.ai logoVast.ai
13,56 €/h
1,70 €/GPU-h
Verda logoVerda
Ver todos los precios
8× NVIDIA RTX PRO 6000
768 GB
167 GB libres
6,89 €/h
0,86 €/GPU-h
Lium logoLium
14,32 €/h
1,79 €/GPU-h
Verda logoVerda
Ver todos los precios
8× Intel Gaudi 2
768 GB
167 GB libres
7,15 €/h
0,89 €/GPU-h
Cyfuture AI logoCyfuture AI
Ver todos los precios
4× AMD Instinct MI300X
768 GB
167 GB libres
9,78 €/h
2,45 €/GPU-h
Cyfuture AI logoCyfuture AI
Ver todos los precios
4× AMD Instinct MI325X
1024 GB
423 GB libres
10,63 €/h
2,66 €/GPU-h
Cyfuture AI logoCyfuture AI
Ver todos los precios
16× NVIDIA RTX 5090Ajustado
512 GB
89 GB por debajo del margen
12,12 €/h
0,76 €/GPU-h
Vast.ai logoVast.ai
Ver todos los precios
8× NVIDIA H100
640 GB
39 GB libres
12,88 €/h
1,61 €/GPU-h
Vast.ai logoVast.ai
24,62 €/h
3,08 €/GPU-h
Verda logoVerda
Ver todos los precios
4× NVIDIA B200
720 GB
119 GB libres
20,25 €/h
5,06 €/GPU-h
Vast.ai logoVast.ai
23,14 €/h
5,79 €/GPU-h
Verda logoVerda
Ver todos los precios

Mostrando las 8 más baratas. Pesos del modelo más un 20 % de sobrecarga de ejecución, a partir de tamaños de checkpoint medidos; una longitud de contexto declarada añade su caché KV. Cada precio es la tarifa reservable más barata para ese tamaño exacto de instancia, para la configuración completa: el más barato de los dos se resalta y ordena la tabla. Una cifra ×N es la VRAM total de N tarjetas y no afirma nada sobre el rendimiento de la interconexión.

Cómo se calcula

Los tamaños de los pesos se miden sobre los archivos reales del checkpoint en Hugging Face, nunca se derivan del número de parámetros, que falla con los lanzamientos cuantizados. Sobre los pesos asumimos un 20 % para activaciones, contexto CUDA y holgura del asignador. Declarar una longitud de contexto añade su caché KV de forma explícita, calculada solo para arquitecturas cuya forma de caché indica la configuración sin ambigüedad.

Una configuración que alberga los pesos y la caché pero no ese margen completo se marca como ajustada en lugar de ocultarse: cargará, e incluso puede funcionar con lote de tamaño uno, pero es previsible que falle bajo carga.

Los precios son la tarifa reservable más barata para ese tamaño exacto de instancia, actualizada con el resto del catálogo.

Seguir explorando