Saltar al contenido
Volver al Lab

¿Cuánta VRAM necesito para correr un LLM local?

Elige un modelo open-weights, su cuantización y el contexto: te decimos cuánta memoria ocupa (pesos + caché KV + margen) y en qué GPUs corre. Cálculo al instante en tu navegador, sin subir nada y sin registro.

8 mil millones de parámetros · 32 capas

8.192tokens

Mientras más largo el contexto, más memoria ocupa la caché KV.

Cuantización (de mayor a menor calidad y tamaño)

La cuantización comprime los pesos: Q4 es el equilibrio habitual entre calidad y tamaño; F16 es el modelo sin comprimir.

Memoria estimada para correrlo

6.6 GB

con Llama 3.1 8B en Q4 y 8.192 tokens de contexto.

Pesos del modelo
4.5 GB
Caché KV (contexto)
1.0 GB
Margen (CUDA + activaciones)
1.2 GB
GB

¿En qué GPU corre?

Veredicto para la configuración actual (6.6 GB).

GPUs y si la configuración actual entra en su memoria
GPUVRAMVeredicto
Consumo
RTX 30708 GB Entra
RTX 308010 GB Entra
RTX 2080 Ti11 GB Entra
RTX 306012 GB Entra
RTX 3080 Ti12 GB Entra
RTX 407012 GB Entra
RTX 4070 SUPER12 GB Entra
RTX 4070 Ti12 GB Entra
RTX 507012 GB Entra
Intel Arc A77016 GB Entra
RTX 4060 Ti 16GB16 GB Entra
RTX 4070 Ti SUPER16 GB Entra
RTX 408016 GB Entra
RTX 4080 SUPER16 GB Entra
RTX 5060 Ti 16GB16 GB Entra
RTX 5070 Ti16 GB Entra
RTX 508016 GB Entra
AMD Radeon RX 7900 XT20 GB Entra
RTX 309024 GB Entra
RTX 3090 Ti24 GB Entra
RTX 409024 GB Entra
RTX 4500 Ada24 GB Entra
RTX A500024 GB Entra
AMD Radeon RX 7900 XTX24 GB Entra
RTX 5000 Ada32 GB Entra
RTX 509032 GB Entra
RTX 6000 Ada48 GB Entra
RTX A600048 GB Entra
AMD Radeon PRO W790048 GB Entra
Centro de datos
V100 16GB16 GB Entra
L424 GB Entra
V100 32GB32 GB Entra
A100 40GB40 GB Entra
A4048 GB Entra
L40S 48GB48 GB Entra
A100 80GB80 GB Entra
H100 80GB80 GB Entra
H100 NVL94 GB Entra
H200141 GB Entra
AMD Instinct MI300X192 GB Entra
B200192 GB Entra
Apple Silicon · memoria unificada
Apple M4 (32 GB)32 GB Entra
Apple M4 Pro (64 GB)64 GB Entra
Apple M1 Max (64 GB)64 GB Entra
Apple M2 Max (96 GB)96 GB Entra
Apple M3 Max (128 GB)128 GB Entra
Apple M4 Max (128 GB)128 GB Entra
Apple M2 Ultra (192 GB)192 GB Entra
Apple M3 Ultra (512 GB)512 GB Entra

✓ Entra con holgura · ⚠ Justo (sobre el 90% de la memoria) · ✗ No entra.

En Apple Silicon la memoria es unificada (la comparten CPU y GPU): por defecto el sistema deja ~70-75% para el modelo, no el total.

Es una estimación: el consumo real varía según el motor (llama.cpp, vLLM, Ollama), el tipo de caché KV y otras cargas en la GPU. Sirve para dimensionar, no como cifra exacta. ¿Comparas correr el modelo local contra pagar una API en la nube? Mira la Calculadora de costos

Preguntas frecuentes

¿Qué es la cuantización y por qué importa para la VRAM?

Cuantizar es guardar los pesos del modelo con menos bits (por ejemplo Q4 usa ~4 bits por peso en vez de los 16 de F16). Eso reduce mucho el tamaño en memoria a cambio de una pérdida pequeña de calidad. Por eso un mismo modelo puede pasar de no caber en tu GPU a correr cómodo solo cambiando la cuantización: Q4 suele ser el equilibrio habitual entre calidad y tamaño.

¿Por qué un modelo MoE pesa por sus parámetros totales y no por los activos?

Un modelo de Mezcla de Expertos (MoE) tiene muchos 'expertos', pero por cada token solo activa unos pocos, así que es rápido. El detalle es que no sabes de antemano qué expertos hará falta, así que hay que cargar todos sus pesos en la memoria de la GPU. En resumen: un MoE corre con la velocidad de un modelo chico, pero ocupa la memoria de uno grande (la de todos sus parámetros).

¿Qué es la caché KV y por qué crece con el contexto?

La caché KV (key-value) guarda el estado de atención de cada token que el modelo ya leyó, para no recalcularlo en cada paso. Crece de forma lineal con la cantidad de tokens en la ventana de contexto: duplicar el contexto duplica la caché KV. En contextos largos esta caché puede ocupar tanta o más memoria que los propios pesos del modelo, por eso conviene dimensionarla.

¿Puedo correrlo con CPU y RAM normal en vez de GPU?

Sí: motores como llama.cpp y Ollama corren en CPU usando la RAM del sistema, y la misma estimación de memoria aplica (los gigas que ves acá tendrían que caber en tu RAM). La diferencia es la velocidad: en CPU la generación es bastante más lenta que en una GPU, que tiene un ancho de banda de memoria mucho mayor. Para probar o para uso ocasional, CPU + RAM funciona; para producción o respuestas ágiles, la GPU marca la diferencia.