¿Cuánta VRAM necesito para correr un LLM local?
Elige un modelo open-weights, su cuantización y el contexto: te decimos cuánta memoria ocupa (pesos + caché KV + margen) y en qué GPUs corre. Cálculo al instante en tu navegador, sin subir nada y sin registro.
8 mil millones de parámetros · 32 capas
Mientras más largo el contexto, más memoria ocupa la caché KV.
Cuantización (de mayor a menor calidad y tamaño)
La cuantización comprime los pesos: Q4 es el equilibrio habitual entre calidad y tamaño; F16 es el modelo sin comprimir.
Memoria estimada para correrlo
6.6 GB
con Llama 3.1 8B en Q4 y 8.192 tokens de contexto.
- Pesos del modelo
- 4.5 GB
- Caché KV (contexto)
- 1.0 GB
- Margen (CUDA + activaciones)
- 1.2 GB
¿En qué GPU corre?
Veredicto para la configuración actual (6.6 GB).
| GPU | VRAM | Veredicto |
|---|---|---|
| Consumo | ||
| RTX 3070 | 8 GB | Entra |
| RTX 3080 | 10 GB | Entra |
| RTX 2080 Ti | 11 GB | Entra |
| RTX 3060 | 12 GB | Entra |
| RTX 3080 Ti | 12 GB | Entra |
| RTX 4070 | 12 GB | Entra |
| RTX 4070 SUPER | 12 GB | Entra |
| RTX 4070 Ti | 12 GB | Entra |
| RTX 5070 | 12 GB | Entra |
| Intel Arc A770 | 16 GB | Entra |
| RTX 4060 Ti 16GB | 16 GB | Entra |
| RTX 4070 Ti SUPER | 16 GB | Entra |
| RTX 4080 | 16 GB | Entra |
| RTX 4080 SUPER | 16 GB | Entra |
| RTX 5060 Ti 16GB | 16 GB | Entra |
| RTX 5070 Ti | 16 GB | Entra |
| RTX 5080 | 16 GB | Entra |
| AMD Radeon RX 7900 XT | 20 GB | Entra |
| RTX 3090 | 24 GB | Entra |
| RTX 3090 Ti | 24 GB | Entra |
| RTX 4090 | 24 GB | Entra |
| RTX 4500 Ada | 24 GB | Entra |
| RTX A5000 | 24 GB | Entra |
| AMD Radeon RX 7900 XTX | 24 GB | Entra |
| RTX 5000 Ada | 32 GB | Entra |
| RTX 5090 | 32 GB | Entra |
| RTX 6000 Ada | 48 GB | Entra |
| RTX A6000 | 48 GB | Entra |
| AMD Radeon PRO W7900 | 48 GB | Entra |
| Centro de datos | ||
| V100 16GB | 16 GB | Entra |
| L4 | 24 GB | Entra |
| V100 32GB | 32 GB | Entra |
| A100 40GB | 40 GB | Entra |
| A40 | 48 GB | Entra |
| L40S 48GB | 48 GB | Entra |
| A100 80GB | 80 GB | Entra |
| H100 80GB | 80 GB | Entra |
| H100 NVL | 94 GB | Entra |
| H200 | 141 GB | Entra |
| AMD Instinct MI300X | 192 GB | Entra |
| B200 | 192 GB | Entra |
| Apple Silicon · memoria unificada | ||
| Apple M4 (32 GB) | 32 GB | Entra |
| Apple M4 Pro (64 GB) | 64 GB | Entra |
| Apple M1 Max (64 GB) | 64 GB | Entra |
| Apple M2 Max (96 GB) | 96 GB | Entra |
| Apple M3 Max (128 GB) | 128 GB | Entra |
| Apple M4 Max (128 GB) | 128 GB | Entra |
| Apple M2 Ultra (192 GB) | 192 GB | Entra |
| Apple M3 Ultra (512 GB) | 512 GB | Entra |
✓ Entra con holgura · ⚠ Justo (sobre el 90% de la memoria) · ✗ No entra.
En Apple Silicon la memoria es unificada (la comparten CPU y GPU): por defecto el sistema deja ~70-75% para el modelo, no el total.
Es una estimación: el consumo real varía según el motor (llama.cpp, vLLM, Ollama), el tipo de caché KV y otras cargas en la GPU. Sirve para dimensionar, no como cifra exacta. ¿Comparas correr el modelo local contra pagar una API en la nube? Mira la Calculadora de costos
Preguntas frecuentes
¿Qué es la cuantización y por qué importa para la VRAM?
Cuantizar es guardar los pesos del modelo con menos bits (por ejemplo Q4 usa ~4 bits por peso en vez de los 16 de F16). Eso reduce mucho el tamaño en memoria a cambio de una pérdida pequeña de calidad. Por eso un mismo modelo puede pasar de no caber en tu GPU a correr cómodo solo cambiando la cuantización: Q4 suele ser el equilibrio habitual entre calidad y tamaño.
¿Por qué un modelo MoE pesa por sus parámetros totales y no por los activos?
Un modelo de Mezcla de Expertos (MoE) tiene muchos 'expertos', pero por cada token solo activa unos pocos, así que es rápido. El detalle es que no sabes de antemano qué expertos hará falta, así que hay que cargar todos sus pesos en la memoria de la GPU. En resumen: un MoE corre con la velocidad de un modelo chico, pero ocupa la memoria de uno grande (la de todos sus parámetros).
¿Qué es la caché KV y por qué crece con el contexto?
La caché KV (key-value) guarda el estado de atención de cada token que el modelo ya leyó, para no recalcularlo en cada paso. Crece de forma lineal con la cantidad de tokens en la ventana de contexto: duplicar el contexto duplica la caché KV. En contextos largos esta caché puede ocupar tanta o más memoria que los propios pesos del modelo, por eso conviene dimensionarla.
¿Puedo correrlo con CPU y RAM normal en vez de GPU?
Sí: motores como llama.cpp y Ollama corren en CPU usando la RAM del sistema, y la misma estimación de memoria aplica (los gigas que ves acá tendrían que caber en tu RAM). La diferencia es la velocidad: en CPU la generación es bastante más lenta que en una GPU, que tiene un ancho de banda de memoria mucho mayor. Para probar o para uso ocasional, CPU + RAM funciona; para producción o respuestas ágiles, la GPU marca la diferencia.