VRAM no es RAM del sistema, ni se suma automáticamente entre GPU
Cada GPU mantiene su propia memoria. Para ejecutar o entrenar, los pesos, activaciones, cachés y buffers deben estar disponibles donde el cálculo los necesita. Por eso una workstation con dos tarjetas puede ser magnífica para trabajos que paralelizan correctamente, pero no se interpreta como una sola tarjeta con la suma simple de sus gigabytes.
La documentación de NVIDIA para modelos de lenguaje resume una parte útil del cálculo: los pesos dependen de parámetros, bytes por parámetro y paralelismo. Sin embargo, el proyecto real consume más memoria que los pesos: cache de contexto, activaciones, buffers de comunicación, CUDA y el margen necesario para que la carga no falle en el peor momento. Cualquier cifra seria debe incluir ese margen.
Primero define qué vas a hacer con el modelo
Hay una diferencia enorme entre inferencia ocasional, desarrollo, fine-tuning con adaptadores, entrenamiento desde cero y servicio interno para varias personas. Para inferencia local, la cuantización puede reducir la memoria de pesos; para fine-tuning y entrenamiento entran gradientes, estados del optimizador y activaciones. Para visión artificial, la resolución, el tamaño de batch y la arquitectura mandan tanto como el número de clases.
Antes de elegir GPU pedimos: framework y versión, modelo o familia, precisión objetivo, longitud de contexto, batch, datos, si se entrena o se infiere, número de GPU esperado y si el puesto también hará render, CAD u otros trabajos. Esa lista parece larga, pero evita propuestas caras que fallan por un detalle de memoria.
Un mapa razonable de VRAM
Con 16 GB se puede desarrollar, hacer inferencia de modelos compactos y trabajar con visión o fine-tuning moderado bien dimensionado. 32 GB abre un margen muy superior para modelos, datasets y contextos que no se acomodan en 16 GB. 96 GB responde a proyectos de IA profesional que realmente demandan esa capacidad, memoria ECC y un camino de plataforma más amplio. No son categorías de marketing: son puntos de partida que hay que contrastar con el perfil exacto.
Si la necesidad supera una sola GPU, entra el diseño del sistema. Se revisan placas con ranuras y líneas PCIe suficientes, fuente con margen, chasis, temperaturas sostenidas, software de distribución y cómo se comunican las tarjetas. El rendimiento multi-GPU depende del software y de la topología; no es razonable prometer una multiplicación fija.
La CPU, RAM y el almacenamiento siguen importando
La GPU puede ejecutar los kernels, pero el conjunto necesita alimentar datos, preparar muestras, guardar checkpoints y mantener el entorno estable. 64 GB de RAM es una base práctica en muchas workstations de IA; 128 GB o más puede ser necesario con datasets grandes, preprocesado, varias GPU o herramientas paralelas. Para almacenamiento, NVMe rápido ayuda a trabajar con datasets y checkpoints activos, mientras que un segundo volumen o almacenamiento de red puede resolver capacidad y copia.
Una CPU de escritorio potente sirve para muchos flujos con una GPU. Threadripper y Threadripper PRO cobran sentido cuando se requieren muchas líneas PCIe, memoria ECC RDIMM, más capacidad y una arquitectura pensada para crecer. La elección correcta no es siempre la mayor: es la que deja margen para el siguiente experimento sin pagar por capacidad que nunca se usará.
Configuraciones de catálogo para empezar la conversación
| Escenario | Configuración | Base técnica | Precio |
|---|---|---|---|
| Desarrollo e inferencia | ACD-006 Pro | RTX 5080 de 16 GB, 64 GB ECC y plataforma ampliable. | 5.655 € |
| Fine-tuning y LLM local | ACD-009 Avanzado Pro | RTX 5090 de 32 GB, Threadripper y 128 GB ECC. | 14.315 € |
| IA profesional de alta memoria | ACD-014 Enterprise Max | RTX PRO 6000 Blackwell de 96 GB ECC, Threadripper PRO y 256 GB ECC. | 38.605 € |
La forma correcta de estimar
La estimación empieza con una prueba reproducible: un modelo, una configuración, el tamaño de batch, el contexto o resolución y el consumo medido. A partir de ahí se añade margen para la iteración, no se redondea al límite. Si existe una previsión de producción, también se define la concurrencia y el crecimiento. Así se diferencia una workstation de desarrollo de una máquina que debe atender carga de forma continuada.
Preguntas frecuentes
¿Puedo ejecutar un modelo que pide más VRAM que mi GPU?
Algunas herramientas permiten cuantización, offload o distribución, con consecuencias en velocidad y complejidad. No debe darse por supuesto: se valida con el modelo y el entorno concreto.
¿Dos GPU de 32 GB equivalen a una de 64 GB?
No de forma general. Cada tarjeta conserva su memoria; el software debe distribuir el trabajo y la memoria de manera compatible.
¿Necesito ECC para IA?
No es obligatorio para cada laboratorio o desarrollo. Puede ser importante en proyectos que priorizan capacidad, continuidad y cargas largas, especialmente en plataformas profesionales.
¿Quieres validar una carga antes de comprar?
Dinos modelo, precisión, batch, contexto y si es entrenamiento o inferencia. Dimensionamos la propuesta sobre ese escenario.