Usar un modelo no es entrenarlo
Esta guía habla de usar modelos ya entrenados —lo que se llama inferencia—: chatear, resumir, buscar en documentos o redactar. Entrenar o ajustar un modelo exige mucha más memoria; lo tratamos en la guía de VRAM para entrenar IA en local.
La regla que lo decide todo: el modelo tiene que caber
Un modelo ocupa, aproximadamente, su número de parámetros por lo que ocupa cada parámetro. Con la cuantización a 4 bits, lo habitual para usar modelos en local con muy poca pérdida de calidad, cada parámetro ocupa algo más de medio byte. A eso hay que sumarle la memoria del contexto: el texto que el modelo lee y escribe en cada consulta.
| Modelo | Memoria aproximada | Dónde cabe |
|---|---|---|
| 8.000 millones de parámetros (8B) | unos 5 GB | Cualquier GPU de 8 GB o más |
| gpt-oss-20b | unos 13 GB | GPU de 16 GB |
| 32.000 millones (32B) | unos 20 GB | GPU de 24 o 32 GB |
| 70.000 millones (70B) | unos 40 GB | Dos GPU de 32 GB o una profesional de 48 GB o más |
| gpt-oss-120b | unos 65 GB | GPU profesional de 80 a 96 GB, o equipo de 128 GB de memoria unificada |
GPU dedicada o memoria unificada
Con una tarjeta gráfica dedicada el modelo vive en su memoria (la VRAM) y responde muy rápido, pero el límite es duro: si no cabe, no funciona bien. Las gráficas de consumo llegan a 32 GB; las profesionales, a 96 GB.
Los equipos de memoria unificada comparten una memoria grande, de hasta 128 GB en equipos compactos, entre el procesador y la gráfica. Caben modelos mucho mayores en un equipo pequeño y silencioso, a cambio de generar el texto más despacio que una GPU dedicada de gama alta. Para una o pocas personas suele ser un buen equilibrio.
Cuántas personas y cuánto texto
No es lo mismo una persona que diez. Cuando varias consultas coinciden, cada una necesita su propio espacio de contexto y el equipo reparte su capacidad. Por eso, para un equipo de trabajo, importa tanto la memoria como la potencia de la GPU: con documentos largos y varias personas a la vez, una GPU de 16 GB se queda corta mucho antes que una de 32 GB.
Configuraciones orientativas
| Escenario | Equipo | Precio |
|---|---|---|
| Hasta 5 personas, modelos de hasta unos 20B | Ryzen 7 9700X · 32 GB · RTX 5060 Ti 16 GB | 2.903 € |
| Hasta 15 personas, modelos de hasta unos 20B | Ryzen 9 9900X · 64 GB · RTX 5070 Ti 16 GB | 4.727 € |
| Hasta 30 personas o modelos de unos 30B | Ryzen 9 9950X · 64 GB · 2× RTX 5070 Ti 16 GB | 6.509 € |
| Hasta 60 personas o modelos de 70B en GPU | Ryzen 9 9950X · 128 GB · 2× RTX PRO 4000 Blackwell 24 GB | 12.413 € |
| Modelos muy grandes | ACD-014 Enterprise Max · RTX PRO 6000 Blackwell 96 GB | 48.305 € |
Precios sin IVA; los cuatro primeros, del configurador. Si lo que quieres es el sistema ya instalado y configurado, con buscador sobre tus documentos y sin cuotas, mira la IA privada para empresas.
Qué necesitamos saber
Cuántas personas lo usarán y cuántas a la vez, qué tipo de documentos y de qué tamaño, si necesitas un modelo concreto y si el equipo tiene que estar en una mesa o en un armario. Con eso te proponemos el equipo por escrito.
Equipos y servicios relacionados
Preguntas frecuentes
¿Puedo usar un portátil para IA local?
Para modelos pequeños y pruebas, sí. Para trabajo diario con documentos, un equipo de sobremesa aguanta mejor el calor y el uso continuo, y admite más memoria.
¿Qué modelo abierto elijo?
Depende del idioma, del tipo de tarea y de la memoria disponible. Los probamos con documentos parecidos a los tuyos antes de recomendarte uno.
¿Cuánta memoria RAM del sistema necesito?
Con GPU dedicada, al menos tanta como la memoria de la GPU, y mejor el doble, para cargar modelos y documentos con holgura. En los equipos de memoria unificada, esa memoria es la del modelo.
¿Te ayudamos a elegir el equipo?
Cuéntanos cuántas personas lo usarán y con qué documentos. Te proponemos la configuración por escrito.