Qué servidor necesitas para un LLM local con Ollama (2026)
Respuesta rápida: La regla práctica es el doble de RAM que el tamaño del modelo. Un modelo pequeño de 3.000 millones de parámetros pide unos 4 GB; uno de 7-8.000 millones, unos 8 GB; uno de 13.000 millones, unos 16 GB. Sin tarjeta gráfica funciona, pero responde despacio: sirve para tareas en segundo plano, no para un chat en directo. Y si lo que quieres es ahorrar frente a pagar una API, casi nunca sale a cuenta: se hace por privacidad, no por precio.
Montar un modelo de lenguaje en tu propio servidor se ha vuelto sencillo. Lo difícil es acertar con el tamaño de la máquina, porque aquí un error no se traduce en «va un poco lento» sino en «no arranca» o «el sistema mata el proceso a mitad».
🔎 Este artículo contiene enlaces de afiliado. Si contratas a través de ellos recibimos una comisión sin coste extra para ti. Ver política de afiliados.
La regla de la RAM
Un modelo ocupa memoria solo por estar cargado, antes de responder nada. La cantidad depende de dos cosas: cuántos parámetros tiene y con cuánta precisión está comprimido (lo que se llama cuantización).
| Tamaño del modelo | RAM solo para cargarlo | RAM del servidor recomendada |
|---|---|---|
| ~1.000 millones de parámetros (1B) | ~1 GB | 4 GB |
| ~3.000 millones (3B) | ~2 GB | 4-8 GB |
| ~7-8.000 millones (7B/8B) | ~5 GB | 8-16 GB |
| ~13.000 millones (13B) | ~8 GB | 16 GB |
| ~30.000 millones o más | 20 GB+ | 32 GB+ |
La segunda columna es lo que ocupa el modelo; la tercera, lo que debe tener la máquina, porque además necesitas memoria para el sistema, para el contexto de la conversación y para lo demás que corra ahí. Dimensionar por la segunda columna es el error clásico: el modelo carga, y el servidor se queda sin aire en cuanto llega una petición larga.
Los modelos que se descargan por defecto suelen venir ya cuantizados, que es lo que permite ejecutar en 5 GB algo que sin comprimir pediría 16. A cambio se pierde algo de calidad, normalmente poco.
¿Hace falta tarjeta gráfica?
No hace falta, pero cambia la experiencia por completo.
Sin GPU, el modelo se ejecuta en el procesador. Funciona: responde, y la respuesta es igual de buena. Lo que cambia es la velocidad — de unas pocas palabras por segundo a un ritmo cómodo de lectura.
Eso define para qué sirve cada montaje:
- Sin GPU: tareas en segundo plano. Clasificar correos que entran, resumir documentos por la noche, etiquetar tickets. Nadie está esperando delante de la pantalla.
- Con GPU: cualquier cosa conversacional en la que haya una persona esperando.
La mayoría de VPS económicos no llevan GPU, y los que la llevan cuestan varias veces más. Antes de contratar uno con tarjeta, ten claro que lo tuyo es el segundo caso.
Cuánto cuesta de verdad
Para el caso realista —un modelo de 7-8B en segundo plano, sin GPU— necesitas un servidor de 8 GB de RAM como mínimo. En Hostinger es el plan KVM 2: 8,99 $/mes con contratación anual, que renueva a 14,99 $/mes. Si además vas a tener n8n u otros servicios en la misma máquina, sube al de 16 GB.
Precios verificados el 6 de septiembre de 2026. El desglose completo de planes está en qué VPS necesitas.
Ahora la parte que casi ninguna guía dice: eso no es más barato que pagar una API. Con 15 $/mes de una API comercial haces muchísimas peticiones, con un modelo mejor y sin mantener nada. Si tu motivo es el ahorro, echa la cuenta antes; suele salir perdiendo.
Entonces, ¿por qué hacerlo?
Por privacidad, y es una razón excelente en algunos sectores. Si el dato que vas a procesar es un historial clínico, un expediente judicial o información de menores, que no salga de una máquina que controlas es un argumento que vale más que la diferencia de precio.
Los otros dos motivos legítimos: coste fijo previsible cuando el volumen es enorme, y funcionar sin internet en entornos aislados.
Si tu caso es «quiero probar la IA en mis procesos», empieza por una API de pago. Migras después, si el motivo aparece.
Qué montar encima
Ollama por sí solo es un motor sin interfaz: se habla con él por línea de comandos o por API. Lo habitual es añadirle una capa de uso:
- Open WebUI para tener un chat parecido a ChatGPT con usuarios y permisos. Suma unos 2 GB de RAM a la cuenta.
- n8n para conectar el modelo con tus procesos: que lea correos, resuma y escriba en algún sitio. Suma otros 2 GB.
Súmalo todo antes de elegir plan. Ollama con un 7B, Open WebUI y n8n en la misma máquina piden 16 GB con holgura, no 8. En el directorio de proyectos tienes la RAM de cada uno para hacer la cuenta.
Preguntas frecuentes
¿Qué modelo elijo para empezar? Uno de la familia de 7-8B en su versión cuantizada. Es el punto de equilibrio: cabe en 8 GB y da resultados razonables para resumir, clasificar y redactar.
¿Puedo ejecutarlo en mi portátil en vez de un servidor? Sí, y para probar es lo más cómodo. Un portátil con 16 GB mueve un 7B sin problema. Lo que no puedes es tenerlo disponible 24 horas para que otros procesos lo llamen; para eso hace falta un servidor.
¿Es legal usar estos modelos en mi empresa? Depende del modelo: cada uno tiene su licencia y algunas restringen el uso comercial. Compruébalo en la ficha del modelo antes de meterlo en producción.
¿Va a ser tan bueno como ChatGPT? No. Un modelo que cabe en 8 GB no compite con los modelos comerciales grandes. Para tareas acotadas —resumir, clasificar, extraer datos de un texto— cumple de sobra; para razonamiento complejo, se nota la diferencia.
¿Cuánto tarda en responder sin GPU? Del orden de unas pocas palabras por segundo con un 7B en un servidor modesto. Aceptable para algo automático; incómodo para un chat en vivo.
🔎 Este artículo contiene enlaces de afiliado a Hostinger. Ver política de afiliados.
