Cómo activar la GPU NVIDIA en LocalAI

Última actualización: 31/07/2026

  • Requisito indispensable de instalar el nvidia-container-toolkit para permitir la comunicación entre Docker y el hardware gráfico.
  • Uso de imágenes de contenedor específicas con etiquetas cublas o cuda según la versión instalada en el sistema.
  • Configuración detallada de archivos YAML para gestionar el offloading de capas del modelo hacia la VRAM.
activar la GPU NVIDIA en LocalAI

Al montar tu propio servidor de inteligencia artificial en casa, probablemente te hayas dado cuenta de que ejecutar modelos solo con el procesador puede ser un auténtico dolor de cabeza debido a la lentitud. Para evitar esto, una buena idea es activar la GPU NVIDIA en LocalAI, una herramienta brutalmente versátil que te permite tener un ecosistema compatible con OpenAI pero bajo tu total control, evitando mandar datos a nubes externas y ahorrándote los costes por token.

Aunque el software es capaz de arrancar en cualquier cafetera sin necesidad de hardware especializado, aprovechar una tarjeta gráfica NVIDIA cambia la experiencia por completo. Pasar de una respuesta lenta a una inferencia casi instantánea es posible si configuramos correctamente la capa de software que conecta el contenedor con los núcleos CUDA, permitiendo que la VRAM haga el trabajo pesado.

Requisitos previos y preparación del entorno

Para que todo funcione como la seda a la hora de activar la GPU NVIDIA en LocalAI, no basta con pinchar la tarjeta en la placa base. Lo primero y más crítico es contar con el nvidia-container-toolkit debidamente instalado. Sin este componente, Docker es básicamente ciego y no puede ver que existe una GPU disponible, lo que resultaría en que LocalAI volviera a usar la CPU por defecto.

Contenido exclusivo - Clic Aquí  ¿Cómo identificar los componentes de una computadora usando CPU-Z?

Es fundamental verificar qué versión de CUDA tienes instalada en tu sistema operativo. Puedes salir de dudas ejecutando el comando nvidia-smi o nvcc –version en tu terminal. Si usas distribuciones como OpenSUSE Tumbleweed, deberás añadir los repositorios oficiales de NVIDIA e instalar los paquetes de drivers propietarios y las utilidades de cómputo correspondientes para asegurar la estabilidad.

Una vez instalados los drivers, es muy recomendable configurar el runtime de Docker. Debes ejecutar la configuración del toolkit para que el daemon.json de Docker reconozca la GPU. En algunos casos específicos de Linux, puede ser necesario ajustar el archivo de configuración del runtime de NVIDIA para desactivar o activar el uso de cgroups según la versión del kernel que estés manejando.

activar la GPU NVIDIA en LocalAI
Activar la GPU NVIDIA en LocalAI

Despliegue de LocalAI con aceleración CUDA

La clave para activar la GPU NVIDIA en LocalAI y que todo salga bien reside en elegir la imagen de contenedor correcta. No todas las imágenes de LocalAI son iguales; para aprovechar NVIDIA, debes buscar aquellas que tengan la etiqueta cublas o gpu-nvidia-cuda. Dependiendo de tu hardware, podrías necesitar la versión para CUDA 11, 12 o incluso 13.

Si utilizas Docker Compose, el archivo YAML debe incluir una sección de reservaciones de recursos. Es vital especificar que el driver es NVIDIA y que las capacidades incluyen la GPU. Si lanzas el contenedor mediante una línea de comandos simple, no olvides añadir la bandera –gpus all, de lo contrario, el sistema ignorará la tarjeta gráfica aunque esté instalada.

Contenido exclusivo - Clic Aquí  ¿Cómo poner en marcha un ordenador portátil nuevo?

Para quienes buscan una experiencia más sencilla, existen las imágenes All-in-One (AIO). Estas versiones ya vienen con soporte CUDA preconfigurado y algunos modelos listos para probar, lo que reduce drásticamente la fricción inicial y permite confirmar rápidamente si la aceleración está activa observando el uso de memoria en herramientas como nvtop.

Cómo añadir una carpeta de documentos a LocalDocs de GPT4All
Related article:
Cómo elegir el mejor modelo de GPT4All según la RAM de tu ordenador

Configuración avanzada de modelos y VRAM

Una vez que el servidor arranca, el siguiente paso para activar la GPU NVIDIA en LocalAI es decirle al modelo exactamente cuánto queremos que use la GPU. Esto se hace a través de archivos de configuración YAML. Para los modelos basados en llama.cpp, el parámetro fundamental es gpu_layers; si ponemos un número elevado (como 999), obligamos al sistema a cargar todas las capas posibles en la memoria de la tarjeta.

En el caso de trabajar con generación de imágenes a través de diffusers, la configuración cambia ligeramente. Es necesario activar la opción cuda: true y, si tienes la suerte de disponer de varias tarjetas gráficas, puedes jugar con el tensor_parallel_size para distribuir la carga de trabajo entre los distintos dispositivos.

Para exprimir el rendimiento al máximo, se recomienda activar la opción f16: true en el archivo YAML, lo que permite usar precisión media y reducir el consumo de VRAM sin perder calidad notable. Además, si el modelo está totalmente volcado en la GPU, poner los hilos de la CPU en 1 evita que haya conflictos de gestión de procesos que puedan ralentizar la respuesta.

Contenido exclusivo - Clic Aquí  Como Reparar Una Tarjeta Sd
Local AI
Cómo activar la GPU NVIDIA en LocalAI

Solución de problemas comunes y optimización

Es bastante habitual que, al principio, el sistema siga usando la CPU a pesar de haber seguido los pasos. En estos casos, lo primero es activar la variable de entorno DEBUG=true para analizar los logs. Si ves que la GPU no es detectada, revisa que el nvidia-container-toolkit esté respondiendo correctamente con un contenedor de prueba básico de Ubuntu.

Otro problema frecuente al activar la GPU NVIDIA en LocalAI son los errores de Out of Memory (OOM). Cuando la VRAM se llena, la inferencia se detiene o se vuelve lentísima. Para solucionar esto, puedes reducir el contexto del modelo (context_size) o utilizar versiones cuantizadas (como Q4_K_M), que ocupan mucho menos espacio sin sacrificar demasiada inteligencia.

Si notas que el rendimiento es errático, considera implementar el VRAM Management. Esta función permite que LocalAI descargue modelos inactivos de la memoria gráfica para dejar espacio a otros, optimizando así el flujo de trabajo cuando saltas entre un modelo de texto y uno de generación de imágenes constantemente.

En definitiva, activar la GPU NVIDIA en LocalAI requiere coordinar la instalación de los drivers en el host, la configuración del toolkit de Docker y el ajuste fino de los parámetros de carga en los archivos YAML de cada modelo. Siguiendo este flujo de trabajo, transformas una máquina convencional en una potente estación de inferencia local capaz de manejar desde LLMs complejos hasta generación de imágenes de alta resolución con una eficiencia sorprendente.