Guía para conectar LocalAI con Open WebUI

Última actualización: 23/07/2026

  • LocalAI permite una distribución de carga de modelos más flexible entre múltiples GPUs que otras alternativas.
  • Open WebUI utiliza protocolos compatibles con OpenAI para integrarse fácilmente mediante una URL y una clave de API.
  • La conexión entre ambos servicios es ideal para ejecutar modelos de gran tamaño de forma local y privada.
conectar LocalAI con Open WebUI

Si estás cansado de utilizar configuraciones rígidas que no aprovechan correctamente el hardware disponible, puedes conectar LocalAI con Open WebUI para crear un entorno de inteligencia artificial local más flexible. Esta combinación permite ejecutar los modelos en tu propio servidor y utilizarlos desde una interfaz visual similar a la de los principales asistentes en la nube.

La integración resulta especialmente interesante cuando trabajas con varias tarjetas gráficas o modelos de gran tamaño. LocalAI se encarga de ejecutar la inferencia mediante el backend seleccionado, mientras que Open WebUI proporciona la interfaz desde la que puedes iniciar conversaciones, gestionar modelos y configurar herramientas adicionales.

No obstante, conectar ambos servicios no garantiza que todas las GPU se aprovechen automáticamente. La distribución de la carga depende del backend, el modelo, la memoria disponible y los parámetros configurados en LocalAI.

¿Cómo funciona la integración técnicamente?

Cómo funciona la integración de LocalAI con Open WebUI

Open WebUI funciona como la interfaz desde la que escribes tus mensajes. Cuando envías una consulta, la aplicación la dirige a la API compatible con OpenAI ofrecida por LocalAI. El servidor procesa la petición, ejecuta el modelo seleccionado y devuelve progresivamente los tokens generados para que la respuesta aparezca en pantalla en tiempo real.

Para establecer la conexión, Open WebUI necesita acceder a la URL base de LocalAI. Una dirección habitual dentro de una red local sería la siguiente:

http://IP_DEL_SERVIDOR:8080/v1

Es importante introducir la URL base terminada en /v1 y no solamente el endpoint /v1/chat/completions. Open WebUI necesita consultar otras rutas de la API, como /v1/models, para detectar los modelos disponibles.

Contenido exclusivo - Clic Aquí  NotebookLM se queda pensando eternamente: causas y soluciones

Si LocalAI y Open WebUI se ejecutan en contenedores conectados a una misma red Docker, puedes utilizar directamente el nombre asignado al servicio:

http://localai:8080/v1

En cambio, si LocalAI se ejecuta en el equipo anfitrión y Open WebUI está dentro de Docker, puede ser necesario utilizar esta dirección:

http://host.docker.internal:8080/v1

Dentro de un contenedor, localhost identifica al propio contenedor y no al ordenador anfitrión. Este detalle explica muchos de los errores de conexión que aparecen incluso cuando LocalAI parece funcionar correctamente desde el navegador.

Pasos clave para dejarlo operativo

Para añadir LocalAI, debes entrar en Panel de administración > Ajustes > Conexiones dentro de Open WebUI y crear una conexión compatible con OpenAI. Después, tendrás que introducir la URL correspondiente y completar el campo de la clave API.

  • Comprueba la dirección de LocalAI: verifica la IP, el puerto y la ruta /v1 desde el dispositivo o contenedor donde se ejecuta Open WebUI.
  • Revisa la red de Docker: si utilizas contenedores independientes, ambos deben compartir una red o disponer de una ruta que permita la comunicación.
  • Configura correctamente la clave: utiliza una credencial válida si has habilitado la autenticación en LocalAI.
  • Comprueba los modelos instalados: Open WebUI solamente mostrará aquellos que LocalAI pueda devolver mediante el endpoint /v1/models.
  • Reinicia los servicios: después de modificar variables o archivos de configuración, vuelve a iniciar los contenedores para aplicar los cambios.

Cuando LocalAI se ejecuta sin autenticación, Open WebUI puede obligarte igualmente a completar el campo reservado para la clave. En ese caso, algunos despliegues aceptan cualquier valor porque LocalAI no está comprobando realmente la credencial.

Sin embargo, no debes asumir que siempre funciona de esta manera. Si LocalAI se ha iniciado con una clave mediante opciones como LOCALAI_API_KEY, API_KEY o --api-keys, tendrás que introducir una de las credenciales autorizadas. Utilizar un valor inventado provocará un error 401.

Contenido exclusivo - Clic Aquí  Cómo usar Pika Labs 2.0 para crear vídeos hiperrealistas

Además, si el servidor puede recibir conexiones desde otros ordenadores, conviene habilitar una clave segura y difícil de adivinar. Ejecutar LocalAI sin autenticación solo resulta razonable en un entorno local correctamente aislado.

Cómo aprovechar varias GPU con LocalAI

Cómo aprovechar varias GPU con LocalAI

Open WebUI no decide cómo se reparte un modelo entre las tarjetas gráficas. Su función consiste en enviar las solicitudes y mostrar las respuestas. La gestión de las GPU corresponde al backend de inferencia utilizado por LocalAI.

Con backends basados en llama.cpp, por ejemplo, es posible distribuir capas del modelo entre varias GPU compatibles. Parámetros como split_mode controlan el tipo de reparto, mientras que CUDA_VISIBLE_DEVICES permite determinar qué tarjetas estarán disponibles para el proceso.

No obstante, el funcionamiento depende de varios factores:

  • La arquitectura y compatibilidad CUDA de cada GPU.
  • La cantidad de memoria gráfica disponible en cada tarjeta.
  • El formato y la cuantización utilizados por el modelo.
  • La versión y compilación del backend seleccionado.
  • La memoria necesaria para almacenar la caché KV.

Combinar tarjetas de generaciones diferentes, como una Tesla M40 y una RTX 2080 Ti, puede introducir limitaciones de compatibilidad o rendimiento. LocalAI permite configurar varios dispositivos, pero eso no significa que vaya a equilibrar automáticamente el trabajo de la forma más eficiente posible.

La capacidad para utilizar un contexto más amplio tampoco depende únicamente de sumar la memoria de todas las GPU. También intervienen el modelo, su cuantización, el parámetro context_size y la memoria reservada para la caché KV. Por este motivo, ejecutar modelos de 70B parámetros exige ajustar cuidadosamente tanto el backend como el consumo de memoria.

Versatilidad de modelos y proveedores

Una de las principales ventajas de Open WebUI es que permite centralizar diferentes modelos y servicios dentro de una misma interfaz. Puedes utilizar mediante LocalAI familias de modelos como Llama, Mistral o Gemma, siempre que el backend y el formato elegido sean compatibles.

Contenido exclusivo - Clic Aquí  Qué hacer cuando RustDesk no consigue establecer la conexión

Open WebUI también permite configurar Ollama, APIs compatibles con OpenAI y determinados proveedores externos. De este modo, puedes comparar modelos locales y comerciales sin cambiar constantemente de aplicación.

No todos los proveedores utilizan exactamente el mismo protocolo. Servicios como Anthropic o Google Gemini pueden requerir conexiones específicas, funciones integradas o componentes adicionales. Por tanto, no basta con introducir cualquier API dentro del apartado de conexiones compatibles con OpenAI.

También puedes ampliar las capacidades del sistema mediante herramientas, búsqueda web, ejecución de código u otras integraciones. Estas funciones permiten crear flujos más avanzados, pero dependen de los permisos concedidos, las herramientas instaladas y la capacidad del modelo para utilizarlas.

Conectar LocalAI no otorga automáticamente al modelo acceso a la terminal o a los archivos del ordenador. Para realizar esas acciones hacen falta componentes adicionales, que deben configurarse aplicando el principio de mínimo privilegio para evitar accesos innecesarios.

Privacidad y funcionamiento completamente local

Esta arquitectura permite mantener las conversaciones dentro de tu propia infraestructura cuando Open WebUI, LocalAI, el modelo y todas sus herramientas se ejecutan localmente. En esas condiciones, no necesitas enviar cada consulta a un proveedor comercial ni pagar por los tokens generados.

Sin embargo, instalar ambos programas no garantiza por sí mismo que ningún dato abandone el equipo. Si habilitas búsquedas web, modelos comerciales, plugins o servicios externos, parte del contenido puede enviarse fuera de la red local. Antes de utilizar información sensible, revisa las conexiones y herramientas activadas.

Para completar correctamente la integración, debes configurar la URL base de LocalAI, introducir una clave válida cuando la autenticación esté habilitada y ajustar el backend según las GPU y el modelo utilizados. Una vez establecida la comunicación, Open WebUI proporcionará una interfaz cómoda desde la que utilizar los modelos, mientras LocalAI conservará el control sobre la inferencia y los recursos del servidor.