Cómo conectar LiteLLM con Open WebUI

Última actualización: 25/08/2026

  • Centralización de múltiples proveedores de LLM y modelos locales bajo una única API compatible con OpenAI.
  • Implementación de un control granular de accesos y monitorización de costes mediante claves virtuales y jerarquías de equipo.
  • Optimización de la inferencia local combinando vLLM para alto rendimiento y Ollama para experimentación rápida.
Representación abstracta de esferas digitales interconectadas que simboliza la integración y el flujo de datos entre Open WebUI y LiteLLM

¿Estás buscando una manera de centralizar todos tus modelos de lenguaje en una sola interfaz? Si es así, conectar LiteLLM con Open WebUI es, sencillamente, la jugada maestra. Imagina tener un punto de acceso único que te permita saltar entre modelos de OpenAI, Gemini o incluso tus propios modelos locales sin tener que cambiar la configuración cada dos por tres.

Esta pareja dinámica no solo facilita la vida al usuario final, sino que es una herramienta brutal para equipos que necesitan controlar el gasto, monitorizar quién usa qué y gestionar permisos de acceso de forma granular, evitando que alguien se deje la cuenta bancaria en una sola tarde de pruebas.

¿Por qué montar este combo de herramientas?

La gran ventaja de conectar LiteLLM con Open WebUI es que actúa como una especie de pasarela o gateway. En lugar de conectar Open WebUI directamente a cinco proveedores distintos, lo conectas solo a LiteLLM, y este se encarga de redirigir la petición al modelo adecuado. Esto permite gestionar más de 100 LLMs desde un solo sitio, establecer límites de presupuesto y enviar los registros de cada interacción a destinos como S3 o Langfuse para analizarlos luego.

Contenido exclusivo - Clic Aquí  El sonido va con retraso en Windows 11: desactiva el modo exclusivo y baja la latencia
conectar LiteLLM con Open WebUI
Cómo conectar LiteLLM con Open WebUI

Pasos para ponerlo en marcha

Lo primero es tener ambos servicios corriendo. Una vez activos, el corazón de la configuración es la creación de una clave virtual en LiteLLM. No es una simple API key, sino un token que permite autenticarse en el proxy y que puede estar vinculado a una jerarquía específica: Organización, Equipo o Usuario.

Para que, todo esté organizado, te recomiendo crear un Equipo dedicado en la interfaz de LiteLLM (normalmente en el puerto 4000). Una vez tengas el equipo, generas la clave virtual. Lo mejor de esto es que puedes restringir qué modelos que verá Open WebUI a través de esa clave, evitando que aparezcan modelos experimentales o demasiado caros en el desplegable.

Vinculación final en la interfaz

Cuando ya tengas tu clave, vete a los ajustes de Open WebUI, entra en la sección de Conexiones y añade una nueva. Aquí solo tienes que poner la URL de tu proxy de LiteLLM (por ejemplo, http://localhost:4000) y la clave virtual que acabas de crear. Para comprobar que todo ha quedado niquelado, selecciona el desplegable de modelos; solo deberían aparecer aquellos a los que les hayas dado permiso previamente.

Contenido exclusivo - Clic Aquí  ¿Cómo usar la opción “Descargar» en TikTok Lite?
LiteLLM web
Cómo conectar LiteLLM con Open WebUI

Seguimiento avanzado de costes y usuarios

Si tienes a varias personas usando la herramienta, no querrás que todos aparezcan como el mismo usuario en los logs. Para solucionar esto, puedes activar los encabezados de información de usuario en Open WebUI mediante variables de entorno. Luego, en el archivo config.yaml de LiteLLM, debes configurar el mapeo de estos headers (como X-OpenWebUI-User-Email) para que el proxy sepa exactamente quién está haciendo la petición.

Configuración técnica para entornos locales

¿Quieres conectar LiteLLM con Open WebUI para crear una arquitectura potente? Una posibilidad es usar Docker Compose integrando vLLM y Ollama como motores de inferencia. En este esquema, vLLM se encarga de los modelos pesados y de alto rendimiento gracias a su velocidad de inferencia, mientras que Ollama es ideal para probar modelos cuantizados o livianos de forma rápida.

En el archivo de configuración de LiteLLM, mapeas los nombres que quieres que vean los usuarios con la dirección real del motor. Por ejemplo, puedes llamar a un modelo «Qwen-Pro» y que LiteLLM lo redirija internamente a http://vllm:8000/v1. Además, si usas modelos con capacidad de razonamiento, recuerda usar el parámetro merge_reasoning_content_in_choices en LiteLLM para que Open WebUI pueda renderizar las etiquetas <think> correctamente.

Contenido exclusivo - Clic Aquí  Cómo Mover Aplicaciones a Tarjeta SD Huawei

Integración de búsqueda web

Si necesitas que tu chat tenga acceso a internet, puedes usar el motor de Perplexity. Aunque Open WebUI permite la conexión directa, es mucho más limpio pasar el tráfico a través de LiteLLM. Solo tienes que configurar el motor de búsqueda en el panel de administración y cambiar la URL base por el endpoint de búsqueda de LiteLLM siguiendo el formato /search/nombre-del-proveedor.

En definitiva, conectar LiteLLM con Open WebUI equivale a montar este ecosistema transforma una simple interfaz de chat en una estación de trabajo de IA profesional, permitiendo que la gestión de modelos, el control de costes y la potencia de la inferencia local y en la nube conviven en un solo flujo de trabajo optimizado y escalable.