- Centralización de múltiples proveedores de LLM y modelos locales bajo una única API compatible con OpenAI.
- Implementación de un control granular de accesos y monitorización de costes mediante claves virtuales y jerarquías de equipo.
- Optimización de la inferencia local combinando vLLM para alto rendimiento y Ollama para experimentación rápida.
¿Estás buscando una manera de centralizar todos tus modelos de lenguaje en una sola interfaz? Si es así, conectar LiteLLM con Open WebUI es, sencillamente, la jugada maestra. Imagina tener un punto de acceso único que te permita saltar entre modelos de OpenAI, Gemini o incluso tus propios modelos locales sin tener que cambiar la configuración cada dos por tres.
Esta pareja dinámica no solo facilita la vida al usuario final, sino que es una herramienta brutal para equipos que necesitan controlar el gasto, monitorizar quién usa qué y gestionar permisos de acceso de forma granular, evitando que alguien se deje la cuenta bancaria en una sola tarde de pruebas.
¿Por qué montar este combo de herramientas?
La gran ventaja de conectar LiteLLM con Open WebUI es que actúa como una especie de pasarela o gateway. En lugar de conectar Open WebUI directamente a cinco proveedores distintos, lo conectas solo a LiteLLM, y este se encarga de redirigir la petición al modelo adecuado. Esto permite gestionar más de 100 LLMs desde un solo sitio, establecer límites de presupuesto y enviar los registros de cada interacción a destinos como S3 o Langfuse para analizarlos luego.
Pasos para ponerlo en marcha
Lo primero es tener ambos servicios corriendo. Una vez activos, el corazón de la configuración es la creación de una clave virtual en LiteLLM. No es una simple API key, sino un token que permite autenticarse en el proxy y que puede estar vinculado a una jerarquía específica: Organización, Equipo o Usuario.
Para que, todo esté organizado, te recomiendo crear un Equipo dedicado en la interfaz de LiteLLM (normalmente en el puerto 4000). Una vez tengas el equipo, generas la clave virtual. Lo mejor de esto es que puedes restringir qué modelos que verá Open WebUI a través de esa clave, evitando que aparezcan modelos experimentales o demasiado caros en el desplegable.
Vinculación final en la interfaz
Cuando ya tengas tu clave, vete a los ajustes de Open WebUI, entra en la sección de Conexiones y añade una nueva. Aquí solo tienes que poner la URL de tu proxy de LiteLLM (por ejemplo, http://localhost:4000) y la clave virtual que acabas de crear. Para comprobar que todo ha quedado niquelado, selecciona el desplegable de modelos; solo deberían aparecer aquellos a los que les hayas dado permiso previamente.
Seguimiento avanzado de costes y usuarios
Si tienes a varias personas usando la herramienta, no querrás que todos aparezcan como el mismo usuario en los logs. Para solucionar esto, puedes activar los encabezados de información de usuario en Open WebUI mediante variables de entorno. Luego, en el archivo config.yaml de LiteLLM, debes configurar el mapeo de estos headers (como X-OpenWebUI-User-Email) para que el proxy sepa exactamente quién está haciendo la petición.
Configuración técnica para entornos locales
¿Quieres conectar LiteLLM con Open WebUI para crear una arquitectura potente? Una posibilidad es usar Docker Compose integrando vLLM y Ollama como motores de inferencia. En este esquema, vLLM se encarga de los modelos pesados y de alto rendimiento gracias a su velocidad de inferencia, mientras que Ollama es ideal para probar modelos cuantizados o livianos de forma rápida.
En el archivo de configuración de LiteLLM, mapeas los nombres que quieres que vean los usuarios con la dirección real del motor. Por ejemplo, puedes llamar a un modelo «Qwen-Pro» y que LiteLLM lo redirija internamente a http://vllm:8000/v1. Además, si usas modelos con capacidad de razonamiento, recuerda usar el parámetro merge_reasoning_content_in_choices en LiteLLM para que Open WebUI pueda renderizar las etiquetas <think> correctamente.
Integración de búsqueda web
Si necesitas que tu chat tenga acceso a internet, puedes usar el motor de Perplexity. Aunque Open WebUI permite la conexión directa, es mucho más limpio pasar el tráfico a través de LiteLLM. Solo tienes que configurar el motor de búsqueda en el panel de administración y cambiar la URL base por el endpoint de búsqueda de LiteLLM siguiendo el formato /search/nombre-del-proveedor.
En definitiva, conectar LiteLLM con Open WebUI equivale a montar este ecosistema transforma una simple interfaz de chat en una estación de trabajo de IA profesional, permitiendo que la gestión de modelos, el control de costes y la potencia de la inferencia local y en la nube conviven en un solo flujo de trabajo optimizado y escalable.
Redactor especializado en temas de tecnología e internet con más de diez años de experiencia en diferentes medios digitales. He trabajado como editor y creador de contenidos para empresas de comercio electrónico, comunicación, marketing online y publicidad. También he escrito en webs de economía, finanzas y otros sectores. Mi trabajo es también mi pasión. Ahora, a través de mis artículos en Tecnobits, intento explorar todas las novedades y nuevas oportunidades que el mundo de la tecnología nos ofrece día a día para mejorar nuestras vidas.