Cómo consultar registros y consumo de tokens en LiteLLM

Última actualización: 27/08/2026

  • Unifica más de 100 APIs de LLMs bajo un estándar compatible con OpenAI para evitar la fragmentación técnica.
  • Permite el rastreo detallado de costes y consumo de tokens mediante parámetros internos y la integración con MLflow.
  • Ofrece una arquitectura flexible que va desde un SDK ligero hasta un servidor proxy robusto con soporte para Redis y PostgreSQL.
Panel de control profesional de LiteLLM mostrando el consumo de tokens y registros de API en modo oscuro con gráficas de uso.

Imagínate que tu empresa decide apostar fuerte por la inteligencia artificial, pero de repente te encuentras con un muro: cada modelo de lenguaje tiene sus propias reglas, sus APIs son distintas y gestionar todo ese caos se vuelve una pesadilla técnica. En este artículo vamos a ver cómo consultar registros y consumo de tokens en LiteLLM, una de las más populares.

Esta herramienta básicamente actúa como un traductor universal para LLMs. En lugar de aprenderte de memoria la documentación de cada proveedor, esta biblioteca unifica todo bajo un mismo estándar, permitiéndote saltar de un modelo a otro sin sudar frío y centrando tus esfuerzos en lo que de verdad aporta valor al negocio.

¿Qué es exactamente LiteLLM y por qué interesa?

 

Para no liarnos, hay que entender que LiteLLM no es una sola cosa, sino que se presenta en dos formatos. Por un lado, tenemos el SDK de Python, que es un paquete ligero que instalas con pip y que traduce tus peticiones al formato que entiendan modelos como Claude o Gemini. Por otro lado, está el Servidor Proxy, una solución más robusta basada en FastAPI que se despliega mediante Docker y que permite centralizar la gestión de claves, controlar el gasto y monitorizar el tráfico de varios equipos.

La gran ventaja es que estandariza el panorama. Si quieres cambiar de GPT-4 a Claude 3.5, no tienes que reescribir toda la lógica de tus mensajes; LiteLLM se encarga del mapeo de tokens y el formato, haciendo que cualquier proveedor parezca que usa la API de OpenAI. Además, ofrece una resiliencia brutal gracias a su sistema de equilibrio de carga y retrocesos, que redirige la petición a un modelo de respaldo si el principal falla o alcanza el límite de velocidad.

Contenido exclusivo - Clic Aquí  Cómo quitar la barra de juegos de Windows 11
Cómo consultar registros y consumo de tokens en LiteLLM
Cómo consultar registros y consumo de tokens en LiteLLM
LiteLLM vs OpenRouter
Related article:
LiteLLM vs OpenRouter: diferencias y cuándo utilizar cada uno

Cómo empezar: Instalación y puesta en marcha

 

Si quieres evitar líos de dependencias, lo más recomendable es desplegar LiteLLM con Docker. El proceso es sencillo: clonas el repositorio, configuras tu clave maestra y la salt key (fundamental para cifrar las credenciales) en un archivo .env y lanzas el contenedor con docker-compose. Una vez levantado, puedes acceder a la interfaz en el puerto 4000 para empezar a registrar tus modelos.

Para añadir un modelo nuevo, solo tienes que ir a la sección de gestión y elegir el proveedor. Lo chulo es que puedes personalizar los nombres de los modelos y asignarles costes específicos o parámetros de tokens de entrada. Por ejemplo, puedes usar modelos ultra rápidos de Groq aprovechando sus LPU para obtener respuestas casi instantáneas.

Representación abstracta de esferas digitales interconectadas que simboliza la integración y el flujo de datos entre Open WebUI y LiteLLM
Related article:
Cómo conectar LiteLLM con Open WebUI

Consultando el consumo de tokens y costes

Una de las dudas más frecuentes es cómo saber cuánto estamos gastando. Si usas el SDK, puedes acceder a la información del coste directamente a través de los parámetros ocultos de la respuesta, específicamente en el campo _hidden_params. Para quienes necesitan un control más profesional y asíncrono, existe la función acount_tokens que permite calcular el conteo de tokens antes o después de la llamada, incluyendo el uso de herramientas y mensajes del sistema.

Contenido exclusivo - Clic Aquí  ¿Qué es Flash?

Si buscas un seguimiento automatizado y visual, la integración con MLflow es la clave. Al activar mlflow.litellm.autolog(), el sistema captura automáticamente las preguntas, respuestas, latencias y, lo más importante, el uso y coste de los tokens, registrándolo todo en un experimento de MLflow para que no se te escape ni un céntimo.

desplegar LiteLLM con Docker
Cómo consultar registros y consumo de tokens en LiteLLM

Implementación técnica y ejemplos de código

Para hacer una petición, el formato es clave: siempre debes usar el esquema proveedor/nombre_del_modelo. Si trabajas con streaming en Python, el SDK de LiteLLM te permite iterar sobre los fragmentos de la respuesta para que el usuario no tenga que esperar a que el texto esté completo.

Monitor financiero mostrando gráficos de datos en tiempo real, representando el seguimiento de costes y presupuestos de IA.
Related article:
Cómo establecer límites de gasto por usuario en LiteLLM
  • Uso con SDK de OpenAI: Puedes configurar el base_url hacia tu instancia de LiteLLM y usar el cliente de OpenAI estándar, simplificando la migración de código.
  • Llamadas via cURL: Es posible realizar peticiones POST directas al endpoint de chat completions, lo que facilita la integración en sistemas que no usan Python.
  • Integración con OpenClaw: Permite centralizar el registro y crear claves virtuales con límites de gasto para evitar sorpresas en la factura mensual.
Como instalar LiteLLM y reunir varias API de IA en una sola
Related article:
Cómo instalar LiteLLM y reunir varias API de IA en una sola

Seguridad y despliegue en entornos corporativos

No todo se limita a consultar registros y consumo de tokens en LiteLLM. Cuando pasamos de un proyecto personal a uno empresarial, la seguridad es lo primero. LiteLLM gestiona las credenciales de forma centralizada, evitando que las claves de API estén expuestas en el código. Además, soporta la configuración de proxies para enrutar el tráfico a través de redes privadas, cumpliendo así con normativas estrictas como el GDPR o la CCPA.

Contenido exclusivo - Clic Aquí  10 herramientas para crear un blog exitoso

No obstante, hay que ser realistas: mantener un proxy de alta disponibilidad requiere infraestructura. Para que el registro de gastos y la limitación de velocidad funcionen, necesitas montar una instancia de Redis para la caché y una base de datos PostgreSQL para los logs. Si el equipo no quiere gestionar bases de datos, existen alternativas gestionadas como TrueFoundry que eliminan esta carga operativa.

Opciones avanzadas y gobernanza

Para las organizaciones más grandes, la herramienta ofrece una edición empresarial que desbloquea funciones críticas que van más allá de simplemente consultar registros y consumo de tokens en LiteLLM. Por ejemplo: el SSO (Single Sign-On) y el control de acceso basado en roles (RBAC). Esto evita que las claves maestras acaben flotando en canales de Slack y permite que el CISO de la empresa duerma tranquilo sabiendo quién tiene acceso a qué modelo.

Además, la capacidad de realizar fine-tuning y la flexibilidad para cambiar de backend sin tocar el código del frontend convierten a esta herramienta en un aliado estratégico. Ya sea gestionando imágenes a través de rutas compatibles con OpenAI o implementando modelos locales mediante Ollama, la versatilidad es su mayor fuerte.

En definitiva, la posibilidad de consultar registros y consumo de tokens en LiteLLM simplifica drásticamente la interoperabilidad entre decenas de proveedores de IA, permitiendo un control exhaustivo del gasto y el rendimiento mediante el uso de proxies, SDKs y herramientas de seguimiento como MLflow. Al unificar las APIs bajo un estándar común, las empresas pueden optimizar sus costes y escalar sus aplicaciones sin quedar atrapadas por la dependencia de un único proveedor tecnológico.

Solución a Problemas de Conexión entre LiteLLM y OpenAI
Related article:
Solución a Problemas de Conexión entre LiteLLM y OpenAI