- Integración de Flowise y Ollama mediante Docker para ejecutar modelos de lenguaje sin costes de API.
- Implementación de sistemas RAG que permiten a la IA responder basándose en documentos privados.
- Configuración de memoria conversacional y despliegue de chatbots mediante endpoints REST.
Si alguna vez has sentido que montar una aplicación de inteligencia artificial es un dolor de cabeza por el código o los costes de las API, llegaste al sitio adecuado. Flowise se presenta como la herramienta definitiva para quienes queremos la potencia de los LLM pero sin pelearnos con cientos de líneas de Python, permitiéndonos diseñar flujos de trabajo visualmente.
Al combinar esta joya con Ollama, conseguimos un ecosistema privado donde todo corre en nuestro propio hardware. Esto significa que puedes montar desde un simple chat hasta un sistema complejo de preguntas y respuestas sobre tus propios archivos, manteniendo la soberanía de tus datos y olvidándote de pagar suscripciones mensuales.
Preparando el terreno: Requisitos y Docker

Antes de lanzarnos a la piscina, necesitamos que el equipo aguante el tirón. Lo ideal es contar con al menos 16GB de RAM, aunque con 8GB podrías ir tirando. Si tienes una GPU NVIDIA, el rendimiento volará, pero si no, el procesador hará el trabajo, aunque sea más lento. Obviamente, debes tener Docker instalado en tu sistema.
La forma más limpia de montar esto es mediante un archivo docker-compose.yml. En este archivo definiremos dos servicios principales: uno para Ollama y otro para Flowise. Es fundamental configurar los volúmenes de datos para que, si reinicias el contenedor, no pierdas los modelos descargados ni tus flujos de trabajo. Además, si usas GPU, no olvides añadir la sección de reservations devices para que Ollama pueda aprovechar la potencia de la tarjeta gráfica.
Poniendo en marcha el ecosistema

Una vez lanzado el despliegue con docker compose up -d, el siguiente paso es dotar a Ollama de «cerebro». Necesitaremos bajar modelos específicos según el uso. Para chatear, llama3.2 es una opción equilibrada y eficiente. Sin embargo, si queremos que la IA lea documentos, necesitamos un modelo de embeddings, siendo nomic-embed-text el estándar recomendado por su velocidad y precisión.
Para ejecutar estas descargas, usamos comandos de terminal como docker exec ollama ollama pull llama3.2. Es vital entender que el modelo de chat y el de embeddings cumplen funciones distintas: uno genera la respuesta y el otro convierte el texto en vectores matemáticos para que la máquina pueda «buscar» información.
La conexión crítica: Configuraciones y URLs
Aquí es donde mucha gente se queda atascada. Si Flowise y Ollama viven en Docker, no puedes usar localhost porque cada contenedor es como una isla. En la sección de Credenciales de Flowise, al añadir ChatOllama u Ollama Embeddings, debes usar la URL http://ollama:11434, haciendo referencia al nombre del servicio en el archivo de compose.
Ojo, si por alguna razón estás en Windows o MacOS fuera de una red de Docker estándar, podrías necesitar http://host.docker.internal:8000. Y si eres usuario de Linux, recuerda que el gateway predeterminado suele ser http://172.17.0.1:8000. Si no ajustas esto, Flowise se quedará colgado intentando llamar a una puerta que no existe.
Construyendo tu primer chatbot sencillo
Para comprobar que todo el cableado está bien, lo mejor es montar un flujo básico. En el lienzo de Flowise, arrastramos un nodo de ChatOllama y una Conversation Chain. Conectamos el modelo al chain, indicamos que usemos llama3.2 y le damos a guardar. Si al escribir un mensaje recibes respuesta, ya tienes el puente tendido.
Si quieres que la IA no sea tan genérica, puedes añadir un nodo de System Message. Aquí es donde le das la personalidad, por ejemplo, diciéndole que actúe como un experto en soporte técnico de tu empresa y que sea conciso, evitando que se invente cosas cuando no sepa la respuesta.
Dominando el RAG: Chatbots que leen tus documentos

El RAG (Generación Aumentada por Recuperación) es donde ocurre la verdadera magia. En lugar de que la IA responda con lo que sabe del entrenamiento general, busca primero en tus archivos y luego redacta la respuesta. Para esto, necesitamos una arquitectura de varios pasos: un cargador de documentos, un divisor de texto, un almacén de vectores y el modelo de lenguaje.
El Recursive Character Text Splitter es clave aquí. Recomendamos un tamaño de chunk de 1000 caracteres con un solapamiento de 200. Esto evita que las frases se corten a la mitad y permite que la IA tenga suficiente contexto. Para guardar estos datos, puedes usar la memoria temporal In-Memory Vector Store para pruebas, pero si vas en serio, instala Chroma o Qdrant en tu Docker Compose para que la información sea persistente.
Memoria, API y Despliegue Final
Un bot que olvida lo que dijiste hace dos frases es frustrante. Para solucionarlo, conectamos un nodo de Buffer Memory a nuestra cadena de conversación. Esto permite que la IA recuerde los últimos intercambios. Si necesitas que esta memoria sobreviva a reinicios del servidor, la mejor opción es integrar Redis en el sistema.
Lo mejor de Flowise es que cada flujo se convierte automáticamente en una API REST. Puedes copiar la URL del endpoint y consumirla desde cualquier aplicación o, más sencillo aún, usar el widget de chat embebible que Flowise proporciona. Solo tienes que copiar el script de JavaScript en tu web y tendrás un asistente inteligente funcionando en minutos.
Solución de problemas comunes
Si notas que el bot responde cosas irrelevantes, prueba a bajar la temperatura a 0.1; esto hace que la IA sea más literal y se ciña más a los documentos. Si el sistema se vuelve lento, revisa con nvidia-smi si la GPU está trabajando. En casos donde los PDFs sean gigantescos, es posible que Node.js se quede sin aire; en ese caso, añade la variable de entorno NODE_OPTIONS=–max-old-space-size=4096 en tu configuración de Docker.
A diferencia de otras herramientas como n8n, que es más para automatizar tareas, o Dify, que es más robusto pero restrictivo, Flowise brilla en la protipación rápida de flujos de IA. Combinando la gestión visual de nodos con la potencia local de Ollama, tienes en tus manos una plataforma capaz de procesar miles de consultas sin gastar un solo euro en créditos de nube.
Soy un apasionado de la tecnología que ha convertido sus intereses «frikis» en profesión. Llevo más de 10 años de mi vida utilizando tecnología de vanguardia y trasteando todo tipo de programas por pura curiosidad. Ahora me he especializado en tecnología de ordenador y videojuegos. Esto es por que desde hace más de 5 años que trabajo redactando para varias webs en materia de tecnología y videojuegos, creando artículos que buscan darte la información que necesitas con un lenguaje entendible por todos.
Si tienes cualquier pregunta, mis conocimientos van desde todo lo relacionado con el sistema operativo Windows así como Android para móviles. Y es que mi compromiso es contigo, siempre estoy dispuesto a dedicarte unos minutos y ayudarte a resolver cualquier duda que tengas en este mundo de internet.