- Ajuste de los parámetros de similitud híbrida y el uso de modelos de re-ranking para filtrar resultados irrelevantes.
- Implementación de estrategias de segmentación avanzada y grafos de conocimiento mediante RAPTOR para consultas complejas.
- Configuración precisa del motor de lenguaje y el system prompt para reducir alucinaciones y aumentar la fidelidad a los datos.
¿RAGFlow responde con información incorrecta: cómo ajustar la recuperación? Seguro que te ha pasado: montas tu sistema de RAGFlow con toda la ilusión, subes tus documentos y, de repente, la IA empieza a decir cosas que no están en el texto o, peor aún, se queda callada cuando la respuesta está ahí mismo. No es que el sistema esté roto, es que la recuperación de información es un arte que requiere un ajuste fino para que el modelo no se pierda en el camino.
Para que RAGFlow no patine con la información, hay que entender que no basta con volcar archivos en una base de datos. La clave está en cómo segmentamos el contenido, cómo lo buscamos y cómo le decimos al modelo que procese esos fragmentos. Si quieres dejar de pelearte con las respuestas incorrectas, vamos a analizar a fondo cómo poner a punto cada tuerca de este framework.
Entendiendo la arquitectura de RAGFlow

RAGFlow no es el típico sistema que corta textos a ciegas. Es un framework modular donde puedes tocar cada paso: desde que importas el documento hasta que el LLM suelta la respuesta. Lo más potente es su capacidad de análisis de diseño (DeepDoc), que permite que el sistema entienda si está leyendo una tabla, una imagen o un PDF con varias columnas, evitando que la información se mezcle de forma caótica.
El corazón del sistema es la Knowledge Base. Aquí es donde viven tus fragmentos vectorizados. Un punto crítico es que el modelo de embedding que elijas al crear la base de conocimientos es definitivo; si te das cuenta de que no funciona bien, no hay vuelta atrás: toca crear una nueva base y volver a importar todo.
El dilema de la recuperación: Similitud y Pesos

Cuando el sistema busca una respuesta, utiliza tres métricas principales que puedes ajustar en el apartado de Retrieval Testing para ver los cambios en tiempo real:
- Similitud Vectorial: Se fija en el significado semántico. Es genial para entender que \»IA\» y \»Inteligencia Artificial\» son lo mismo, aunque no compartan palabras>.
- Similitud de Términos: Es una búsqueda literal, casi como el control+F de toda la vida. Es fundamental cuando buscas nombres propios o códigos específicos.
- Similitud Híbrida: Es el equilibrio perfecto, ya que combina ambas métricas. Es la opción más robusta para evitar que el sistema ignore datos concretos o se pierda en interpretaciones vagas.
Si notas que los resultados siguen siendo pobres, activar un modelo de re-ranking es la solución. Este actúa como un segundo filtro que reordena los fragmentos recuperados para que los más relevantes queden arriba del todo antes de pasar al LLM.
Segmentación y Chunking: La base de todo

Si el \»chunking\» o segmentación es mala, la respuesta será mala. RAGFlow permite configurar el Recommended Chunk Size, que define cuántos tokens tiene cada trozo de texto. Si el fragmento es muy pequeño, se pierde el contexto; si es muy grande, el LLM puede distraerse con información irrelevante.
Para llevar esto al siguiente nivel, existen funciones avanzadas que ayudan al modelo a no alucinar:
- Auto-Keyword y Auto-Question: El sistema genera palabras clave y posibles preguntas para cada fragmento, lo que facilita que la búsqueda encuentre la aguja en el pajar>.
- Tag Sets: Permite etiquetar fragmentos con vocabulario controlado (como \»Derecho Laboral\»), añadiendo una capa de metadatos estructurados muy útil para filtrar búsquedas.
- Grafos de Conocimiento y RAPTOR: Esta es la joya de la corona. En lugar de buscar trozos sueltos, RAPTOR analiza las relaciones lógicas entre ellos. Esto es vital para preguntas multi-hop, donde la respuesta no está en un solo sitio, sino distribuida por el documento.
Ajustando el Asistente y el Modelo
Una vez recuperada la información, entra en juego el Prompt Engine. El System Prompt es donde le das las reglas del juego al modelo. Si quieres evitar que invente cosas, debes ser tajante: \»Responde únicamente basándote en el contenido proporcionado\». El uso de variables como {knowledge} permite que el sistema inyecte los fragmentos exactos en la instrucción.
En cuanto a los parámetros del modelo, hay tres que debes vigilar:
- Temperature: Para evitar respuestas incorrectas, ponla baja (cercana a 0). Así el modelo es determinista y preciso, en lugar de creativo.
- Top P: Controla el pool de palabras candidatas. Un valor bajo hace que la respuesta sea más predecible y menos propensa a errores.
- Similarity Threshold: Este es el portero de la discoteca. Si el valor es muy alto, solo pasan fragmentos muy similares; si es bajo, entra de todo, aumentando el riesgo de ruido en la respuesta.
Para casos donde necesites hacer cálculos o sumas sobre miles de datos, el RAG tradicional falla. Aquí es donde entra el SQL RAG, que convierte la pregunta del usuario en una consulta SQL para que la base de datos haga el trabajo sucio de agregación y el LLM solo redacte el resultado.
Despliegue y Rendimiento Técnico
Para que todo esto vuele, la infraestructura debe estar a la altura. RAGFlow se despliega fácilmente con Docker Compose, pero ojo con la memoria. Elasticsearch es tragón, por lo que ajustar el vm.max_map_count es obligatorio para que no se te caiga el servicio. Si tienes una GPU, úsala para acelerar los embeddings y el análisis de DeepDoc, lo que reducirá drásticamente la latencia de respuesta.
Es posible ejecutar todo el ecosistema de forma 100% local usando Ollama o vLLM, lo que garantiza que tus datos no salgan de tu servidor. Solo recuerda que si usas la versión \»slim\» de la imagen, tendrás que configurar los embeddings externamente.
Dominar RAGFlow implica pasar de una configuración básica a una estrategia donde el re-ranking, la segmentación inteligente mediante grafos y un control estricto de la temperatura del modelo trabajan juntos. Al optimizar la similitud híbrida y refinar el system prompt, se logra transformar un chatbot que alucina en una herramienta de precisión quirúrgica capaz de razonar sobre documentos complejos con citas verificables.
Apasionado de la tecnología desde pequeñito. Me encanta estar a la última en el sector y sobre todo, comunicarlo. Por eso me dedico a la comunicación en webs de tecnología y videojuegos desde hace ya muchos años. Podrás encontrarme escribiendo sobre Android, Windows, MacOS, iOS, Nintendo o cualquier otro tema relacionado que se te pase por la cabeza.