Guía Completa para Conectar AnythingLLM con Ollama

Última actualización: 20/07/2026

  • Implementación de sistemas RAG locales para interactuar con documentos privados sin enviar datos a la nube.
  • Configuración flexible de modelos de lenguaje y embeddings mediante la integración de Ollama.
  • Gestión avanzada de conocimientos mediante workspaces independientes con control de permisos multiusuario.
Conectar AnythingLLM con Ollama

AnythingLLM y Ollama permiten crear un asistente que consulta tus propios documentos utilizando modelos ejecutados en el ordenador o servidor. Ollama se encarga de cargar el modelo de lenguaje, mientras que AnythingLLM proporciona la interfaz, organiza los archivos y recupera la información relevante mediante RAG.

Cuando todos los componentes están configurados localmente, los documentos y las consultas no necesitan enviarse a un proveedor de modelos en la nube. Sin embargo, esta privacidad depende de que tampoco actives búsquedas web, APIs externas u otras herramientas que transmitan información fuera del equipo.

Qué necesitas antes de conectar AnythingLLM con Ollama

Qué necesitas antes de conectar AnythingLLM con Ollama

Necesitas tener Ollama instalado y en ejecución, además de AnythingLLM Desktop o una instancia desplegada con Docker. Desktop resulta más sencillo para un único usuario, mientras que Docker permite acceder desde el navegador y compartir la instalación.

Los recursos necesarios dependen del modelo elegido, su cuantización y la longitud de contexto. Un modelo pequeño puede funcionar únicamente con la CPU, aunque responderá más lentamente. Los modelos de 7.000 u 8.000 millones de parámetros suelen necesitar más memoria y ofrecen una experiencia mejor cuando Ollama puede utilizar una GPU compatible.

No conviene establecer una cantidad mínima de RAM válida para todos los casos. Antes de descargar un modelo grande, comprueba su tamaño y deja memoria disponible para el sistema operativo, AnythingLLM y la base de datos vectorial.

Descarga un modelo de chat y otro de embeddings

Ollama necesita un modelo para generar las respuestas y, si también quieres utilizarlo como proveedor de embeddings, otro modelo especializado en transformar los documentos en vectores.

Contenido exclusivo - Clic Aquí  Komala

Puedes descargar dos modelos de ejemplo mediante:

ollama pull llama3.1:8b
ollama pull nomic-embed-text

El primer modelo se utiliza para conversar y redactar respuestas. nomic-embed-text solo genera embeddings y no puede utilizarse como modelo de chat. Puedes comprobar los modelos disponibles con:

ollama list

Estos nombres son ejemplos, no requisitos. Puedes seleccionar un modelo de chat más pequeño si el equipo tiene pocos recursos. Para documentos mayoritariamente en español también puede interesarte un modelo de embeddings multilingüe disponible en la biblioteca de Ollama, como bge-m3.

El modelo de embeddings debe elegirse antes de indexar una biblioteca grande. Si lo cambias posteriormente, tendrás que volver a procesar los documentos para generar vectores compatibles.

Cómo conectar AnythingLLM Desktop con Ollama

Abre los ajustes de AnythingLLM y selecciona Ollama como proveedor del modelo de lenguaje. Si ambas aplicaciones se ejecutan en el mismo ordenador, utiliza normalmente esta dirección:

http://127.0.0.1:11434

AnythingLLM debería mostrar los modelos descargados. Selecciona el que utilizarás para el chat y realiza una prueba antes de añadir los documentos.

Después, abre la configuración del proveedor de embeddings. Puedes elegir el modelo integrado de AnythingLLM o seleccionar Ollama y utilizar el modelo de embeddings descargado anteriormente. LanceDB puede mantenerse como base de datos vectorial local si no necesitas otro sistema.

No establezcas una ventana de contexto elevada únicamente porque el modelo la admita. Aumentar el contexto incrementa el consumo de memoria y puede ralentizar las respuestas. Empieza con la configuración detectada por Ollama y modifícala solo si tu caso lo necesita.

Contenido exclusivo - Clic Aquí  Como Contratar Afizzionados en Sky

Cómo conectar AnythingLLM en Docker con Ollama

instalar AnythingLLM con Docker

Cuando AnythingLLM se ejecuta dentro de un contenedor, localhost apunta al propio contenedor y no al ordenador anfitrión. En Docker Desktop para Windows o macOS puedes utilizar:

http://host.docker.internal:11434

En Linux, ese nombre puede no estar disponible automáticamente. Puedes añadir una asignación al iniciar el contenedor o incluirla en Docker Compose:

extra_hosts:
  - "host.docker.internal:host-gateway"

También puede ser necesario configurar Ollama para que escuche en una dirección accesible desde la red de Docker. No expongas el puerto 11434 directamente a Internet, ya que la API local de Ollama no está pensada para publicarse sin una capa adicional de protección.

Si Ollama y AnythingLLM se ejecutan como servicios del mismo archivo de Docker Compose, resulta más limpio incorporarlos a una red privada común y utilizar el nombre del servicio, por ejemplo:

http://ollama:11434

Tras guardar la dirección, verifica que AnythingLLM puede mostrar los modelos instalados antes de continuar.

Añade documentos y configura el RAG

Crea un espacio de trabajo y sube los documentos que quieras consultar. Para que estén disponibles mediante RAG, debes incorporarlos al workspace e iniciar su procesamiento. AnythingLLM dividirá el texto en fragmentos, generará los embeddings y los almacenará en la base vectorial.

Cuando haces una pregunta, el sistema recupera algunos fragmentos relacionados y los incorpora al contexto enviado al modelo. Esto reduce la cantidad de texto procesado, pero significa que el modelo no lee automáticamente todos los documentos en cada consulta.

Si una respuesta omite información relevante, revisa el número máximo de fragmentos recuperados y el umbral de similitud. Un umbral muy restrictivo puede descartar el fragmento que contiene la respuesta. La documentación recomienda probar temporalmente la opción sin restricciones cuando el RAG no encuentra información que sí aparece en los archivos.

Contenido exclusivo - Clic Aquí  Como Saber La Ubicacion

Las referencias mostradas por AnythingLLM ayudan a identificar el documento utilizado, pero no garantizan que la respuesta sea correcta ni que siempre se indique la página exacta. Conviene comprobar la fuente antes de utilizar el resultado en decisiones importantes.

Soluciona los problemas más habituales

Si AnythingLLM no detecta Ollama, comprueba primero que el servicio esté activo y que la dirección configurada sea accesible desde el mismo entorno donde se ejecuta AnythingLLM. También puedes verificar la API local mediante:

curl http://localhost:11434/api/tags

Si el modelo aparece en Ollama pero no en AnythingLLM, actualiza la lista de modelos y revisa que hayas seleccionado el proveedor correcto. En Docker, el problema suele estar relacionado con el uso incorrecto de localhost o con una configuración de red que impide llegar al host.

Cuando las respuestas sean poco precisas, comprueba el modelo de embeddings, el idioma de los documentos, el tamaño de los fragmentos y el umbral de similitud. Un modelo de chat más grande no solucionará una recuperación deficiente si los fragmentos adecuados no llegan al contexto.

Utilizar Ollama evita el coste por consulta de una API externa, pero sigue implicando consumo eléctrico, espacio de almacenamiento y mantenimiento del equipo. La principal ventaja de esta combinación es poder controlar dónde se procesan los documentos y adaptar el modelo a los recursos disponibles.