Cómo acelerar Ollama: Guía completa para optimizar tu IA local

Última actualización: 24/07/2026

  • La gestión de la VRAM y el uso de cuantizaciones adecuadas son los factores que más impactan en la velocidad de generación.
  • La configuración de variables de entorno como el tiempo de permanencia del modelo y Flash Attention elimina retardos críticos.
  • El uso de hardware especializado como GPUs NVIDIA o Apple Silicon es fundamental para evitar el cuello de botella de la CPU.
  • El ajuste preciso del tamaño del contexto evita que el sistema recurra a la memoria RAM o al disco, disparando los tiempos de respuesta.
ollama va lento

Montar tu propio servidor de inteligencia artificial en casa es una experiencia emocionante, pero nada corta más las alas que instalar un modelo potente y darte cuenta de que el primer token tarda una eternidad en aparecer o que la velocidad de escritura es más lenta que la de una tortuga. Si sientes que tu hardware es capaz de dar más pero Ollama no termina de arrancar, no te desesperes; lo más probable es que haya algún cuello de botella en la configuración que no estás viendo.

El rendimiento de los LLMs locales depende críticamente de cómo se gestionan los datos entre el disco, la memoria RAM y la VRAM de la tarjeta gráfica. Cuando algo falla en este flujo, la IA empieza a hacer swapping a la memoria del sistema, y es ahí donde la velocidad cae en picado. En este artículo vamos a desgranar todas las técnicas, desde los ajustes rápidos de cinco minutos hasta optimizaciones avanzadas, para que tu modelo local vuele.

Cómo limitar la memoria RAM que utiliza Ollama
Related article:
Cómo optimizar y limitar el uso de memoria en Ollama

Diagnóstico: ¿Dónde está el problema?

porque ollama va lento

Antes de tocar nada, es vital saber qué está pasando exactamente. Si notas que la primera respuesta tarda 20 segundos pero luego fluye, el problema es la carga del modelo desde el disco. Si, por el contrario, la generación de palabras es constante y lentísima (1-3 tokens por segundo), es muy probable que Ollama no esté detectando tu GPU y esté haciendo toda la inferencia mediante la CPU.

Contenido exclusivo - Clic Aquí  ¿Cómo hacer captura de pantalla en Dell XPS?

Otro síntoma típico es cuando los modelos pequeños van genial, pero al probar uno más grande el sistema se vuelve inusable. Esto indica que la VRAM de tu tarjeta es insuficiente y el modelo se ha desbordado hacia la RAM normal. Para comprobarlo en tiempo real, puedes usar el comando watch -n 0.5 nvidia-smi en Linux o herramientas como GPU-Z en Windows, vigilando que la utilización de la GPU esté cerca del 100% durante la generación.

eliminar modelos que ya no utilizas en Ollama
Related article:
Cómo eliminar modelos que ya no utilizas en Ollama

Trucos rápidos para eliminar el lag inicial

Uno de los problemas más comunes es que Ollama descarga el modelo de la memoria después de unos minutos de inactividad. Para solucionar esto, podemos usar la variable de entorno OLLAMA_KEEP_ALIVE=-1, lo que obliga al programa a mantener el modelo cargado indefinidamente. Esto elimina por completo el tiempo de espera en la primera consulta, haciendo que la experiencia sea mucho más fluida y natural.

Si tienes una tarjeta NVIDIA de la serie 30xx o 40xx, es imprescindible activar Flash Attention 2 mediante la variable OLLAMA_FLASH_ATTENTION=1. Esta tecnología optimiza los cálculos matemáticos del mecanismo de atención, lo que puede suponer una mejora de hasta el 40% en la velocidad general y es especialmente efectiva cuando trabajas con contextos de texto muy extensos.

El arte de elegir la cuantización correcta

elegir la cuantización correcta

No todos los modelos son iguales. La cuantización es el proceso de reducir la precisión de los pesos del modelo para que ocupen menos espacio. Usar un modelo FP16 (precisión total) es un lujo que requiere muchísima VRAM y, si no cabe, el sistema recurrirá a la RAM, lo que es estremadamente más lento. Lo ideal es buscar un equilibrio con la cuantización Q4_K_M o Q6_K.

Contenido exclusivo - Clic Aquí  Cómo preparar Windows antes de vender tu PC: limpieza, cifrado y borrado seguro

La regla de oro es: utiliza la cuantización más alta que quepa cómodamente en tu VRAM sin hacer swap. Para tarjetas de 8-12 GB, un modelo de 8B en cuantización Q6 o Q8 suele ser el punto dulce. Si bajamos a Q4, la pérdida de calidad es mínima pero ganamos una velocidad considerable. Evita caer en Q2 o Q3 a menos que sea la única forma de que el modelo arranque, ya que la coherencia de las respuestas se desploma.

Cómo usar varios modelos diferentes en Ollama sin conflictos
Related article:
Guía Completa para Gestionar Varios Modelos en Ollama sin Conflictos

Ajustes avanzados de memoria y contexto

A veces el problema no es el modelo, sino cuánta información intentamos procesar a la vez. El parámetro num_ctx define la ventana de contexto. Un error frecuente es dejar valores astronómicos (como 128k o 256k tokens) cuando solo necesitamos unos pocos miles. Aumentar el contexto consume VRAM de forma lineal, y si te pasas, el modelo se desbordará a la RAM del sistema, ralentizando todo el proceso.

Para optimizar esto, ajusta el contexto en el Modelfile a valores como 4096 o 8192 tokens, que suelen ser el punto de equilibrio óptimo para la mayoría de chats. Además, si tienes el modelo en un disco mecánico (HDD), muévelo urgentemente a un SSD NVMe. La diferencia en la velocidad de carga es abismal, pudiendo reducir los tiempos de espera iniciales entre un 50% y un 70% gracias al uso de archivos mapeados en memoria (mmap).

Hardware y optimización del sistema

Si después de tocar todas las variables el rendimiento sigue siendo pobre, es posible que hayas llegado al límite físico de tu equipo. En Windows, asegúrate de que los drivers de CUDA estén actualizados y que Ollama no esté compitiendo con procesos en segundo plano como antivirus o actualizaciones pesadas. En Mac, la memoria unificada de los chips M2 o M3 es una ventaja enorme, ya que permite que la GPU acceda a gran parte de la RAM del sistema.

Contenido exclusivo - Clic Aquí  Cómo abrir un archivo PCF

Un factor que solemos olvidar es la temperatura. Cuando la GPU alcanza los 85-90°C, se activa el thermal throttling, reduciendo la velocidad del reloj para no quemarse, lo que provoca que la IA empiece rápido y se vuelva lenta tras unos minutos. Limpiar el polvo de los ventiladores o ajustar la curva de velocidad del fan puede recuperar un 20-50% de rendimiento perdido por el calor.

Si buscas una mejora radical, la mejor inversión es subir la capacidad de VRAM. Pasar de una RTX 3060 a una RTX 4090 de 24 GB permite ejecutar modelos de hasta 34B parámetros completamente en la GPU, evitando cualquier caída de rendimiento. Para quienes no pueden ampliar hardware, existen alternativas como alquilar GPUs por horas en servicios de nube especializados, que ofrecen una potencia bruta inalcanzable en la mayoría de los portátiles domésticos.

Lograr que una IA local funcione con soltura requiere un ajuste fino entre el tamaño del modelo, la cuantización elegida y la gestión de la memoria VRAM. Al priorizar el uso de la GPU, limitar el contexto a lo estrictamente necesario y mantener el modelo cargado en memoria, es posible transformar una experiencia frustrante y lenta en una herramienta de productividad extremadamente ágil y privada.

conexión entre Dify y Ollama
Related article:
Cómo conectar Dify con Ollama para crear IA Local