- El comando específico para descargar un modelo de la memoria es ollama stop, aunque también se puede forzar mediante la API con keep_alive en 0.
- La gestión de la VRAM es crítica, ya que el contexto excesivo puede desplazar el modelo a la CPU y ralentizar la generación de tokens.
- Es posible automatizar la descarga de modelos configurando la variable de entorno OLLAMA_KEEP_ALIVE para optimizar los recursos del sistema.

¿Cómo detener un modelo que continúa cargado en Ollama? Seguro que te ha pasado: lanzas un modelo potente en tu ordenador, haces tus pruebas y, al cerrar la terminal, notas que el consumo de memoria GPU sigue por las nubes. Esto ocurre porque Ollama, para evitar que cada petición tarde una eternidad en cargar, mantiene los pesos del modelo en la RAM o VRAM durante un tiempo. Es una funcionalidad genial para la fluidez, pero puede convertirse en un dolor de cabeza si necesitas liberar espacio para jugar o ejecutar otra aplicación pesada.
Manejar la inteligencia artificial en local tiene su aquel, y no siempre es tan intuitivo como darle a un botón de apagado. En este artículo vamos a desgranar no solo cómo echar el modelo de la memoria, sino también cómo tunear Ollama para que no te coma los recursos del sistema, desde el uso de la línea de comandos hasta ajustes avanzados en el servidor y la API, para que tengas el control total de tu hardware.
Cómo liberar el modelo de la memoria

Si quieres que un modelo deje de ocupar espacio en tu tarjeta gráfica inmediatamente, la vía más rápida es utilizar el comando ollama stop seguido del nombre del modelo (por ejemplo, ollama stop llama3.2). Este comando le dice al servidor que expulse el modelo de la memoria activa, liberando así la VRAM para otros procesos.
A veces, however, puede que quieras hacer esto de forma programática. Para ello, puedes enviar una solicitud a la API de Ollama utilizando curl o Python, especificando el parámetro keep_alive con un valor de 0. Esto provoca que el servidor descargue el modelo justo después de procesar la petición, sin esperar los minutos de cortesía habituales.
Entendiendo la persistencia y el Keep-Alive

Por defecto, Ollama no borra el modelo al instante; suele dejarlo cargado unos 5 minutos aproximadamente. Esto se hace para que, si vuelves a preguntar algo, la respuesta sea instantánea. Si este comportamiento te molesta o quieres cambiarlo, tienes que jugar con la variable de entorno OLLAMA_KEEP_ALIVE.
- Si pones el valor en 0, el modelo se va en cuanto termina la tarea.
- Si usas un valor como 30m, se quedará ahí media hora.
- Si estableces el valor en -1, el modelo no se descargará nunca hasta que reinicies el servidor o lo pares manualmente.
Para configurar esto en Linux, lo ideal es editar la unidad de systemd con sudo systemctl edit ollama.service y añadir la línea Environment=\»OLLAMA_KEEP_ALIVE=0\» bajo la sección de Service. En Windows, deberás añadirlo a las Variables de Entorno del Sistema y reiniciar la aplicación desde el Administrador de Tareas.
El impacto de la ventana de contexto en la VRAM
Un error muy común es pensar que el modelo solo ocupa lo que pesa su archivo. La realidad es que la longitud del contexto (parámetro num_ctx) consume memoria adicional. Si configuras una ventana de contexto enorme, como 64k o 128k tokens, es muy probable que el modelo ya no quepa entero en la GPU.
Cuando ocurre esto, Ollama hace un volcado parcial a la CPU. Puedes comprobarlo ejecutando ollama ps. Si en la columna PROCESSOR ves que no dice 100% GPU, significa que el rendimiento va a caer en picado porque el procesador es mucho más lento que la gráfica. Para solucionar esto, puedes reducir la ventana de contexto en el Modelfile o mediante la bandera -p num_ctx al ejecutar el modelo.
Gestión avanzada y automatización de modelos
Para quienes buscan llevar su setup al siguiente nivel, crear modelos personalizados mediante un Modelfile es la clave. Aquí puedes definir no solo el modelo base con FROM, sino también la temperatura para la creatividad y el prompt del sistema para darle una personalidad específica. Una vez creado con ollama create, el modelo se comporta como cualquier otro pero con tus ajustes predefinidos.
Si trabajas con agentes de programación o scripts, puedes automatizar la interacción redirigiendo archivos. Por ejemplo, usar ollama run modelo \"resume esto\" < archivo.txt permite procesar datos sin copiar y pegar. Además, si necesitas que la IA sea persistente en una tarea, recuerda que configurar el servidor es más eficiente que hacerlo en el cliente, ya que todos los agentes que conecten a ese host heredarán la configuración de memoria y contexto.
Solución de problemas y errores comunes
Es frecuente toparse con el error Address already in use en el puerto 11434. Esto suele pasar porque hay una instancia de Ollama colgada en segundo plano. En Windows, puedes matar el proceso desde la pestaña Detalles del Administrador de Tareas; en Linux o Mac, un lsof -i :11434 te dirá el PID para hacerle un kill al proceso.
Otro problema es cuando el modelo parece olvidar lo que dijiste hace dos turnos. Esto no es un fallo de la IA, sino que probablemente has superado el límite de contexto. Ollama descarta los tokens más antiguos silenciosamente. La solución es aumentar el OLLAMA_CONTEXT_LENGTH en el servidor y reiniciar el servicio para que la memoria se asigne correctamente.
Dominar la carga y descarga de modelos en Ollama permite exprimir al máximo cualquier hardware, evitando que la VRAM se sature y asegurando que la velocidad de inferencia sea la óptima. Desde el simple uso de ollama stop hasta el ajuste fino de las variables de entorno y el control del contexto, tener el control sobre cómo el modelo reside en la memoria es la diferencia entre un sistema lento y una estación de IA local verdaderamente potente.
Apasionado de la tecnología desde pequeñito. Me encanta estar a la última en el sector y sobre todo, comunicarlo. Por eso me dedico a la comunicación en webs de tecnología y videojuegos desde hace ya muchos años. Podrás encontrarme escribiendo sobre Android, Windows, MacOS, iOS, Nintendo o cualquier otro tema relacionado que se te pase por la cabeza.