Cómo descargar y ejecutar tu primer modelo con Ollama

Última actualización: 17/08/2026

  • Permite ejecutar modelos de lenguaje potentes (LLMs) de forma local, garantizando privacidad total y funcionamiento sin conexión a internet.
  • Es compatible con Windows, macOS y Linux, requiriendo principalmente una buena cantidad de VRAM en la GPU para un rendimiento óptimo.
  • Ofrece una amplia biblioteca de modelos especializados en chat general, programación y razonamiento avanzado, integrables mediante API o interfaces gráficas.

Cómo descargar y ejecutar tu primer modelo con Ollama

¿Cómo descargar y ejecutar tu primer modelo con Ollama? Imagina poder tener un cerebro artificial potentísimo viviendo directamente en tu ordenador, sin tener que pagar suscripciones mensuales ni preocuparte de que una empresa en California lea tus secretos. Ejecutar modelos de lenguaje locales se ha vuelto sorprendentemente sencillo gracias a herramientas que eliminan toda la fricción técnica, permitiéndonos pasar de cero a tener un chat inteligente en cuestión de minutos.

Aquí es donde entra en juego Ollama, una plataforma que básicamente actúa como el Docker de la inteligencia artificial. Su magia reside en que gestiona todo el proceso tedioso: desde la descarga del modelo y la optimización de la memoria hasta la ejecución, ofreciendo una experiencia fluida tanto para quienes saben programar como para los que solo quieren probar la IA sin romper nada en el camino.

¿Por qué molestarse en instalar IA en local?

Pantalla de ordenador con código de programación en Visual Studio Code y terminal, ilustrando la instalación de Ollama y su uso para programar.

La razón principal es, sin duda, la privacidad absoluta. Cuando usas servicios en la nube, tus datos viajan por internet; con Ollama, la información no sale de tu máquina, lo que es vital si manejas documentos confidenciales o datos sensibles. Además, te olvidas de los costes por tokens o las cuotas mensuales de 20 euros, ya que una vez descargado el modelo, el uso es totalmente gratuito.

Contenido exclusivo - Clic Aquí  Quitar Marca Agua Foto

Otro punto fuerte es la capacidad de funcionar sin internet. Puedes llevarte tu portátil a un avión o a una zona rural y seguir teniendo un asistente capaz de programar o redactar textos. Por último, la flexibilidad es total: puedes crear modelos personalizados mediante archivos de configuración llamados Modelfiles, ajustando la personalidad y el comportamiento de la IA a tu antojo.

Hardware: ¿Qué necesitas para que no vaya a pedales?

No hace falta tener un supercomputador, pero sí hay que ser realistas con los recursos. El cuello de botella siempre será la VRAM de la tarjeta gráfica. Si tienes una GPU NVIDIA o AMD, Ollama la aprovechará para que las respuestas sean instantáneas. Si solo tienes CPU, funcionará, pero la velocidad caerá drásticamente, pasando de generar decenas de palabras por segundo a algunas pocas.

  • Modelos ligeros (1-3B): Con 8 GB de RAM y 4 GB de VRAM vas sobrado. Ejemplos como Gemma 2 2B son ideales para tareas simples.
  • Modelos medianos (7-8B): Aquí el estándar son 16 GB de RAM y 8 GB de VRAM. Es el terreno de Llama 3.1 8B o Mistral, que ofrecen el equilibrio perfecto entre calidad y rapidez.
  • Modelos grandes (13-70B+): Aquí ya entramos en terreno profesional. Para un modelo de 70B necesitarás al menos 64 GB de RAM y GPUs con 40 GB de VRAM o más.

Para quienes usan Apple Silicon (M1, M2, M3, M4), la experiencia es fantástica gracias a la memoria unificada, que permite que la GPU acceda a toda la RAM del sistema.

Guía de instalación paso a paso

Persona trabajando con un portátil en una oficina moderna, destacando la privacidad y flexibilidad de ejecutar modelos de lenguaje locales.

Instalar Ollama es casi un proceso de un solo clic, dependiendo de tu sistema operativo:

  • En Windows: Descargas el ejecutable .exe desde la web oficial, lo instalas y verás el icono de Ollama en la bandeja del sistema. Si quieres cambiar la ruta donde se guardan los modelos (porque el disco C se llena rápido), debes crear una variable de entorno llamada OLLAMA_MODELS con la ruta de tu carpeta preferida.
  • En macOS: Basta con descargar el archivo .dmg y arrastrar la aplicación a la carpeta de Aplicaciones.
  • En Linux: Se hace mediante una sola línea de comandos: curl -fsSL https://ollama.com/install.sh | sh. Esto configura automáticamente el servicio systemd.
Contenido exclusivo - Clic Aquí  Cómo registrar un dll en Windows 10

Para comprobar que todo está en orden, abre una terminal y escribe ollama --version. Si te devuelve el número de la versión, ya estás dentro.

Tus primeros pasos con los modelos

Para poner en marcha una IA, no necesitas configurar nada complejo, solo usar el comando run. Por ejemplo, si escribes ollama run llama3.1, el sistema descargará automáticamente el modelo y abrirá un chat interactivo en la propia terminal. Para salir de ahí, simplemente escribe /bye.

Catálogo de modelos recomendados

Interfaz de chat de IA en una pantalla, representando el resultado de ejecutar un modelo como DeepSeek a través de Ollama y Open WebUI.

No todos los modelos sirven para lo mismo. Dependiendo de tu objetivo, te conviene elegir uno u otro:

  • Uso general: Llama 3.3 70B es la bestia para razonamiento complejo, mientras que Llama 3.1 8B es la opción más versátil para el día a día.
  • Programación: DeepSeek Coder y Qwen 2.5 Coder son herramientas brutales para autocompletar código y depurar errores directamente en tu editor.
  • Razonamiento avanzado: DeepSeek-R1 es la opción ideal si necesitas que la IA piense paso a paso antes de responder, acercándose a la capacidad de los modelos más top del mercado.
  • Multimodalidad: LLaVA es perfecto si quieres que la IA analice imágenes y te describa qué hay en ellas.
Contenido exclusivo - Clic Aquí  Word cambia las reglas: autoguardado en la nube por defecto

Llevando Ollama al siguiente nivel: Interfaces y APIs

Si la terminal te parece demasiado espartana, puedes instalar Open WebUI. Es una interfaz web que clona la experiencia de ChatGPT pero conectada a tu Ollama local. Se instala fácilmente mediante Docker y te permite gestionar historiales, subir PDFs para hacerles preguntas (RAG) y cambiar de modelo con un clic.

Para los desarrolladores, Ollama expone una API REST en el puerto 11434 que es totalmente compatible con la de OpenAI. Esto significa que puedes integrar tu IA local en cualquier aplicación de Python o JavaScript simplemente cambiando la URL del servidor. Incluso existen extensiones como Continue.dev para VS Code que convierten a Ollama en tu propio Copilot privado.

Trucos de optimización y mantenimiento

Para que el sistema vuele, es recomendable usar modelos cuantizados (como los Q4_K_M), que reducen el peso del modelo sin perder apenas calidad. Si notas que el modelo olvida cosas, puedes ampliar la ventana de contexto usando el parámetro --num-ctx. Además, mantener los drivers de NVIDIA actualizados es fundamental para aprovechar tecnologías como Flash Attention, que reduce el consumo de memoria.

Ollama ha transformado la IA local en algo accesible, permitiendo que cualquier persona con un PC decente despliegue desde asistentes de programación hasta sistemas de análisis de documentos privados. Gracias a su arquitectura basada en comandos sencillos, la integración con interfaces visuales como Open WebUI y la compatibilidad con una enorme librería de modelos open source, ya no es necesario depender de la nube para aprovechar la potencia de los LLMs.