Cómo importar modelos GGUF en Ollama: Guía Completa

Última actualización: 24/07/2026

  • Capacidad de integrar modelos personalizados de Hugging Face que no están en el registro oficial de Ollama.
  • Flexibilidad para elegir diferentes niveles de cuantización según la memoria VRAM disponible.
  • Soporte avanzado para la carga de modelos GGUF fragmentados en múltiples archivos.
  • Posibilidad de ejecutar modelos privados mediante la configuración de llaves SSH.
Cómo importar modelos GGUF en Ollama

Si te mola trastear con la inteligencia artificial, habrás notado que a veces el catálogo oficial de Ollama se queda corto y necesitas un modelo muy específico que solo está disponible en formato GGUF. Afortunadamente, Ollama permite importar estos archivos de forma manual, abriendo la puerta a que uses cualquier cuantización que encuentres por ahí, especialmente las que suben la comunidad a Hugging Face.

Para los que están empezando, el proceso puede parecer un poco intimidante porque la documentación a veces no mastica los pasos para novatos. Sin embargo, una vez que entiendes que todo se resume en crear un archivo de configuración llamado Modelfile, el camino se vuelve pan comido y puedes tener tu IA personalizada funcionando en cuestión de minutos.

Cómo usar varios modelos diferentes en Ollama sin conflictos
Related article:
Guía Completa para Gestionar Varios Modelos en Ollama sin Conflictos

Descarga y preparación del modelo

Descarga y preparación del modelo GGUF en Ollama

Lo primero que tienes que hacer es ir a Hugging Face y buscar el modelo que te interese. Verás que hay un montón de versiones cuantizadas, como la Q4_K_M, Q5_K_M o la Q8_0. No te agobies con los nombres; básicamente, cuanto menor sea el número, menos memoria RAM o VRAM consumirá el modelo, aunque perderá un pelín de precisión. Elige la que mejor se adapte a tu hardware y descarga el archivo .gguf.

Contenido exclusivo - Clic Aquí  Cómo hacer Captura de Pantalla en Mac con Teclado Windows

Una vez tengas el archivo en tu ordenador, te recomiendo colocarlo en una carpeta fija y evitar que el nombre del archivo tenga espacios o caracteres extraños. Si el nombre es un trabalenguas, cámbialo por algo sencillo para que no te dé errores al escribir las rutas en la terminal.

Si eres usuario de Windows, puedes dejar el archivo en tu carpeta de Descargas, pero asegúrate de conocer la ruta exacta (por ejemplo, C:\Users\TuNombre\Downloads\modelo.gguf), ya que será la pieza clave para que Ollama encuentre el modelo.

Cómo conectar Open WebUI con Ollama para utilizar modelos locales sin Internet
Related article:
Cómo conectar Open WebUI con Ollama para utilizar modelos locales sin Internet

Creación del Modelfile y registro en Ollama

Aquí es donde ocurre la magia. Necesitas crear un archivo de texto plano. Puedes abrir el Bloc de Notas y escribir una única línea: from «C:\ruta\al\archivo\modelo.gguf». Es vital que la ruta sea la correcta y esté entre comillas si hay espacios. Una vez escrito, guarda el archivo con el nombre Modelfile (sin el .txt al final), aunque si te cuesta quitar la extensión, guárdalo como Modelfile.txt y luego renómbralo manualmente en la carpeta.

Ahora toca pasar a la acción con la consola. Abre el CMD o tu terminal favorita y ejecuta el comando ollama create nombre-de-tu-modelo -f Modelfile. En este punto, Ollama leerá las instrucciones, procesará el archivo GGUF y creará una nueva capa en su sistema local. Solo queda esperar a que el proceso termine y veas el mensaje de éxito.

Contenido exclusivo - Clic Aquí  Como Poner Llaves

Si tienes curiosidad por saber cómo están configurados los modelos oficiales, puedes usar el comando ollama show –modelfile llama3.2. Esto te permitirá ver cómo se organizan el system prompt y las plantillas, lo cual es súper útil si quieres personalizar el comportamiento de tu IA más allá de la simple importación del archivo.

Cómo añadir varios modelos de IA a Open WebUI y cambiar entre ellos
Related article:
Guía Completa para Añadir y Gestionar Múltiples Modelos de IA en Open WebUI

Métodos avanzados y automatizaciones

Para los que buscan ir más rápido, existe la posibilidad de ejecutar modelos directamente desde Hugging Face sin crearle un Modelfile manual. Si el modelo es público, puedes usar la sintaxis ollama run hf.co/usuario/repositorio. Por defecto, Ollama intentará usar la cuantización Q4_K_M, pero si quieres una distinta, puedes seleccionarla desde el visor de GGUF en la web de Hugging Face y copiar el fragmento de código generado.

En el caso de que trabajes con modelos privados, el proceso requiere un paso extra de seguridad. Deberás copiar tu llave SSH de Ollama (que suele estar en ~/.ollama/id_ed25519.pub) y añadirla a la configuración de tu cuenta de Hugging Face. Una vez hecho esto, podrás llamar a tus repositorios privados directamente desde la terminal sin complicaciones.

Otro problema común ocurre cuando el modelo es tan grande que está dividido en varios archivos GGUF. Antiguamente esto era un dolor de cabeza, pero ahora el comando create soporta la importación de múltiples archivos. Solo tienes que listar todos los archivos .gguf en el Modelfile o pasarlos en el comando de creación para que Ollama los una correctamente.

Cómo instalar Open WebUI con Docker y acceder desde cualquier dispositivo
Related article:
Cómo instalar Open WebUI con Docker y acceder desde cualquier dispositivo

Ajustes de rendimiento y personalización

No basta con que el modelo cargue; queremos que responda bien. Si notas que la IA se comporta de forma extraña, es probable que necesites ajustar la plantilla de chat (chat template). Ollama intenta detectarla automáticamente desde los metadatos del archivo GGUF, pero si falla, puedes crear un archivo llamado «template» en tu repositorio o definirlo en el Modelfile usando el formato de plantillas de Go.

Contenido exclusivo - Clic Aquí  Como Desbloquear Un Control Mirage

También puedes optimizar la experiencia creando un archivo llamado «params» en formato JSON para ajustar los parámetros de muestreo, como la temperatura o el top_p. Esto es fundamental si buscas que la IA sea más creativa o, por el contrario, mucho más determinista y rigurosa en sus respuestas.

Integrar archivos GGUF externos permite saltarse las limitaciones de la biblioteca oficial, permitiéndonos elegir la cuantización exacta para nuestra VRAM y personalizar el prompt del sistema. Ya sea mediante la creación manual de un Modelfile, la ejecución directa desde hf.co o la gestión de modelos fragmentados y privados, Ollama se ha convertido en una herramienta flexible para desplegar cualquier LLM localmente con un esfuerzo mínimo.