- Capacidad de integrar modelos personalizados de Hugging Face que no están en el registro oficial de Ollama.
- Flexibilidad para elegir diferentes niveles de cuantización según la memoria VRAM disponible.
- Soporte avanzado para la carga de modelos GGUF fragmentados en múltiples archivos.
- Posibilidad de ejecutar modelos privados mediante la configuración de llaves SSH.
Si te mola trastear con la inteligencia artificial, habrás notado que a veces el catálogo oficial de Ollama se queda corto y necesitas un modelo muy específico que solo está disponible en formato GGUF. Afortunadamente, Ollama permite importar estos archivos de forma manual, abriendo la puerta a que uses cualquier cuantización que encuentres por ahí, especialmente las que suben la comunidad a Hugging Face.
Para los que están empezando, el proceso puede parecer un poco intimidante porque la documentación a veces no mastica los pasos para novatos. Sin embargo, una vez que entiendes que todo se resume en crear un archivo de configuración llamado Modelfile, el camino se vuelve pan comido y puedes tener tu IA personalizada funcionando en cuestión de minutos.
Descarga y preparación del modelo

Lo primero que tienes que hacer es ir a Hugging Face y buscar el modelo que te interese. Verás que hay un montón de versiones cuantizadas, como la Q4_K_M, Q5_K_M o la Q8_0. No te agobies con los nombres; básicamente, cuanto menor sea el número, menos memoria RAM o VRAM consumirá el modelo, aunque perderá un pelín de precisión. Elige la que mejor se adapte a tu hardware y descarga el archivo .gguf.
Una vez tengas el archivo en tu ordenador, te recomiendo colocarlo en una carpeta fija y evitar que el nombre del archivo tenga espacios o caracteres extraños. Si el nombre es un trabalenguas, cámbialo por algo sencillo para que no te dé errores al escribir las rutas en la terminal.
Si eres usuario de Windows, puedes dejar el archivo en tu carpeta de Descargas, pero asegúrate de conocer la ruta exacta (por ejemplo, C:\Users\TuNombre\Downloads\modelo.gguf), ya que será la pieza clave para que Ollama encuentre el modelo.
Creación del Modelfile y registro en Ollama
Aquí es donde ocurre la magia. Necesitas crear un archivo de texto plano. Puedes abrir el Bloc de Notas y escribir una única línea: from «C:\ruta\al\archivo\modelo.gguf». Es vital que la ruta sea la correcta y esté entre comillas si hay espacios. Una vez escrito, guarda el archivo con el nombre Modelfile (sin el .txt al final), aunque si te cuesta quitar la extensión, guárdalo como Modelfile.txt y luego renómbralo manualmente en la carpeta.
Ahora toca pasar a la acción con la consola. Abre el CMD o tu terminal favorita y ejecuta el comando ollama create nombre-de-tu-modelo -f Modelfile. En este punto, Ollama leerá las instrucciones, procesará el archivo GGUF y creará una nueva capa en su sistema local. Solo queda esperar a que el proceso termine y veas el mensaje de éxito.
Si tienes curiosidad por saber cómo están configurados los modelos oficiales, puedes usar el comando ollama show –modelfile llama3.2. Esto te permitirá ver cómo se organizan el system prompt y las plantillas, lo cual es súper útil si quieres personalizar el comportamiento de tu IA más allá de la simple importación del archivo.
Métodos avanzados y automatizaciones
Para los que buscan ir más rápido, existe la posibilidad de ejecutar modelos directamente desde Hugging Face sin crearle un Modelfile manual. Si el modelo es público, puedes usar la sintaxis ollama run hf.co/usuario/repositorio. Por defecto, Ollama intentará usar la cuantización Q4_K_M, pero si quieres una distinta, puedes seleccionarla desde el visor de GGUF en la web de Hugging Face y copiar el fragmento de código generado.
En el caso de que trabajes con modelos privados, el proceso requiere un paso extra de seguridad. Deberás copiar tu llave SSH de Ollama (que suele estar en ~/.ollama/id_ed25519.pub) y añadirla a la configuración de tu cuenta de Hugging Face. Una vez hecho esto, podrás llamar a tus repositorios privados directamente desde la terminal sin complicaciones.
Otro problema común ocurre cuando el modelo es tan grande que está dividido en varios archivos GGUF. Antiguamente esto era un dolor de cabeza, pero ahora el comando create soporta la importación de múltiples archivos. Solo tienes que listar todos los archivos .gguf en el Modelfile o pasarlos en el comando de creación para que Ollama los una correctamente.
Ajustes de rendimiento y personalización
No basta con que el modelo cargue; queremos que responda bien. Si notas que la IA se comporta de forma extraña, es probable que necesites ajustar la plantilla de chat (chat template). Ollama intenta detectarla automáticamente desde los metadatos del archivo GGUF, pero si falla, puedes crear un archivo llamado «template» en tu repositorio o definirlo en el Modelfile usando el formato de plantillas de Go.
También puedes optimizar la experiencia creando un archivo llamado «params» en formato JSON para ajustar los parámetros de muestreo, como la temperatura o el top_p. Esto es fundamental si buscas que la IA sea más creativa o, por el contrario, mucho más determinista y rigurosa en sus respuestas.
Integrar archivos GGUF externos permite saltarse las limitaciones de la biblioteca oficial, permitiéndonos elegir la cuantización exacta para nuestra VRAM y personalizar el prompt del sistema. Ya sea mediante la creación manual de un Modelfile, la ejecución directa desde hf.co o la gestión de modelos fragmentados y privados, Ollama se ha convertido en una herramienta flexible para desplegar cualquier LLM localmente con un esfuerzo mínimo.
Soy un apasionado de la tecnología que ha convertido sus intereses «frikis» en profesión. Llevo más de 10 años de mi vida utilizando tecnología de vanguardia y trasteando todo tipo de programas por pura curiosidad. Ahora me he especializado en tecnología de ordenador y videojuegos. Esto es por que desde hace más de 5 años que trabajo redactando para varias webs en materia de tecnología y videojuegos, creando artículos que buscan darte la información que necesitas con un lenguaje entendible por todos.
Si tienes cualquier pregunta, mis conocimientos van desde todo lo relacionado con el sistema operativo Windows así como Android para móviles. Y es que mi compromiso es contigo, siempre estoy dispuesto a dedicarte unos minutos y ayudarte a resolver cualquier duda que tengas en este mundo de internet.

