- El formato GGUF permite empaquetar pesos y metadatos en un único archivo optimizado para inferencia local.
- El uso de Modelfiles posibilita la importación de modelos personalizados desde Hugging Face hacia el ecosistema de Ollama.
- La cuantización es la herramienta clave para ajustar el rendimiento del modelo según la memoria VRAM disponible.
- La integración con llama.cpp acelera la disponibilidad de nuevas arquitecturas de IA en entornos locales.
¿Cómo cargar y ejecutar un modelo GGUF usando un Modelfile? Seguramente te ha pasado que buscas un modelo de IA concreto en la biblioteca de Ollama y, sencillamente, no está. O quizá quieres probar una versión específica de un modelo que has visto en Hugging Face y no sabes por dónde empezar. No te preocupes, porque aunque la documentación oficial a veces parece escrita para ingenieros de la NASA, montar tu propio modelo GGUF es mucho más sencillo de lo que parece una vez que conoces los pasos correctos.
En este artículo vamos a desgranar todo el proceso, desde que descargas el archivo hasta que consigues que el modelo te responda en la terminal. Vamos a ver cómo aprovechar el formato GGUF, que básicamente es como un contenedor todo en uno que incluye los pesos del modelo y el tokenizador, permitiendo que la IA funcione en tu ordenador sin que explote la memoria RAM.
Conceptos básicos: ¿Qué narices es GGUF y llama.cpp?
Antes de meternos en el barro, conviene entender que Ollama no hace toda la magia solo; utiliza un motor llamado llama.cpp. Este proyecto es el corazón de la inferencia local y es el que define el formato GGUF. Básicamente, GGUF permite que el modelo sea eficiente en CPU y GPU, evitando que necesites un servidor industrial para ejecutar una IA decente.
Si te fijas en Hugging Face, verás que los modelos GGUF vienen con etiquetas como Q4_K_M o Q8_0. Esto es la cuantización. En lenguaje sencillo, es como comprimir un archivo: una cuantización Q4 reduce el tamaño y el consumo de VRAM, pero mantiene una calidad sorprendente. Si tienes una tarjeta gráfica potente, puedes ir a por Q8 o FP16; si vas justo de recursos, el Q4_K_M es el equilibrio perfecto.
El camino rápido: Importar un archivo GGUF ya existente

Si ya tienes el archivo .gguf en tu disco duro, no hace falta que te compliques la vida. El proceso es prácticamente un «copia y pega» inteligente. Lo primero es crear un archivo de texto simple que llamaremos Modelfile (sin extensión .txt al final, aunque puedes empezar creándolo así y luego renombrarlo).
Dentro de ese archivo, solo necesitas escribir una línea fundamental: FROM seguida de la ruta completa de tu archivo. Por ejemplo: FROM C:\Usuarios\TuNombre\Downloads\modelo_genial.gguf. Una vez guardado, abres tu terminal o CMD y ejecutas el comando ollama create nombre-de-tu-modelo -f Modelfile. Es vital respetar el orden de los argumentos para que el sistema no te lance un error.
Cuando termine de procesar, ya tienes el modelo integrado. Para ponerlo a prueba, solo escribe ollama run nombre-de-tu-modelo y ya puedes empezar a chatear con tu IA local. Si notas que el modelo se vuelve loco o genera texto infinito, puedes ajustar los stop tokens o la temperatura en el Modelfile para que sea más coherente.
Nivel avanzado: Convertir y cuantizar tus propios modelos
A veces, el modelo que quieres no está en GGUF, sino en formatos de PyTorch o Safetensors. En ese caso, tienes que hacer el trabajo sucio tú mismo usando llama.cpp. Primero, clona el repositorio de llama.cpp y compílalo usando CMake y un compilador como MinGW en Windows. Una vez tengas los binarios, puedes usar el script convert_hf_to_gguf.py para transformar el modelo de Hugging Face a un formato que Ollama entienda.
Tras la conversión, obtendrás un archivo FP16, que suele ser enorme. Aquí es donde entra la herramienta quantize.exe. Ejecutando este comando, puedes convertir ese archivo gigante en una versión cuantizada Q4_K_M, reduciendo drásticamente el espacio en disco y la carga de la GPU. Finalmente, creas el Modelfile apuntando a este nuevo archivo cuantizado y lo importas en Ollama como hicimos anteriormente.
Personalización profunda del Modelfile
El Modelfile no sirve solo para decirle a Ollama dónde está el archivo. Es una herramienta poderosa para moldear la personalidad de la IA. Puedes añadir parámetros técnicos como PARAMETER temperature 0.7 para controlar la creatividad, o PARAMETER num_ctx 4096 para definir cuánta memoria de contexto tiene el modelo para recordar la conversación.
Una de las funciones más divertidas es el SYSTEM prompt. Mediante la directiva SYSTEM, puedes decirle al modelo que actúe como un experto en leyes, un programador cínico o incluso como un personaje de videojuegos. Por ejemplo, si escribes SYSTEM You are a helpful assistant, el modelo se comportará de forma estándar, pero si cambias la descripción, cambiarás totalmente su comportamiento y tono de respuesta.
Optimización de hardware y rendimiento

Con las versiones más recientes de Ollama, la integración con Vulkan y NVIDIA ha mejorado muchísimo. En Windows, Vulkan suele venir activado por defecto, lo que permite que GPUs de AMD o Intel ayuden en la inferencia. Si tienes una NVIDIA, podrías notar una mejora de rendimiento de hasta el 20% gracias a las optimizaciones de CUDA.
Un truco para saber si todo va bien es ejecutar el comando ollama ps mientras el modelo está funcionando. Si en la columna de procesador ves 100% GPU, felicidades, estás exprimiendo tu hardware. Si ves que dice CPU o que hay un swap constante, es probable que el modelo sea demasiado grande para tu VRAM y necesites probar una cuantización más agresiva (como Q2 o Q3).
Llevar la IA a tu propia máquina mediante archivos GGUF te otorga un control total sobre la privacidad y los costes, permitiéndote desde personalizar prompts complejos hasta ejecutar modelos especializados de la comunidad sin depender de la nube. Solo necesitas descargar el archivo correcto, configurar un Modelfile sencillo y ejecutar los comandos de creación para tener un asistente potente y privado funcionando en cuestión de minutos.
Apasionado de la tecnología desde pequeñito. Me encanta estar a la última en el sector y sobre todo, comunicarlo. Por eso me dedico a la comunicación en webs de tecnología y videojuegos desde hace ya muchos años. Podrás encontrarme escribiendo sobre Android, Windows, MacOS, iOS, Nintendo o cualquier otro tema relacionado que se te pase por la cabeza.


