Guía Completa para Ejecutar Modelos GGUF en Ollama mediante Modelfile

Última actualización: 25/07/2026

  • El formato GGUF permite empaquetar pesos y metadatos en un único archivo optimizado para inferencia local.
  • El uso de Modelfiles posibilita la importación de modelos personalizados desde Hugging Face hacia el ecosistema de Ollama.
  • La cuantización es la herramienta clave para ajustar el rendimiento del modelo según la memoria VRAM disponible.
  • La integración con llama.cpp acelera la disponibilidad de nuevas arquitecturas de IA en entornos locales.

Cómo cargar y ejecutar un modelo GGUF usando un Modelfile

¿Cómo cargar y ejecutar un modelo GGUF usando un Modelfile? Seguramente te ha pasado que buscas un modelo de IA concreto en la biblioteca de Ollama y, sencillamente, no está. O quizá quieres probar una versión específica de un modelo que has visto en Hugging Face y no sabes por dónde empezar. No te preocupes, porque aunque la documentación oficial a veces parece escrita para ingenieros de la NASA, montar tu propio modelo GGUF es mucho más sencillo de lo que parece una vez que conoces los pasos correctos.

En este artículo vamos a desgranar todo el proceso, desde que descargas el archivo hasta que consigues que el modelo te responda en la terminal. Vamos a ver cómo aprovechar el formato GGUF, que básicamente es como un contenedor todo en uno que incluye los pesos del modelo y el tokenizador, permitiendo que la IA funcione en tu ordenador sin que explote la memoria RAM.

Conceptos básicos: ¿Qué narices es GGUF y llama.cpp?

Antes de meternos en el barro, conviene entender que Ollama no hace toda la magia solo; utiliza un motor llamado llama.cpp. Este proyecto es el corazón de la inferencia local y es el que define el formato GGUF. Básicamente, GGUF permite que el modelo sea eficiente en CPU y GPU, evitando que necesites un servidor industrial para ejecutar una IA decente.

Cómo usar varios modelos diferentes en Ollama sin conflictos
Related article:
Guía Completa para Gestionar Varios Modelos en Ollama sin Conflictos

Si te fijas en Hugging Face, verás que los modelos GGUF vienen con etiquetas como Q4_K_M o Q8_0. Esto es la cuantización. En lenguaje sencillo, es como comprimir un archivo: una cuantización Q4 reduce el tamaño y el consumo de VRAM, pero mantiene una calidad sorprendente. Si tienes una tarjeta gráfica potente, puedes ir a por Q8 o FP16; si vas justo de recursos, el Q4_K_M es el equilibrio perfecto.

Contenido exclusivo - Clic Aquí  ¿Cómo puedo cambiar mi página de inicio en Google Chrome?

El camino rápido: Importar un archivo GGUF ya existente

niveles Cuantización GGUF

Si ya tienes el archivo .gguf en tu disco duro, no hace falta que te compliques la vida. El proceso es prácticamente un «copia y pega» inteligente. Lo primero es crear un archivo de texto simple que llamaremos Modelfile (sin extensión .txt al final, aunque puedes empezar creándolo así y luego renombrarlo).

Dentro de ese archivo, solo necesitas escribir una línea fundamental: FROM seguida de la ruta completa de tu archivo. Por ejemplo: FROM C:\Usuarios\TuNombre\Downloads\modelo_genial.gguf. Una vez guardado, abres tu terminal o CMD y ejecutas el comando ollama create nombre-de-tu-modelo -f Modelfile. Es vital respetar el orden de los argumentos para que el sistema no te lance un error.

Cómo conectar Open WebUI con Ollama para utilizar modelos locales sin Internet
Related article:
Cómo conectar Open WebUI con Ollama para utilizar modelos locales sin Internet

Cuando termine de procesar, ya tienes el modelo integrado. Para ponerlo a prueba, solo escribe ollama run nombre-de-tu-modelo y ya puedes empezar a chatear con tu IA local. Si notas que el modelo se vuelve loco o genera texto infinito, puedes ajustar los stop tokens o la temperatura en el Modelfile para que sea más coherente.

Contenido exclusivo - Clic Aquí  ¿Quién inventó el lenguaje de programación Julia?

Nivel avanzado: Convertir y cuantizar tus propios modelos

formato GGUF

A veces, el modelo que quieres no está en GGUF, sino en formatos de PyTorch o Safetensors. En ese caso, tienes que hacer el trabajo sucio tú mismo usando llama.cpp. Primero, clona el repositorio de llama.cpp y compílalo usando CMake y un compilador como MinGW en Windows. Una vez tengas los binarios, puedes usar el script convert_hf_to_gguf.py para transformar el modelo de Hugging Face a un formato que Ollama entienda.

Tras la conversión, obtendrás un archivo FP16, que suele ser enorme. Aquí es donde entra la herramienta quantize.exe. Ejecutando este comando, puedes convertir ese archivo gigante en una versión cuantizada Q4_K_M, reduciendo drásticamente el espacio en disco y la carga de la GPU. Finalmente, creas el Modelfile apuntando a este nuevo archivo cuantizado y lo importas en Ollama como hicimos anteriormente.

Personalización profunda del Modelfile

El Modelfile no sirve solo para decirle a Ollama dónde está el archivo. Es una herramienta poderosa para moldear la personalidad de la IA. Puedes añadir parámetros técnicos como PARAMETER temperature 0.7 para controlar la creatividad, o PARAMETER num_ctx 4096 para definir cuánta memoria de contexto tiene el modelo para recordar la conversación.

Cómo añadir varios modelos de IA a Open WebUI y cambiar entre ellos
Related article:
Guía Completa para Añadir y Gestionar Múltiples Modelos de IA en Open WebUI

Una de las funciones más divertidas es el SYSTEM prompt. Mediante la directiva SYSTEM, puedes decirle al modelo que actúe como un experto en leyes, un programador cínico o incluso como un personaje de videojuegos. Por ejemplo, si escribes SYSTEM You are a helpful assistant, el modelo se comportará de forma estándar, pero si cambias la descripción, cambiarás totalmente su comportamiento y tono de respuesta.

Contenido exclusivo - Clic Aquí  ¿Cómo formatear un Toshiba Portege?

Optimización de hardware y rendimiento

formato GGUF

Con las versiones más recientes de Ollama, la integración con Vulkan y NVIDIA ha mejorado muchísimo. En Windows, Vulkan suele venir activado por defecto, lo que permite que GPUs de AMD o Intel ayuden en la inferencia. Si tienes una NVIDIA, podrías notar una mejora de rendimiento de hasta el 20% gracias a las optimizaciones de CUDA.

Un truco para saber si todo va bien es ejecutar el comando ollama ps mientras el modelo está funcionando. Si en la columna de procesador ves 100% GPU, felicidades, estás exprimiendo tu hardware. Si ves que dice CPU o que hay un swap constante, es probable que el modelo sea demasiado grande para tu VRAM y necesites probar una cuantización más agresiva (como Q2 o Q3).

Llevar la IA a tu propia máquina mediante archivos GGUF te otorga un control total sobre la privacidad y los costes, permitiéndote desde personalizar prompts complejos hasta ejecutar modelos especializados de la comunidad sin depender de la nube. Solo necesitas descargar el archivo correcto, configurar un Modelfile sencillo y ejecutar los comandos de creación para tener un asistente potente y privado funcionando en cuestión de minutos.

Cómo instalar Open WebUI con Docker y acceder desde cualquier dispositivo
Related article:
Cómo instalar Open WebUI con Docker y acceder desde cualquier dispositivo