Guía Completa sobre el Formato GGUF para Modelos de IA

Última actualización: 31/07/2026

  • El formato GGUF es la evolución de GGML, optimizado para cargar modelos de lenguaje de forma rápida y eficiente en hardware doméstico.
  • Permite la cuantización de pesos, reduciendo el consumo de memoria VRAM y CPU sin perder demasiada precisión en las respuestas.
  • Es compatible con diversas arquitecturas y herramientas populares como llama.cpp, Ollama y LM Studio.
Qué es GGUF

Si te has sumergido en el mundo de la inteligencia artificial local, seguramente te habrás encontrado con archivos que terminan en .gguf. Este formato permite distribuir y ejecutar modelos de lenguaje en ordenadores domésticos utilizando herramientas como llama.cpp, Ollama, LM Studio o Jan.

Su popularidad se debe a que reúne en uno o varios archivos los pesos del modelo, su arquitectura y diferentes metadatos necesarios para cargarlo. Además, admite modelos cuantizados que ocupan menos espacio y necesitan menos memoria que sus versiones originales en FP16 o FP32.

Gracias a ello, un modelo que originalmente requeriría una GPU profesional puede llegar a funcionar en un portátil o un ordenador convencional. Esto no significa que cualquier modelo sea compatible con cualquier equipo: hay que elegir correctamente su tamaño, cuantización y longitud de contexto.

También influye la velocidad de la unidad donde está almacenado. Aunque GGUF está diseñado para favorecer una carga eficiente mediante técnicas como el mapeo de memoria, un disco lento todavía puede afectar al inicio. Si tarda demasiado, conviene comprobar si el SSD está actuando como cuello de botella al cargar modelos de IA.

Cómo importar modelos GGUF en Ollama
Related article:
Cómo importar modelos GGUF en Ollama: Guía Completa

Qué es el formato GGUF y para qué sirve

Qué es el formato GGUF y para qué sirve

GGUF es un formato binario desarrollado para almacenar modelos destinados a la inferencia con GGML y motores basados en este proyecto. Su nombre procede de GGML Universal File y fue creado como sucesor de formatos anteriores como GGML, GGMF y GGJT.

Su principal objetivo es proporcionar un formato extensible, fácil de distribuir y rápido de cargar. Un archivo GGUF puede contener los tensores del modelo junto con información sobre su arquitectura, vocabulario, tokenizador, contexto y otros parámetros necesarios para interpretarlo correctamente.

Entre sus características principales se encuentran:

  • Almacenamiento de los pesos y metadatos del modelo.
  • Compatibilidad con diferentes niveles y métodos de cuantización.
  • Carga eficiente mediante mapeo de memoria o mmap.
  • Posibilidad de ampliar los metadatos sin rediseñar todo el formato.
  • Distribución sencilla de modelos preparados para la inferencia.
  • Compatibilidad con numerosas arquitecturas admitidas por llama.cpp.

GGUF no es un programa que ejecute directamente la inteligencia artificial. Es el contenedor donde se almacena el modelo. Para utilizarlo necesitas un motor compatible, como llama.cpp, o una aplicación construida sobre este ecosistema.

La evolución desde GGML hasta GGUF

Para entender la aparición de GGUF hay que remontarse a GGML, la biblioteca creada por Georgi Gerganov para realizar cálculos de aprendizaje automático de forma eficiente, especialmente en CPU y en dispositivos con recursos limitados.

Los primeros formatos asociados al proyecto fueron evolucionando a medida que aparecían nuevas arquitecturas, cuantizaciones y parámetros. El problema era que algunos cambios podían generar incompatibilidades y obligar a las aplicaciones a interpretar estructuras distintas.

GGUF introdujo una estructura más clara basada en parejas de clave y valor para los metadatos. Esto permite añadir información nueva sin alterar necesariamente el funcionamiento de las aplicaciones que no necesitan utilizarla. El resultado es un contenedor más flexible y preparado para evolucionar.

Otra ventaja es que la información necesaria para reconocer y cargar el modelo puede viajar junto a sus pesos. De esta forma se reducen los problemas provocados por configuraciones externas ausentes, vocabularios incorrectos o parámetros que no coinciden con el modelo descargado.

Contenido exclusivo - Clic Aquí  Como Utilizar Rufus

Aun así, la compatibilidad no está garantizada para siempre. Si aparece una arquitectura nueva, el motor utilizado debe incorporar soporte para ella. Por eso un archivo GGUF reciente puede no funcionar en una versión antigua de llama.cpp, Ollama o LM Studio.

Cómo cargar y ejecutar un modelo GGUF usando un Modelfile
Related article:
Guía Completa para Ejecutar Modelos GGUF en Ollama mediante Modelfile

Cómo funciona la cuantización de un modelo GGUF

Cómo funciona la cuantización de un modelo GGUF

La cuantización consiste en representar los pesos del modelo utilizando menos bits. Un modelo original puede almacenar buena parte de sus parámetros en FP16 o BF16, mientras que una versión cuantizada utiliza representaciones de 8, 6, 5, 4, 3 o incluso 2 bits para muchos de sus tensores.

Reducir la precisión disminuye tanto el tamaño del archivo como la memoria necesaria durante la inferencia. También puede mejorar la velocidad cuando el hardware procesa eficientemente ese tipo de cuantización. A cambio, se pierde una parte de la fidelidad del modelo.

GGUF no cambia automáticamente la cuantización según el ordenador. Normalmente encontrarás diferentes archivos del mismo modelo y tendrás que descargar el que mejor se adapte a tu memoria RAM o VRAM.

Estas son algunas de las opciones más habituales:

  • Q4_K_M: suele ofrecer un buen equilibrio entre tamaño, consumo de memoria y calidad. Es una elección razonable para empezar.
  • Q5_K_M: conserva algo más de fidelidad que Q4_K_M, pero genera archivos mayores y aumenta el uso de memoria.
  • Q6_K: proporciona una calidad elevada cuando el equipo dispone de suficiente memoria y no necesita reducir tanto el modelo.
  • Q8_0: mantiene una calidad muy próxima a las versiones de mayor precisión, aunque su ahorro de memoria es menor.
  • IQ4_XS: busca reducir el tamaño por debajo de otras alternativas de cuatro bits manteniendo una calidad razonable.
  • IQ3 e IQ2: reducen considerablemente el consumo, pero la pérdida de calidad puede resultar más evidente.

No existe una cuantización universalmente mejor. El resultado depende de la arquitectura, el tamaño del modelo, la tarea y el hardware. Un modelo grande cuantizado a tres bits puede superar a otro mucho más pequeño en Q8_0, aunque también puede generar respuestas menos estables que una cuantización de cuatro o cinco bits del mismo modelo.

Por eso no siempre es correcto descartar las versiones de dos o tres bits. Pueden ser útiles cuando la alternativa es no poder cargar el modelo. Sin embargo, para trabajos donde importa especialmente la precisión, suele ser preferible mantenerse alrededor de Q4_K_M, Q5_K_M o niveles superiores.

Cuánta memoria necesita un modelo GGUF

El tamaño del archivo ofrece una primera referencia, pero no representa toda la memoria necesaria. Durante la inferencia también hay que reservar espacio para la caché KV, el contexto, los búferes de cálculo y otros componentes del motor.

Por ejemplo, un archivo GGUF de 8 GB no garantiza que funcione correctamente en una GPU con exactamente 8 GB de VRAM. El programa necesitará memoria adicional y, si no dispone de ella, tendrá que repartir parte del modelo entre la GPU y la RAM o ejecutarlo mediante la CPU.

Para calcular si un modelo funcionará en tu equipo debes tener en cuenta:

  • El tamaño del archivo GGUF.
  • La memoria RAM y VRAM disponibles.
  • La longitud de contexto configurada.
  • El tamaño y la cuantización de la caché KV.
  • Las capas que se procesarán mediante la GPU.
  • Las aplicaciones que permanecen abiertas simultáneamente.
Contenido exclusivo - Clic Aquí  Como Combinar Celdas en Excel

Como norma práctica, conviene dejar cierto margen por encima del tamaño del archivo. Si el modelo no cabe completamente en la GPU, llama.cpp y otras herramientas permiten descargar solo una parte de sus capas en la tarjeta gráfica y procesar las restantes mediante la CPU.

Cómo usar varios modelos diferentes en Ollama sin conflictos
Related article:
Guía Completa para Gestionar Varios Modelos en Ollama sin Conflictos

GGUF frente a GPTQ, AWQ y otros formatos

GGUF no es la única manera de distribuir modelos cuantizados. También existen métodos y formatos como GPTQ, AWQ, EXL2 o bitsandbytes, cada uno con motores, aceleradores y casos de uso diferentes.

Una de las principales fortalezas de GGUF es su capacidad para trabajar en CPU, GPU o configuraciones híbridas. Esto lo hace especialmente útil en ordenadores domésticos, equipos con poca VRAM, dispositivos ARM y sistemas que utilizan memoria unificada.

GPTQ, AWQ y EXL2 suelen estar más orientados a la ejecución mediante determinadas GPU y motores especializados. En algunos equipos pueden ofrecer un rendimiento excelente, pero no siempre cuentan con la misma flexibilidad para repartir el modelo entre procesador, memoria principal y tarjeta gráfica.

La elección depende de la aplicación que vayas a utilizar. Si trabajas con llama.cpp, Ollama o LM Studio, GGUF suele ser la alternativa más práctica. Si dispones de una GPU NVIDIA potente y utilizas un motor especializado, otro método puede proporcionar mejores resultados en determinadas configuraciones.

Herramientas recomendadas para utilizar archivos GGUF

Herramientas recomendadas para utilizar archivos GGUF

No necesitas manejar directamente todos los parámetros de llama.cpp para empezar. Existen aplicaciones que simplifican la descarga, carga y configuración de los modelos.

LM Studio

LM Studio proporciona una interfaz gráfica para buscar modelos disponibles en Hugging Face, descargar diferentes cuantizaciones y conversar con ellos localmente. También puede iniciar un servidor con endpoints compatibles con la API de OpenAI.

La aplicación permite seleccionar cuánto contexto utilizar, cuántas capas enviar a la GPU y otros parámetros del motor. Si experimentas tiempos de respuesta demasiado altos, puedes aplicar diferentes ajustes para mejorar el rendimiento cuando LM Studio funciona lento.

Ollama

Ollama está pensado para descargar, organizar y ejecutar modelos mediante comandos sencillos. Utiliza componentes del ecosistema llama.cpp y permite trabajar tanto con su biblioteca como con archivos GGUF procedentes de otras fuentes.

Los Modelfiles permiten configurar el modelo base, el mensaje del sistema, la plantilla y parámetros como la temperatura o el contexto. Si quieres utilizar un archivo propio, puedes seguir nuestra guía para cargar un modelo GGUF mediante un Modelfile.

llama.cpp

llama.cpp es el motor de referencia para trabajar con GGUF. Ofrece herramientas de terminal, un servidor HTTP compatible con diferentes endpoints de la API de OpenAI y numerosas opciones para optimizar el uso de CPU, GPU y memoria.

Puede utilizar aceleración mediante tecnologías como CUDA, Metal, Vulkan, SYCL e HIP, dependiendo del sistema y de la compilación instalada. También permite ejecutar el modelo repartiendo sus capas entre distintos dispositivos.

Jan y GPT4All

Aplicaciones como Jan y GPT4All también permiten descargar o importar modelos compatibles y utilizarlos mediante una interfaz gráfica. Son alternativas interesantes para quien busca una experiencia sencilla sin renunciar a la ejecución local.

Cómo cambiar la carpeta donde Ollama guarda los modelos
Related article:
Cómo cambiar la ruta de almacenamiento de modelos en Ollama

Metadatos, tokenizadores y modelos divididos

Un archivo GGUF no contiene únicamente los pesos cuantizados. También puede guardar información sobre la arquitectura, el número de capas, el tamaño del contexto, el vocabulario, los tokens especiales y la plantilla de conversación.

Contenido exclusivo - Clic Aquí  Como Hacer Que Un Archivo No Se Pueda Abrir

Estos metadatos permiten que el motor identifique cómo debe interpretar el modelo. No obstante, una plantilla incorrecta o una versión antigua del programa todavía puede provocar respuestas extrañas, repeticiones o errores al cargar el archivo.

Aunque GGUF está diseñado para facilitar la distribución en un solo archivo, los modelos de gran tamaño también pueden publicarse en varias partes. En ese caso aparecen nombres que indican el número de fragmento, por ejemplo:

modelo-Q4_K_M-00001-of-00003.gguf
modelo-Q4_K_M-00002-of-00003.gguf
modelo-Q4_K_M-00003-of-00003.gguf

Es necesario descargar todos los fragmentos, conservar sus nombres y guardarlos en la misma carpeta. De lo contrario, el motor no podrá reconstruir correctamente el modelo.

GGUF, LoRA y modelos ajustados

Los modelos ajustados mediante técnicas como LoRA pueden convertirse o distribuirse para utilizarlos en el ecosistema GGUF. llama.cpp permite aplicar determinados adaptadores LoRA durante la inferencia y también existen herramientas para fusionarlos con un modelo base antes de cuantizarlo.

Sin embargo, conviene diferenciar varios conceptos. LoRA y QLoRA son métodos relacionados con el entrenamiento o ajuste del modelo, mientras que GGUF es un formato orientado principalmente a su almacenamiento y ejecución.

QLoRA permite ajustar modelos utilizando una representación cuantizada para reducir el consumo de memoria durante el entrenamiento. Una vez terminado ese proceso, el resultado puede fusionarse, convertirse y cuantizarse para crear un archivo GGUF compatible, siempre que la arquitectura esté soportada.

Del mismo modo, la conexión con frameworks como LangChain no procede directamente de GGUF. La integración se realiza a través de motores y servidores como llama.cpp, Ollama o LM Studio, que exponen el modelo mediante una API o una librería compatible.

Cómo elegir el archivo GGUF adecuado

En repositorios como Hugging Face es habitual encontrar muchas versiones del mismo modelo. Para elegir correctamente, comprueba primero que la arquitectura sea compatible con la versión de la aplicación que vas a utilizar.

Después, revisa estos elementos:

  • Número de parámetros: un modelo de 14B necesita bastante más memoria que uno de 7B u 8B.
  • Cuantización: Q4_K_M suele ser un buen punto de partida para la mayoría de los equipos.
  • Tamaño del archivo: debe caber en la RAM o en la combinación de RAM y VRAM disponible.
  • Tipo de modelo: comprueba si es una versión base, instruct, chat, visión o especializada.
  • Contexto admitido: no configures automáticamente el máximo si tienes poca memoria.
  • Plantilla de conversación: utiliza la recomendada para evitar respuestas mal formadas.
  • Fragmentos: verifica si el modelo está dividido en varios archivos.

Si dudas entre varias versiones, comienza con Q4_K_M. Si el modelo funciona con margen de memoria, puedes probar Q5_K_M o Q6_K para conservar algo más de calidad. Si no carga, utiliza una cuantización más pequeña, reduce el contexto o descarga menos capas en la GPU.

GGUF ha contribuido a que la inteligencia artificial local sea mucho más accesible. Su combinación de metadatos, cuantización, carga eficiente y compatibilidad con diferentes tipos de hardware permite ejecutar modelos que hace unos años habrían requerido una infraestructura considerable.

El formato no elimina las limitaciones del ordenador ni garantiza que cualquier modelo funcione correctamente. Sin embargo, elegir una arquitectura y una cuantización adecuadas permite experimentar con asistentes, herramientas de programación y modelos especializados sin depender continuamente de servicios externos.

Cómo eliminar modelos descargados sin romper LM Studio
Related article:
Cómo cambiar la carpeta de modelos en LM Studio y optimizar su uso