- Jan AI permite ejecutar modelos de lenguaje GGUF de forma local garantizando la privacidad total de los datos.
- El software ofrece múltiples vías de importación, desde su Hub integrado hasta la carga de archivos locales o enlaces de Hugging Face.
- La herramienta detecta automáticamente los metadatos del modelo, facilitando la configuración de la arquitectura y la plantilla de chat.
Si te interesa la inteligencia artificial, pero no quieres enviar tus conversaciones y documentos privados a servidores externos, Jan AI ofrece una alternativa muy interesante. Se trata de un asistente de escritorio gratuito y de código abierto que permite ejecutar modelos de lenguaje directamente en el ordenador.
Una de sus mayores ventajas es la compatibilidad con modelos en formato GGUF mediante llama.cpp. Esto permite descargar modelos cuantizados, aprovechar la CPU y la tarjeta gráfica del equipo y utilizarlos incluso sin conexión a Internet.
En la práctica, puedes convertir Jan en una especie de ChatGPT privado y personalizable. Eso sí, la privacidad depende de la configuración elegida: los modelos locales procesan los datos en el dispositivo, mientras que las conexiones con OpenAI, Anthropic u otros proveedores externos envían las solicitudes a sus servidores.
Qué necesitas antes de importar un modelo GGUF

Antes de descargar el primer modelo que encuentres, conviene comprobar que el archivo sea compatible con llama.cpp y que su tamaño encaje en la memoria disponible. Los repositorios de Hugging Face suelen incluir varias cuantizaciones del mismo modelo, como Q4_K_M, Q5_K_M o Q8_0.
La cuantización reduce el tamaño de los pesos y permite ejecutar modelos grandes en equipos más modestos. Como norma general, Q4_K_M ofrece un buen equilibrio entre calidad, consumo de memoria y velocidad, mientras que Q5_K_M y Q8_0 conservan algo más de precisión a cambio de ocupar más espacio y necesitar más RAM o VRAM.
También debes comprobar la arquitectura del modelo. Aunque llama.cpp admite una gran cantidad de familias, los modelos recién publicados pueden necesitar una versión más moderna del motor. Si el archivo no carga, no siempre significa que esté dañado: el backend instalado en Jan podría no reconocer todavía su arquitectura.
Descargar modelos desde el Hub de Jan
La forma más sencilla de añadir un modelo es utilizar el Hub integrado de Jan. Desde esta sección puedes buscar modelos, consultar las variantes disponibles y descargar la cuantización más adecuada para tu ordenador.
Una vez iniciada la descarga, Jan muestra el modelo y el porcentaje completado en el indicador situado en la parte superior. El proceso se puede cancelar y, si se produce un error, basta con volver a pulsar el botón de descarga para intentarlo de nuevo.
Este método resulta especialmente recomendable para principiantes porque Jan se encarga de guardar el archivo y preparar la configuración necesaria. Cuando termine la descarga, el modelo aparecerá en el selector del chat y podrás cargarlo para empezar a utilizarlo.
Importar un modelo de Hugging Face mediante su ID

El Hub también permite localizar modelos disponibles en Hugging Face mediante el identificador de su repositorio. Para hacerlo, copia un ID con el formato organizacion/nombre-del-modelo y pégalo en la barra de búsqueda del Hub de Jan.
Por ejemplo, podrías buscar un repositorio como bartowski/Qwen2.5-7B-Instruct-GGUF. Si Jan reconoce el repositorio, mostrará las cuantizaciones disponibles para que puedas seleccionar y descargar una de ellas.
Antes de continuar, asegúrate de que el repositorio contiene archivos GGUF compatibles con llama.cpp. Un repositorio que solo incluya pesos en formatos como Safetensors no podrá cargarse de esta manera como modelo local.
Algunos modelos de Hugging Face están restringidos y exigen aceptar previamente sus condiciones de uso. En esos casos tendrás que iniciar sesión en Hugging Face, obtener un token de acceso e introducirlo en Settings > General > Others > HuggingFace Token. La ubicación exacta puede variar ligeramente según la versión de Jan.
También puedes abrir la página de un modelo compatible en Hugging Face, pulsar Use this model y seleccionar Jan dentro del apartado de aplicaciones locales. El navegador intentará abrir Jan para iniciar la importación.
Cómo importar un archivo GGUF guardado en el ordenador
Si ya has descargado el archivo con el navegador o lo has obtenido mediante otra herramienta, no necesitas volver a bajarlo desde el Hub. En Jan, entra en Settings > Model Providers, abre la configuración de llama.cpp y pulsa la opción Import.
Después, selecciona el archivo GGUF almacenado en el ordenador. Jan analizará sus metadatos para identificar datos como la arquitectura, el tokenizador y, cuando esté disponible, la plantilla de conversación.
Jan puede enlazar el modelo desde su ubicación actual en lugar de crear necesariamente otra copia completa. Esto ahorra espacio, pero implica que no debes mover, renombrar ni borrar el archivo original después de importarlo. Si lo haces, Jan puede perder la referencia y dejar de cargar el modelo.
Una vez incorporado, abre un chat nuevo, selecciona el modelo y espera a que termine de cargarse. La primera carga puede tardar un poco más, especialmente si el archivo es grande o se ejecuta principalmente mediante la CPU.
Importar en Jan un modelo ajustado con Ertas Studio
Los usuarios que realizan fine-tuning de modelos de lenguaje también pueden utilizar Jan como entorno de ejecución. Herramientas como Ertas Studio permiten entrenar o ajustar un modelo en la nube y exportar el resultado en formato GGUF.
No se trata de una integración directa entre ambas aplicaciones. El flujo consiste en preparar y entrenar el modelo en Ertas Studio, evaluar sus resultados, exportar una versión cuantizada y cargar posteriormente el archivo GGUF en Jan mediante la opción de importación local.
Antes de exportarlo conviene probar distintas cuantizaciones. Q4_K_M suele ser una elección razonable para distribuir el modelo entre equipos domésticos, mientras que Q5_K_M o Q8_0 pueden ofrecer más fidelidad si los ordenadores de destino cuentan con memoria suficiente.
Este sistema permite desarrollar asistentes adaptados a documentación, terminología o tareas concretas y ejecutarlos después sin depender permanentemente de una API. Sin embargo, en sectores como la salud o las finanzas, trabajar en local no garantiza por sí solo el cumplimiento normativo. También hay que controlar el origen de los datos, los permisos, el almacenamiento y el acceso al equipo.
Ajustar Jan para que el modelo funcione más rápido
La velocidad del modelo dependerá de su tamaño, la cuantización seleccionada y el hardware disponible. Desde el icono de configuración situado junto al modelo puedes modificar parámetros como el contexto, la temperatura y las capas enviadas a la GPU.
El ajuste GPU Layers determina cuántas capas procesa la tarjeta gráfica. Un valor alto suele mejorar notablemente la velocidad, pero también aumenta el consumo de VRAM. Si el modelo no carga o aparece un error de memoria, reduce este valor hasta encontrar una configuración estable.
La longitud de contexto también influye en el consumo. Aunque un modelo admita decenas de miles de tokens, configurar el máximo desde el principio puede reservar una cantidad importante de memoria para la caché KV. Si el equipo se queda sin recursos, prueba a reducir el contexto o utilizar una caché cuantizada.
En equipos con una tarjeta NVIDIA resulta recomendable comprobar que Jan utiliza un backend CUDA compatible. En otros sistemas se puede recurrir a Vulkan, Metal o la CPU, dependiendo del hardware y del sistema operativo. Si Jan AI no detecta la tarjeta gráfica, actualizar los controladores y el motor de llama.cpp suele ser uno de los primeros pasos.
Cómo eliminar modelos y recuperar espacio en el disco
Los archivos GGUF pueden ocupar varios gigabytes, por lo que es fácil acumular decenas de gigabytes de modelos que ya no utilizas. Para borrar uno individualmente, accede a su configuración y pulsa el icono de la papelera.
Jan también permite realizar una limpieza masiva. Entra en Settings > Llama.cpp —o MLX en equipos Apple compatibles— y utiliza Delete All dentro del apartado de modelos. Antes de confirmar, la aplicación indica cuánto espacio se recuperará.
Esta función elimina las descargas gestionadas por Jan, pero mantiene intactos los modelos locales enlazados manualmente. En estos casos se retira la referencia de la aplicación sin borrar el archivo original.
Qué hacer si Jan no reconoce o no carga el modelo GGUF

Cuando un modelo se queda cargando indefinidamente o Jan muestra un error, empieza comprobando que el archivo haya terminado de descargarse y que no esté dividido en varias partes. Algunos modelos grandes se distribuyen mediante varios archivos GGUF que deben conservar sus nombres y permanecer en la misma carpeta.
También puede ocurrir que la versión actual de llama.cpp no sea compatible con una arquitectura recién publicada. Entra en la configuración del motor, instala la versión más reciente disponible y activa las actualizaciones automáticas si quieres recibir nuevas compilaciones.
Si el problema está relacionado con la memoria, prueba estas medidas:
- Reduce el número de capas enviadas a la GPU.
- Disminuye la longitud máxima del contexto.
- Cierra juegos y aplicaciones que consuman mucha RAM o VRAM.
- Utiliza una cuantización más pequeña, como Q4_K_M.
- Configura Jan para mantener cargado un solo modelo simultáneamente.
- Prueba otro backend compatible con tu procesador o tarjeta gráfica.
Cuando hayas importado el modelo desde otra carpeta, comprueba además que el archivo continúe en la misma ubicación. Si fue movido o renombrado, elimina su referencia de Jan y vuelve a importarlo.
Jan también admite modelos propios como Jan-v3-4B, basado en Qwen3-4B-Instruct-2507, además de conexiones con OpenAI, Anthropic, OpenRouter y otros servicios compatibles. Esta combinación permite utilizar modelos locales cuando necesitas privacidad y recurrir a proveedores externos cuando buscas más potencia o funciones específicas.
Importar modelos GGUF en Jan AI es, por tanto, una forma sencilla de crear un entorno de inteligencia artificial local y bajo tu control. Elegir una cuantización adecuada, ajustar el uso de la GPU y mantener actualizado llama.cpp suele ser suficiente para ejecutar una gran variedad de modelos sin depender continuamente de Internet.
Soy un apasionado de la tecnología que ha convertido sus intereses «frikis» en profesión. Llevo más de 10 años de mi vida utilizando tecnología de vanguardia y trasteando todo tipo de programas por pura curiosidad. Ahora me he especializado en tecnología de ordenador y videojuegos. Esto es por que desde hace más de 5 años que trabajo redactando para varias webs en materia de tecnología y videojuegos, creando artículos que buscan darte la información que necesitas con un lenguaje entendible por todos.
Si tienes cualquier pregunta, mis conocimientos van desde todo lo relacionado con el sistema operativo Windows así como Android para móviles. Y es que mi compromiso es contigo, siempre estoy dispuesto a dedicarte unos minutos y ayudarte a resolver cualquier duda que tengas en este mundo de internet.