Ollama no utiliza la GPU: causas y soluciones

Última actualización: 12/08/2026

Ollama no utiliza la GPU

¿Sospechas que Ollama no utiliza la GPU? Si a la hora de ejecutar tus modelos notas que se tarda mucho en responder y que tiene un consumo excesivo de procesador, es probable que la aplicación no esté detectando tu tarjeta gráfica. En este artículo, analizaremos las causas principales y las soluciones paso a paso para que le devuelvas la aceleración por hardware a tu sistema.

¿Por qué Ollama no utiliza la GPU?

Ollama no utiliza la GPU

Cuando Ollama no utiliza la GPU, suele ser por controladores desactualizados o faltan dependencias necesarias como CUDA o ROCm. O puede ser que la memoria VRAM es insuficiente para el tamaño del modelo que descargaste, lo que fuerza al sistema a poner toda la carga de trabajo de manera automática hacia la CPU y la memoria RAM. Es parecido a lo que sucede cuando LocalAI no carga los modelos.

Conocer las causas por las que Ollama no utiliza la GPU te permite diagnosticar rápidamente la falla y restaurar la aceleración por hardware. Esto a su vez, optimiza el rendimiento de tu equipo, evita cuellos de botella en el procesador y hace que los modelos de lenguaje respondan más rápido. Además, te aseguras de aprovechar al máximo la capacidad real de tu tarjeta gráfica.

Ollama no utiliza la GPU: causas principales

porque ollama va lento

Cuando Ollama no utiliza la GPU, es normal percibir que la velocidad de respuesta cae drásticamente. De hecho, este es el primer síntoma que te puede advertir de que algo está fallando. A continuación, veamos las principales causas de este fallo:

  • VRAM insuficiente para el modelo: Si el archivo del modelo (.gguf) junto con su contexto excede la memoria VRAM disponible en la GPU, Ollama deriva la carga total o parcial a la CPU/RAM.
  • Falta de Runtime o Controladores adecuados: Ollama no detecta aceleración si faltan los controladores de pantalla actualizados o el backend de cómputo (CUDA para NVIDIA, ROCm/HIP para AMD o IPEX para Intel).
  • GPU no compatible de forma nativa: Tienes una tarjeta gráfica antigua (por ejemplo, arquitecturas previas a Compute Capability 5.0 en NVIDIA) o GPUs integradas/ AMD de consumo que no admiten ROC de manera oficial.
  • Variables de entorno limitantes: Variables que ocultan la GPU (como CUDA_VISIBLE_DEVICES=-1) o falta de variables para arquitecturas no oficiales.
Contenido exclusivo - Clic Aquí  ¿Cómo escribir Notas & mensajes en presupuestos Idesoft?

Diagnóstico inicial: Antes de ponerte a aplicar cambios, es mejor verificar cómo reconoce Ollama tu sistema abriendo una terminal y revisando los logs: ollama serve. Al iniciar el servicio o enviar un prompt, observa las líneas iniciales:

  • dynamic_glog / cuda / rocm: Indica detección correcta de la aceleración.
  • Cpu / no compatible GPU found: Indica que el motor no pudo inicializar la GPU y usará la CPU.

Soluciones por proveedor de Hardware

Cuando Ollama no utiliza la GPU, la solución varía en función de la causa del problema y de tu proveedor de hardware. A continuación, te damos paso a paso las soluciones para usuarios de NVIDIA, AMD Radeon o Intel iGPU / ARC.

1. Para usuarios de NVIDIA

  • Instalar controladores y CUDA: Asegúrate de tener los drivers más recientes. Para entornos Linux o WSL2, instala el NVIDIA CUDA Toolkit.
  • Configurar GPU preferida (Windows): Ve a Configuración – Sistema – Pantalla – Gráficos. Busca y añade los ejecutables ollama.exe y ollama app.exe. Finalmente, establece la preferencia de en Alto rendimiento (GPU dedicada).
  • Verificar visibilidad: Asegúrate de no tener restringido el dispositivo ejecutando en la terminal el comando:
    • set CUDA_VISIBLE_DEVICES=0 # En Windows (CMD).
    • export CUDA_VISIBLE_DEVICES=0 # en Linux / macOS / PowerShell.
Contenido exclusivo - Clic Aquí  ¿Cómo Comprobar el historial de edición de tus presupuestos con Anfix?

2. Para usuarios de AMD (Radeon)

  • Instalar el runtime de ROCm / HIP: En Linux es necesario instalar ROCm formalmente. En Windows tienes que instalar el paquete completo de AMD Software: Adrenalin Edition.
  • Forzar soporte en tarjetas no soportadas (Linux): Si utilizas una GPU AMD que no está en la lista oficial de ROCm (por ejemplo, RX 6700 XT, RX 5800), puedes forzar la compatibilidad agregando esta variable de entorno antes de iniciar Ollama: export HSA_OVERRIDE_GFX_VERSION=10.3.0 # Ajustar según la arquitectura (ej. 10.3.0 para RDNA2).

3. Para usuarios de Intel (iGPU – Arc)

  • Variable de entorno: En algunas configuraciones de Intel Arc o iGPUs modernas, se debe habilitar el parámetro experimental: set OLLAMA_INTEL_GPU=1.
  • Vulkan fallback: Si la arquitectura no soporta el backend por defecto, puedes probar activando la aceleración vía Vulkan en versiones compatibles: set OLLAMA_VULKAN=1.

Ajustes de modelos y VRAM

Ahora bien, si a pesar de revisar todo lo anterior Ollama sigue sin usar la GPU, el problema puede ser el tamaño de la memoria física. Si sospechas que esto es lo que está pasando, prueba lo siguiente:

  • Elige cuantizaciones menores: Un modelo en precisión fp16 o q8 requiere mucha más VRAM. Es mejor que optes por versiones menores como q4_K_M o q5_K_M.
  • Reduce el contexto de entrada (num_ctx): Un contexto alto (por ejemplo, 32k tokens) consume gigabytes adicionales de VRAM solo para el KV-Cache. Limítalo en tu archivo de configuración o consulta (por ejemplo, a 2048 o 4096 tokens).
  • Utiliza una versión más pequeña del modelo: Para GPUs de 4 GB a 8 GB de VRAM, prioriza modelos de 3B a 8B de parámetros.
Contenido exclusivo - Clic Aquí  ¿Cuál es el mejor descompresor para Mac?

Beneficios de saber por qué Ollama no utiliza la GPU

Ollama no utiliza la GPU

Conocer las causas y soluciones por las que Ollama no utiliza la GPU ofrece ventajas a nivel técnico y operativo:

  • Máximo rendimiento y velocidad: La GPU procesa texto y código hasta 10 veces más rápido que la CPU. Al solucionar este problema, le devuelves la fluidez a la generación de respuestas.
  • Diagnóstico rápido ante actualizaciones: Puedes identificar si un fallo repentino se debe a controladores desactualizados, variables de entorno mal configuradas o incompatibilidades tras actualizar el sistema operativo.
  • Optimización de recursos del sistema: Cuando Ollama no utiliza la GPU, la CPU trabaja forzada. Al solucionar este inconveniente, evitas que se sobrecaliente tu equipo, que los ventiladores suenen excesivamente y que las aplicaciones se congelen.
  • Uso eficiente de la VRAM: Si descubres que la memoria VRAM es insuficiente, puedes ajustar el tamaño de los modelos y la longitud de contexto para aprovechar el hardware que tienes disponible sin sobrepasar la memoria gráfica.

En conclusión, saber por qué Ollama no utiliza la GPU te ayudará a restaurar rápidamente la aceleración por hardware. Aplica la solución adecuada según tu tarjeta gráfica y ajusta el uso de VRAM usando las sugerencias de este artículo. Así, garantizas respuestas fluidas y eficientes en tus modelos de IA locales.