Guía completa para elegir el modelo de LM Studio según tu hardware

Última actualización: 11/08/2026

  • La VRAM de la tarjeta gráfica es el factor determinante para la velocidad y el tamaño del modelo que puedes cargar.
  • Apple Silicon ofrece una ventaja única gracias a su memoria unificada, permitiendo ejecutar modelos masivos que requieren mucha RAM.
  • La cuantización en 4 bits (Q4) es el equilibrio ideal entre calidad de respuesta y consumo de recursos para la mayoría de los usuarios.
  • NVIDIA sigue liderando en rendimiento puro y compatibilidad inmediata gracias al ecosistema CUDA.

Hardware para IA

Hacer correr una inteligencia artificial en casa ha pasado de ser un experimento para frikis a una herramienta de productividad brutal. Si te has bajado LM Studio, seguramente te habrás dado cuenta de que no basta con darle al botón de descargar; elegir el modelo adecuado según tu memoria RAM y tu tarjeta gráfica es la diferencia entre tener un asistente fluido o un ordenador que se queda colgado procesando una sola palabra.

No hace falta ser un ingeniero de la NASA para entenderlo, pero sí hay que conocer un par de conceptos básicos. La clave está en dónde se alojan los «pesos» del modelo: si caben en la VRAM de tu GPU, volarás; si tienen que ir a la RAM del sistema, la velocidad caerá en picado. En este artículo vamos a desgranar qué opciones tienes según tu presupuesto y el hardware que tengas montado en el chasis.

Dominar LM Studio
Related article:
Guía Completa de LM Studio: Cómo Dominar la IA Local en tu PC

Entendiendo los pilares: VRAM, RAM y Ancho de Banda

Memoria de video

Cuando hablamos de LLM, la inferencia se divide en dos fases: el procesamiento del prompt (cuando la IA lee tu pregunta) y la generación de tokens (cuando escribe la respuesta). La cantidad de VRAM (Video RAM) es lo que decide qué tamaño de modelo puedes cargar. Si el modelo es demasiado grande para tu gráfica, el sistema hará un offloading a la RAM, lo que ralentiza todo el proceso porque la memoria del sistema es mucho más lenta que la de la GPU.

Pero ojo, que no todo es capacidad. Una vez que el modelo cabe en la memoria, el cuello de botella pasa a ser el ancho de banda de la memoria. Básicamente, es la velocidad a la que los datos viajan. Si tienes mucha memoria pero un bus muy estrecho, la generación de texto será lenta aunque el modelo sea pequeño. Por eso, en configuraciones modernas, buscar memorias rápidas como DDR5 o buses GDDR7 es fundamental para no frustrarse.

Contenido exclusivo - Clic Aquí  Guía práctica para probar micrófonos: técnicas y consejos

Otro concepto vital es la cuantización. Los modelos originales son pesadísimos (FP16), pero mediante técnicas de compresión se crean versiones «cuantizadas» (como Q4_K_M). Básicamente, se reduce la precisión de los datos para que el modelo ocupe mucho menos espacio. La regla de oro es: mejor un modelo pequeño en Q4 que uno gigante en Q2, ya que una cuantización demasiado agresiva hace que la IA pierda la lógica y empiece a decir incoherencias. Para profundizar en este tema, puedes consultar nuestra guía completa sobre el formato GGUF.

LM Studio va lento
Related article:
Guía Completa de LM Studio: Instalación, Modelos y Optimización del Rendimiento

NVIDIA y el ecosistema CUDA: La fuerza bruta

Tarjeta gráfica NVIDIA

Si buscas el máximo rendimiento y compatibilidad «Día 0», NVIDIA sigue siendo la opción lógica. Su secreto no es solo el hardware, sino CUDA y TensorRT, que son los estándares sobre los que se construye casi toda la IA moderna. Si instalas un modelo nuevo hoy, lo más probable es que esté optimizado primero para las arquitecturas Blackwell o Ada Lovelace.

Para los que no quieren gastar miles de euros, las RTX 3090 de segunda mano son la joya de la corona. ¿Por qué? Porque tienen 24 GB de VRAM, lo que permite ejecutar modelos medianos de forma holgada sin tocar la RAM del sistema. Si tienes presupuesto, la RTX 5090 es el tope de gama, eliminando casi cualquier cuello de botella gracias a su ancho de banda masivo.

Sin embargo, NVIDIA tiene una política de limitar la VRAM en sus gamas medias para no canibalizar sus tarjetas profesionales. Por eso, si vas a comprar una tarjeta nueva, intenta que tenga al menos 16 GB de VRAM. Quedarse en 8 GB o 12 GB hoy en día es jugar al límite, ya que los modelos de calidad están empezando a superar los 7 billones de parámetros.

LM Studio vs Ollama
Related article:
Qué IA en local rinde mejor en PCs modestos: LM Studio vs Ollama

Apple Silicon: El truco de la Memoria Unificada

Apple ha hecho algo muy inteligente con sus chips M1, M2, M3 y M4. En lugar de separar la RAM de la GPU, utilizan Memoria Unificada. Esto significa que si compras un Mac Studio con 128 GB de RAM, técnicamente tienes una GPU con 128 GB de VRAM disponible para la IA. Es la forma más barata y eficiente de cargar modelos titánicos sin montar un servidor en el salón.

Contenido exclusivo - Clic Aquí  ¿Cómo elegir el procesador (CPU) adecuado para mi PC?

Gracias al framework MLX, LM Studio vuela en macOS. Un chip M4 Max puede procesar modelos de 70B parámetros a velocidades muy decentes consumiendo una fracción de la energía que gastaría un PC. La única pega es que el procesamiento inicial del prompt es algo más lento que en NVIDIA, ya que no tienen Tensor Cores tan agresivos, pero para inferencia pura es una maravilla.

Si tienes un Mac con solo 8 GB de RAM, no te desesperes, pero sé realista. El sistema consume una parte, por lo que te quedan unos 4-6 GB reales. En este caso, olvídate de modelos grandes y vete a por Phi-4-mini (3.8B) o Gemma 4 E4B en versiones de 4 bits. Son los únicos que te darán una experiencia fluida sin que el ordenador empiece a echar humo.

AMD Radeon y la redención de ROCm

Tarjeta gráfica AMD

Durante mucho tiempo, usar AMD para IA era un dolor de cabeza. Pero con la evolución de ROCm, la situación ha cambiado. Ahora, LM Studio y otras herramientas integran soporte nativo, permitiendo que las gráficas Radeon sean una opción muy competitiva, especialmente en la relación VRAM por euro.

Las series RX 7000 y 8000 ofrecen mucha memoria a precios más bajos que NVIDIA. Si usas el formato GGUF a través de llama.cpp, el rendimiento es magnífico. La desventaja sigue siendo el software: si sale una librería experimental hoy en GitHub, probablemente tarde unos meses en funcionar perfectamente en AMD, mientras que en CUDA funcionará al instante.

Instalar y configurar LM Studio en Windows
Related article:
Cómo instalar y configurar LM Studio en Windows paso a paso

Guía de selección según el tamaño del modelo

Para no liarte, aquí tienes la hoja de ruta dependiendo de lo que quieras conseguir. Si buscas agentes ligeros o ayuda con el código (modelos de 8B a 14B), te basta con una RTX 4060 Ti de 16 GB o un MacBook con 24 GB de RAM. Son modelos rápidos y eficientes para tareas cotidianas.

Si necesitas razonamiento avanzado (modelos de 30B a 40B), ya entramos en terreno serio. Aquí necesitas 24 GB de VRAM como mínimo. Una RTX 3090 o 4090 es la elección ideal para cargar el modelo completo. Si prefieres Apple, un Mac Studio con chip Max y 64 GB de RAM te permitirá manejar el contexto sin despeinarte.

Contenido exclusivo - Clic Aquí  Lenovo Legion Go 2 apostará por SteamOS como sistema nativo

Para los modelos masivos de nivel profesional (70B a 120B+), que ya compiten con GPT-4, necesitas una bestia. La opción más sencilla es un Mac Ultra con 128 GB o 192 GB de memoria unificada. Si eres un hacker del hardware, puedes montar un sistema multi-GPU con varias RTX 3090, aunque prepárate para gestionar un consumo eléctrico enorme y mucho ruido de ventiladores.

Configuración optimizada en LM Studio

Una vez elegido el modelo, no olvides ajustar la herramienta para exprimir tu hardware. En el apartado de Hardware Settings, asegúrate de que la aceleración (como Metal en Mac) esté activa. El GPU Offload es la perilla más importante: desplázala al máximo para cargar tantas capas del modelo en la VRAM como sea posible.

Un error común es dejar el Context Size demasiado alto. Cada token de contexto consume memoria. Si tienes poca RAM, limita el contexto a 2048 o 4096 tokens; si intentas usar 32K en un equipo limitado, es muy probable que la aplicación se cierre por falta de memoria antes de que el modelo termine de escribir.

Para quienes tienen configuraciones modestas, el indicador de hardware-fit de LM Studio (verde, amarillo o rojo) es tu mejor amigo. Si ves un indicador rojo, no lo fuerces; la velocidad de generación caerá a niveles desesperantes. Es preferible bajar la cuantización a 4 bits o elegir un modelo con menos parámetros para mantener la estabilidad del sistema.

A la hora de montar tu estación de trabajo, recuerda que el equilibrio entre la VRAM disponible y la velocidad del bus de memoria define tu experiencia. Ya sea optando por la versatilidad de NVIDIA, la capacidad masiva de Apple Silicon o la economía de AMD, lo primordial es no escatimar en memoria, pues es la única barrera real entre un chatbot mediocre y una IA local potente que transforme tu flujo de trabajo.

Cómo eliminar modelos descargados sin romper LM Studio
Related article:
Cómo cambiar la carpeta de modelos en LM Studio y optimizar su uso