- El uso de modelos cuantizados en formato GGUF permite ejecutar IAs potentes en hardware con poca memoria.
- La gestión manual de las capas de offload a la GPU evita que el sistema recurra a la RAM lenta y desplome el rendimiento.
- El control estricto de la longitud del contexto es fundamental para evitar saturar la memoria de vídeo.
Ejecutar una inteligencia artificial en el propio ordenador ofrece privacidad, libertad para cambiar de modelo y la posibilidad de trabajar sin depender continuamente de Internet. El problema aparece cuando LM Studio intenta cargar más datos de los que caben en la memoria disponible y el sistema comienza a utilizar la RAM, la memoria compartida o incluso el archivo de paginación.
En ese momento pueden aparecer respuestas extremadamente lentas, bloqueos, errores al cargar el modelo o un ordenador que apenas responde. No significa necesariamente que necesites comprar una tarjeta gráfica nueva. En muchos casos basta con elegir correctamente el modelo y ajustar la cuantización, el contexto, la descarga a la GPU y el KV Cache.
LM Studio puede configurar automáticamente muchos de estos parámetros, pero también permite modificarlos antes de cargar cada modelo. Si tu equipo tiene poca RAM o VRAM, aprender a controlar estos ajustes puede marcar la diferencia entre un modelo que no arranca y otro que genera respuestas con fluidez.
Qué consume RAM y VRAM en LM Studio

Cuando LM Studio carga un modelo, el archivo descargado no es el único elemento que ocupa memoria. El consumo total se reparte entre varios componentes:
- Pesos del modelo: contienen los parámetros aprendidos por la red neuronal y suelen representar la mayor parte del consumo.
- KV Cache: conserva información de los tokens procesados para no tener que calcularlos de nuevo durante la conversación.
- Contexto: incluye las instrucciones, el historial, los documentos y la respuesta que se está generando.
- Buffers y memoria de cálculo: son espacios temporales que el motor necesita para ejecutar las operaciones.
- Batch de evaluación: determina cuántos tokens se procesan conjuntamente durante la lectura de la entrada.
- Componentes adicionales: los modelos de visión pueden necesitar memoria extra para procesar imágenes.
Por esta razón, un archivo GGUF de 5 GB no tiene por qué ocupar solamente 5 GB al ejecutarse. LM Studio necesita cierto margen adicional y ese margen puede aumentar considerablemente cuando se configura un contexto largo.
La RAM y la VRAM tampoco son equivalentes. La VRAM está conectada directamente a la GPU y ofrece un ancho de banda muy superior. Si una parte del modelo permanece en la RAM, la CPU puede encargarse de procesarla, pero normalmente lo hará con menos velocidad. También pueden producirse transferencias constantes entre ambas memorias.
En Windows, el Administrador de tareas puede mostrar memoria de GPU compartida. Esta procede de la RAM del sistema y no convierte mágicamente una gráfica de 8 GB en una de 16 GB. Aunque puede evitar algunos errores, su rendimiento es muy inferior al de la VRAM dedicada.
Elegir un modelo que quepa en el equipo
El primer paso no consiste en mover deslizadores, sino en escoger un modelo acorde con el hardware. El número de parámetros ofrece una referencia aproximada, pero no permite conocer por sí solo el consumo. También influyen la cuantización, la arquitectura, el contexto y las funciones del modelo.
Como orientación general:
- Equipos con 8 GB de RAM: conviene utilizar modelos pequeños de aproximadamente 1B a 3B parámetros y cerrar otras aplicaciones.
- Equipos con 16 GB de RAM: suelen desenvolverse mejor con modelos cuantizados de 3B a 8B.
- Equipos con 32 GB de RAM: ofrecen más margen para modelos de 8B, 12B, 14B o algunos superiores.
- GPU con 4 GB o 6 GB de VRAM: puede acelerar modelos pequeños o descargar solamente una parte de las capas.
- GPU con 8 GB o 12 GB de VRAM: permite cargar completamente muchos modelos pequeños y medianos cuantizados.
- GPU con 16 GB o más: admite modelos mayores, contextos más amplios y configuraciones menos comprimidas.
Estos rangos no son límites absolutos. Un modelo puede funcionar aunque no quepa completamente en la GPU porque LM Studio reparte parte del trabajo con la CPU. Sin embargo, que un modelo pueda cargarse no significa que vaya a responder con una velocidad aceptable.
Usar una cuantización adecuada
La cuantización reduce la precisión con la que se almacenan los pesos del modelo. Esto disminuye el tamaño del archivo y la memoria necesaria para ejecutarlo, a cambio de cierta pérdida de calidad.
En los modelos GGUF encontrarás variantes como Q2, Q3, Q4, Q5, Q6 o Q8. LM Studio recomienda escoger, siempre que el equipo lo permita, una cuantización de 4 bits o superior.
Las opciones más habituales son:
- Q4_K_M: suele ofrecer una buena relación entre tamaño, calidad y velocidad.
- Q5_K_M: conserva algo más de precisión, pero utiliza más memoria.
- Q6_K: se aproxima más a cuantizaciones de alta calidad y necesita mayor capacidad.
- Q8_0: reduce poco la calidad respecto a formatos de mayor precisión, aunque el archivo es considerablemente más pesado.
- Q3 o Q2: pueden resultar útiles cuando la memoria es muy limitada, pero la degradación puede hacerse más evidente.
No es correcto afirmar que Q4 reduzca siempre el consumo en un porcentaje exacto. El tamaño final depende del método de cuantización y de los componentes del modelo que se conserven con mayor precisión.
Si una variante Q5 no cabe completamente en la GPU, una Q4 del mismo modelo puede proporcionar más velocidad aunque su precisión sea ligeramente inferior. En un equipo modesto suele ser preferible un modelo más pequeño funcionando íntegramente en memoria rápida que uno enorme desplazando datos continuamente.
Limitar la longitud del contexto
La longitud del contexto indica cuántos tokens puede tener presentes el modelo durante una petición. En esa cifra entran las instrucciones, los mensajes anteriores, los documentos adjuntos y la respuesta generada.
Que un modelo admita 32.000, 128.000 o más tokens no significa que debas asignarle siempre el máximo. Cuanto mayor sea el contexto configurado, más memoria puede necesitar el KV Cache.
Para conversaciones normales, un contexto de 4096 u 8192 tokens suele ser un punto de partida razonable. Puedes ampliarlo cuando necesites analizar documentos extensos, conservar conversaciones muy largas o trabajar con grandes fragmentos de código.
En LM Studio puedes cambiar este valor en la configuración de carga del modelo. Si no aparecen los parámetros avanzados, activa el modo Developer desde Settings > Developer.
También puedes establecer el contexto desde la terminal:
lms load identificador-del-modelo --context-length 4096
Reducir el contexto no cambia el tamaño de los pesos, pero sí puede rebajar notablemente el consumo asociado a la conversación. La diferencia exacta varía según el modelo, el tipo de atención y el formato empleado para el KV Cache.
Ajustar el GPU Offload sin llenar la VRAM

El GPU Offload determina qué proporción del modelo se procesa en la tarjeta gráfica. Cuantas más capas se descarguen a la GPU, mayor será normalmente la velocidad, pero también aumentará el uso de VRAM.
LM Studio puede calcular automáticamente una configuración compatible con el equipo. Si necesitas limitar manualmente el consumo, no hace falta empezar obligatoriamente en el 50 %. Resulta más práctico seguir este procedimiento:
- Selecciona el modelo y abre sus ajustes de carga.
- Configura primero el contexto que realmente necesites.
- Consulta la estimación de memoria que muestra LM Studio.
- Aumenta el GPU Offload sin agotar toda la VRAM.
- Deja margen para el sistema operativo y otras aplicaciones que utilicen la GPU.
- Si aparecen errores o una caída brusca de rendimiento, reduce ligeramente la descarga.
Desde la CLI puedes indicar una proporción entre 0 y 1:
lms load identificador-del-modelo --gpu 0.5
Para intentar descargar todo el modelo a la GPU:
lms load identificador-del-modelo --gpu max
Y para ejecutar sin GPU Offload:
lms load identificador-del-modelo --gpu off
La configuración más rápida suele ser la que mantiene la mayor cantidad posible del modelo en la GPU sin provocar falta de memoria ni recurrir excesivamente a memoria compartida.
Activar Flash Attention y comprimir el KV Cache
Flash Attention optimiza el cálculo de la atención y puede reducir el consumo de memoria, especialmente al utilizar contextos largos. También puede mejorar el rendimiento en hardware compatible.
LM Studio permite guardar esta opción dentro de los ajustes predeterminados de cada modelo. No obstante, su disponibilidad y los resultados dependen del modelo, el runtime y la GPU instalada.
Otra posibilidad es cuantizar el KV Cache. En los modelos y runtimes compatibles, LM Studio permite utilizar una precisión inferior para las claves y los valores almacenados durante la conversación. Esto puede reducir mucho el consumo cuando se trabaja con ventanas de contexto amplias.
Debes tener en cuenta lo siguiente:
- Un KV Cache de menor precisión utiliza menos memoria.
- El impacto en la calidad depende del modelo y del nivel seleccionado.
- La cuantización del Value Cache necesita Flash Attention en determinadas configuraciones.
- Es recomendable probar primero Q8 antes de recurrir a niveles más agresivos.
Si solo utilizas contextos de 4096 tokens, la diferencia puede ser menos importante. En cambio, cuando intentas trabajar con decenas de miles de tokens, cuantizar el KV Cache puede ser decisivo para que el modelo quepa en la memoria.
Reducir el batch y descargar modelos inactivos
El tamaño del batch de evaluación determina cuántos tokens procesa conjuntamente el motor durante la fase de entrada. Un valor elevado puede mejorar la velocidad de procesamiento del prompt, pero también necesita más memoria.
Si LM Studio se queda sin memoria al leer documentos largos o prompts extensos, prueba a reducir el Eval Batch Size. El procesamiento inicial puede tardar algo más, pero disminuirá el pico de consumo.
También conviene comprobar que no haya varios modelos cargados simultáneamente. Puedes ver los modelos activos mediante:
lms ps
Para descargar todos los modelos de la memoria utiliza:
lms unload --all
Si ejecutas LM Studio como servidor, puedes establecer un tiempo de vida o TTL para que el modelo se descargue tras permanecer inactivo:
lms load identificador-del-modelo --ttl 3600
En este ejemplo, el modelo se retirará de la memoria después de una hora sin utilizarse. Esta opción resulta útil cuando LM Studio comparte el ordenador con videojuegos, editores de vídeo u otras aplicaciones que necesitan mucha VRAM.
Estimar la memoria antes de cargar el modelo

LM Studio incluye un estimador que permite calcular el consumo sin cargar realmente el modelo. Primero puedes consultar los modelos descargados con:
lms ls
Después, utiliza su identificador con el parámetro --estimate-only:
lms load --estimate-only identificador-del-modelo
La estimación tiene en cuenta factores como el contexto, Flash Attention y las capacidades visuales del modelo. También puedes comparar diferentes configuraciones:
lms load --estimate-only identificador-del-modelo --context-length 4096 --gpu max
Si la estimación se acerca demasiado a la memoria disponible, reduce primero el contexto, prueba una cuantización inferior o descarga menos capas a la GPU.
El cálculo sigue siendo una estimación y conviene conservar cierto margen. Windows, el navegador, la aceleración gráfica y otras aplicaciones también pueden ocupar VRAM mientras LM Studio está funcionando.
Cómo funciona la memoria en los modelos MoE
Los modelos Mixture of Experts o MoE contienen diferentes grupos de parámetros especializados. Durante la generación solo se activan algunos expertos para cada token, lo que reduce el coste de cálculo frente a un modelo denso con el mismo número total de parámetros.
Sin embargo, esto no significa que los expertos inactivos desaparezcan de la memoria. Los pesos del modelo siguen teniendo que almacenarse en la RAM, la VRAM o ambas. Por eso, un modelo MoE de 120B puede necesitar decenas de gigabytes incluso si solo activa una fracción de sus parámetros durante cada paso.
Algunas configuraciones permiten mantener determinados pesos o expertos en la CPU y utilizar la GPU para otras partes del modelo. Esto puede facilitar la carga, pero exige suficiente RAM y puede reducir considerablemente la velocidad debido a las transferencias de datos.
Los MoE son interesantes para equipos con mucha RAM y una GPU más limitada, pero no deben presentarse como una forma de ejecutar cualquier modelo gigantesco en una tarjeta de 8 GB. El resultado dependerá de la memoria total del equipo, la cuantización y el ancho de banda disponible.
Diferencias entre Windows, Mac y Linux
LM Studio está disponible para Windows, macOS y Linux, pero la gestión de memoria cambia según el hardware.
Windows
En un PC con GPU dedicada, la RAM y la VRAM son espacios separados. Si el modelo no cabe en la gráfica, una parte puede ejecutarse mediante la CPU. Es recomendable cerrar juegos, navegadores con muchas pestañas y aplicaciones aceleradas por hardware antes de cargar modelos grandes.
LM Studio admite sistemas Windows x64 y ARM64 compatibles, aunque el soporte exacto depende de la CPU, la GPU y el runtime instalado. No conviene establecer AVX2 o 32 GB de RAM como requisitos universales para todos los modelos.
Mac con Apple Silicon
Los Mac con Apple Silicon utilizan memoria unificada, de modo que la CPU y la GPU acceden al mismo conjunto de memoria. Esto elimina parte de las transferencias que existen en un PC con GPU dedicada, pero macOS también necesita reservar memoria para el sistema y las demás aplicaciones.
LM Studio puede ejecutar modelos GGUF mediante llama.cpp y también admite modelos preparados para MLX. El formato más rápido dependerá del modelo, su cuantización, la versión del runtime y el equipo. No existe una mejora universal de tres veces por utilizar MLX.
Linux y GPU AMD
En Linux, la compatibilidad y el rendimiento dependen del controlador, el runtime y la GPU utilizada. Algunos equipos AMD con memoria unificada permiten reservar una parte mayor de la RAM para tareas gráficas desde la BIOS.
Determinados procesadores AMD Ryzen AI Max con grandes cantidades de memoria unificada pueden asignar capacidades muy elevadas a la GPU. Sin embargo, no todas las GPU AMD permiten convertir 96 GB de RAM en VRAM. Es una posibilidad asociada a plataformas concretas y no una función general de LM Studio o de cualquier equipo con VGM.
Configuración recomendada para reducir el consumo
Si LM Studio utiliza demasiada RAM o VRAM, aplica los cambios en este orden:
- Elige un modelo más pequeño o una variante Q4_K_M.
- Reduce el contexto a 4096 u 8192 tokens.
- Activa Flash Attention si el modelo y el hardware son compatibles.
- Cuantiza el KV Cache cuando necesites un contexto amplio.
- Ajusta el GPU Offload dejando margen de VRAM para el sistema.
- Reduce el Eval Batch Size si el error aparece al procesar prompts largos.
- Descarga otros modelos que continúen ocupando memoria.
- Utiliza el estimador antes de cargar configuraciones exigentes.
La mejor configuración no es siempre la que utiliza el modelo más grande o descarga todas las capas a la GPU. El objetivo es encontrar un equilibrio que permita mantener una velocidad estable sin llenar la memoria ni provocar paginación.
Con una cuantización adecuada, un contexto razonable y el GPU Offload bien ajustado, LM Studio puede ejecutar modelos útiles incluso en ordenadores con recursos limitados. Si el rendimiento sigue siendo insuficiente después de optimizar estos parámetros, normalmente resultará más efectivo cambiar a un modelo menor que forzar uno que supera claramente la capacidad del equipo.
Soy un apasionado de la tecnología que ha convertido sus intereses «frikis» en profesión. Llevo más de 10 años de mi vida utilizando tecnología de vanguardia y trasteando todo tipo de programas por pura curiosidad. Ahora me he especializado en tecnología de ordenador y videojuegos. Esto es por que desde hace más de 5 años que trabajo redactando para varias webs en materia de tecnología y videojuegos, creando artículos que buscan darte la información que necesitas con un lenguaje entendible por todos.
Si tienes cualquier pregunta, mis conocimientos van desde todo lo relacionado con el sistema operativo Windows así como Android para móviles. Y es que mi compromiso es contigo, siempre estoy dispuesto a dedicarte unos minutos y ayudarte a resolver cualquier duda que tengas en este mundo de internet.
