Cómo conectar Continue con Ollama para programar con IA local

Última actualización: 11/08/2026

  • Instalación de Ollama como motor de inferencia local y configuración de modelos específicos mediante etiquetas exactas.
  • Integración con la extensión Continue en VS Code a través de un archivo config.yaml para asignar roles de chat y autocompletado.
  • Optimización del hardware eligiendo modelos según la VRAM, destacando la familia Qwen para código y Llama para razonamiento.
  • Capacidad de conectar una laptop a un servidor remoto de Ollama configurando la IP y variables de entorno de red.

IA local para programadores

Si te gusta programar, habrás notado que los asistentes de inteligencia artificial se han vuelto casi imprescindibles. Sin embargo, depender de la nube tiene sus migueyas, como que el código sale de tu equipo o que te quedas colgado si el internet decide tomarse el día libre. Aquí es donde entra la combinación de Continue y Ollama, una pareja dinámica que te permite montar tu propio Copilot en casa, totalmente gratis y con un control absoluto sobre tus datos.

Básicamente, estamos hablando de desplazar toda la potencia de procesamiento a tu propio hardware. En lugar de pagar suscripciones mensuales, instalas un runtime de inferencia en tu máquina y conectas tu editor de código preferido. Así, logras un flujo de trabajo donde la privacidad es total y la latencia se reduce al mínimo, ya que no hay servidores remotos de por medio, solo tu CPU y tu GPU dándolo todo.

LocalAI vs Ollama: cuál elegir como servidor local
Related article:
LocalAI vs Ollama: Guía Completa para Elegir tu Servidor de IA Local

Pasos para instalar y poner en marcha Ollama

Instalación de Ollama

Lo primero de todo es dejar listo el motor que moverá los modelos. Dependiendo de tu sistema, el proceso varía un pelín. Si usas macOS o Windows, lo más sencillo es seguir la instalación de Ollama en Windows y seguir los pasos. Para los amantes de Linux, se puede hacer todo desde la terminal lanzando el comando curl oficial para automatizar la instalación.

Una vez instalado, debes arrancar el servicio. Es fundamental que el sistema esté activo para que el editor pueda comunicarse con él. Para descargar los modelos, usarás el comando ollama pull seguido del nombre del modelo. Ojo aquí: es vital usar las etiquetas exactas (como :latest, :7b o :instruct) para evitar que el sistema se confunda y te diga que el modelo no existe.

Contenido exclusivo - Clic Aquí  Cómo transferir fotos desde la tarjeta SD a la PC

Antes de lanzarte, echa un vistazo a tu hardware. Para moverte con soltura, lo ideal es tener al menos 16GB de RAM, aunque con 8GB puedes defenderte con modelos pequeños. El almacenamiento debe tener unos 10GB libres para que los modelos respiren tranquilos mientras se descargan y ejecutan.

ollama va lento
Related article:
Cómo acelerar Ollama: Guía completa para optimizar tu IA local

Integración de Ollama con la extensión Continue

Configuración de Continue

Con el motor funcionando, toca instalar la extensión Continue en VS Code o JetBrains. Una vez instalada, el corazón de todo es el archivo config.yaml. Aquí es donde defines qué modelo hace qué cosa. No todos los modelos sirven para lo mismo; algunos son cracks escribiendo código y otros son mejores razonando o simplemente completando la línea en la que estás escribiendo.

Existen tres rutas para configurar tus modelos. La primera es mediante bloques de modelos en el YAML, definiendo el nombre, el proveedor (ollama) y el rol. La segunda es la función de autodetección, donde Continue escanea tu sistema y te deja elegir el modelo desde un menú desplegable en la interfaz gráfica, lo cual es canela en rama para los que no quieren tocar archivos de texto.

Por último, tienes la configuración manual avanzada. Esta es la mejor opción si quieres ajustes finos, como cambiar el apiBase si Ollama no está en tu laptop sino en otro ordenador de la red, o si necesitas especificar capacidades especiales como el uso de herramientas para el modo agente. En este sentido, es similar a cómo se puede conectar LM Studio con VS Code para obtener funcionalidad similar.

Contenido exclusivo - Clic Aquí  ¿Cómo Activar el WiFi de mi Laptop HP Windows 7?

Cómo elegir el modelo adecuado según tu hardware

Modelos de IA para código

No intentes correr un modelo gigante en una máquina modesta porque el sistema petará. Para la generación de código, el qwen2.5-coder:7b es una joya, mientras que el deepseek-coder:6.7b es rapidísimo. Si buscas razonamiento puro y duro para resolver bugs complejos, el deepseek-r1:32b es la bestia, pero requiere unos 32GB de RAM para no ir a pedales.

Para el autocompletado (el famoso Tab), la regla de oro es usar modelos ligeros entre 1.5B y 3B parámetros. El qwen2.5-coder:1.5b es ideal porque tiene soporte Fill-In-the-Middle (FIM), lo que significa que entiende el código que hay antes y después del cursor. Si usas un modelo de chat general para esto, verás que el código sale con errores de sintaxis o líneas repetidas.

Si tienes una GPU potente (como una RTX 4090 o una M3 Max), puedes ir a por el qwen3-coder:30b. Gracias a su arquitectura Mixture-of-Experts (MoE), es increíblemente eficiente y ofrece una calidad de respuesta profesional sin que la máquina se convierta en un horno.

Jan AI no detecta la tarjeta gráfica: causas y soluciones
Related article:
Guía completa para elegir el modelo de IA Local ideal según tu memoria RAM

Configuración de servidores remotos y optimización

Servidor remoto Ollama

Mucha gente tiene una laptop ligera para trabajar pero un PC potente en el escritorio. Puedes usar ese PC como servidor de IA. Para ello, debes configurar la variable de entorno OLLAMA_HOST=0.0.0.0:11434 en la máquina potente para que acepte conexiones externas. Luego, en el config.yaml de tu laptop, cambias el localhost por la dirección IP del escritorio.

Si te encuentras con problemas de conexión, lo primero es comprobar que el puerto 11434 no esté bloqueado por el firewall. Un truco rápido es lanzar un curl a la IP del servidor desde la laptop para ver si responde. Para mayor seguridad, especialmente si sales de tu red local, lo más recomendable es montar un túnel SSH, así la conexión viaja cifrada y no expones tu servidor a todo el mundo.

Contenido exclusivo - Clic Aquí  ¿Cómo copiar un enlace en Google Drive?

Para optimizar el rendimiento, monitoriza el uso de memoria con ollama ps. Si notas que el autocompletado va lento, sube el debounceDelay en la configuración para que la IA no intente predecir cada milisegundo. También puedes ajustar la ventana de contexto según la VRAM disponible para evitar que el modelo se sature y empiece a soltar tonterías.

Resolución de errores comunes y trucos finales

Es normal que al principio te salga el error «404 model not found». Esto suele pasar porque el modelo no ha sido descargado con la etiqueta exacta que pusiste en el archivo YAML. La solución es simple: haz un pull manual del modelo exacto desde la terminal y reinicia la extensión de Continue.

Otro dolor de cabeza es cuando el modo agente dice que no está soportado. Esto ocurre porque no todos los modelos saben usar herramientas (function calling). Para arreglarlo, asegúrate de añadir capabilities: en el config y usa modelos confirmados como Llama 3.1 o Mistral, que se llevan mucho mejor con el modo autónomo.

Para aquellos que quieren mejorar el contexto del chat sin que el modelo se sature, el uso de nomic-embed-text es la clave. Este modelo de embeddings permite vectorizar tu base de código completa, logrando que el asistente encuentre la información relevante en miles de archivos sin necesidad de pegarlos todos manualmente en el prompt.

Montar este ecosistema te permite disfrutar de un asistente de programación robusto, privado y gratuito, donde la clave reside en emparejar el modelo correcto con tu hardware y ajustar la red para que todo fluya sin tirones.

Cómo conectar LibreChat con Ollama
Related article:
Cómo conectar LibreChat con Ollama para tener IA local