- Ollama permite ejecutar LLMs de código abierto localmente, garantizando privacidad total y eliminando costes por token.
- La configuración requiere atención a la RAM y GPU, siendo 16GB el estándar recomendado para un rendimiento fluido.
- Es posible conectar modelos locales al navegador mediante extensiones y configurar el CORS para interactuar con el contenido web en tiempo real.
- La herramienta se integra con IDEs como VS Code y entornos virtualizados como Docker para optimizar el desarrollo de software.
¿Cómo utilizar Browser Use con Ollama y modelos locales? Seguro que te has dado cuenta de que la IA está metida en absolutamente todo ahora mismo. ChatGPT es el rey, pero claro, con tanta potencia viene también un poquito de paranoia: ¿qué pasa con los datos que subimos? ¿Quién se lee nuestros prompts o si mi jefe sabe que estoy usando una IA para terminar el trabajo más rápido? Son dudas más que lógicas y por eso mucha gente está pasando de las nubes y se está montando su propio entorno de inteligencia artificial local.
La idea es sencilla pero potente: tener el control total. En este artículo te vamos a explicar a fondo cómo dominar Ollama, una herramienta que te permite ejecutar modelos de lenguaje en tu propio ordenador sin que ni un solo byte salga de tu máquina. Vamos a ver desde la instalación básica hasta cómo integrar todo esto en tu navegador para que la IA analice las webs que visitas en tiempo real, sin suscripciones mensuales ni letras pequeñas sobre la privacidad.
¿Qué demonios es Ollama y por qué mola tanto?

Para ponerlo fácil, Ollama es una plataforma de código abierto que actúa como un gestor de modelos de lenguaje (LLMs). Imagínatelo como una tienda de aplicaciones, pero para cerebros artificiales. Te permite descargar modelos como Llama, Mistral o DeepSeek y ejecutarlos directamente en tu hardware, ya sea que uses Windows, macOS o Linux. Lo mejor de todo es que, una vez bajado el modelo, no necesitas internet para chatear con él.
La gran ventaja aquí es la soberanía de tus datos. Puedes pasarle al modelo contratos confidenciales, notas privadas o código sensible sin miedo a que se usen para entrenar la siguiente versión de algún modelo comercial. Además, te olvidas de las tarifas por token que a veces te dejan la cartera tiritando al final del mes. Es, básicamente, IA democrática y privada.
Lo que necesitas para que no explote tu PC
No hace falta tener un superordenador de la NASA, pero tampoco te sirve cualquier tostadora. El componente crítico aquí es la memoria RAM. Si tienes 8GB, podrás mover modelos pequeñitos, pero prepárate para que la respuesta sea lenta. Lo ideal es contar con al menos 16GB de RAM para que la experiencia sea fluida. Si eres usuario de Mac con chips Apple Silicon, vas sobradísimo gracias a la memoria unificada.
En cuanto al almacenamiento, depende de qué modelo quieras. Un modelo cuantizado pequeño puede ocupar unos 2GB, pero si te pones ambicioso con modelos masivos, podrías necesitar desde 40GB hasta cantidades absurdas como 1.3TB. También es fundamental la GPU (tarjeta gráfica); si tienes una NVIDIA o AMD compatible, el modelo responderá casi instantáneamente, mientras que si dependes solo de la CPU, tendrás que armarte de paciencia.
Manos a la obra: Instalación y primeros pasos

Instalar Ollama es pan comido. Puedes ir a la web oficial o usar la terminal. En Linux y Mac, un simple comando de curl hace todo el trabajo. Una vez instalado, Ollama levanta un servidor local en el puerto 11434. Para comprobar que todo va viento en popa, basta con entrar en http://localhost:11434 desde tu navegador; si ves un mensaje de confirmación, ya estás dentro.
Para bajar tu primer modelo, abre la terminal y escribe ollama pull llama3.2. Si quieres empezar a hablar con él directamente, usa ollama run llama3.2. A partir de ahí, ya tienes un asistente potente funcionando en tu hardware. Si quieres ver qué tienes instalado, el comando es ollama list, y para borrar alguno que ya no uses, ollama rm.
Conceptos clave: Cuantización y Modelos Cloud

Quizás hayas visto términos como cuantización y te suenen a chino. Básicamente, es un proceso para reducir la precisión de los pesos del modelo (pasar de 16 bits a 4 u 8 bits). Esto hace que el modelo ocupe mucho menos espacio y requiera menos RAM, sacrificando una pizca de precisión que, en la mayoría de los casos, ni notarás. Por eso verás etiquetas como q4_K_M, que indican un equilibrio entre tamaño y calidad.
Y si tu PC se queda corto pero quieres potencia bruta, Ollama ha lanzado los modelos en la nube. Estos permiten usar modelos gigantescos (como DeepSeek-v3.1 de 671B) usando la misma interfaz. Solo tienes que añadir el sufijo -cloud al nombre del modelo y hacer un ollama signin. Lo guapo es que, aunque estén en la nube, Ollama promete no retener tus datos.
Cómo integrar Ollama con tu navegador y el mundo real
Tener el modelo en la terminal está bien, pero usarlo mientras navegas es donde ocurre la magia. Imagina analizar un artículo científico denso o comparar precios de competidores sin copiar y pegar textos infinitos. Para lograr esto, existen extensiones como SurfMind que conectan tu Ollama local con el DOM de la página web.
Para que esto funcione, primero debes configurar el CORS para que el navegador tenga permiso de hablar con Ollama. Tienes que ejecutar el servidor con la variable OLLAMA_ORIGINS="*". Después, en la extensión, eliges la preconfiguración de Ollama, apuntas a la URL http://localhost:11434/api/chat y ¡listo! Ya tienes un analista web privado que puede resumirte textos o buscar puntos débiles en un documento legal en segundos.
Opciones avanzadas: Docker y Entornos de Desarrollo
Si prefieres no ensuciar tu sistema operativo, la mejor opción es usar Docker. Ejecutar Ollama en un contenedor te da una capa de aislamiento brutal. Para quienes buscan una interfaz visual más parecida a ChatGPT, Open WebUI es la pareja ideal. Se instala también vía Docker y te ofrece un entorno gráfico intuitivo donde gestionar tus modelos y chats sin tocar la consola.
Además, si eres programador, puedes integrar Ollama en tu flujo de trabajo. Desde marzo de 2025, GitHub Copilot permite usar modelos personalizados mediante la función BYOK (Bring Your Own Key). Simplemente vas a la gestión de modelos en VS Code, seleccionas Ollama y tu editor de código empezará a sugerirte líneas basadas en tu modelo local, manteniendo el código estrictamente en tu máquina.
Modelos recomendados según lo que busques
La librería de Ollama es enorme, así que aquí tienes una guía rápida para no perderte. Para tareas generales o chat, ve a lo seguro con Llama 3.2 o Mistral. Si lo tuyo es picar código, DeepSeek-Coder o CodeLlama son las mejores opciones. Para analizar documentos o resumir, busca los modelos con la etiqueta instruct, ya que están entrenados específicamente para seguir órdenes precisas.
Si necesitas que la IA «vea», tienes que optar por modelos multimodales como Llava o Moondream. Estos te permiten pasarle una imagen y preguntar cosas sobre ella. Recuerda siempre revisar el comando ollama ps para comprobar si el modelo se está ejecutando en la GPU; si dice CPU, la velocidad caerá drásticamente y será el momento de optimizar tus controladores o cerrar pestañas de Chrome.
Tener un sistema de IA local es pasar de ser un simple usuario de una herramienta cerrada a ser el dueño de tu propio motor de conocimiento. Desde la instalación sencilla de Ollama y la gestión de modelos cuantizados para ahorrar RAM, hasta la integración con extensiones de navegador y entornos como Docker o VS Code, el ecosistema permite priorizar la privacidad sin renunciar a la potencia. Montar este flujo de trabajo te libera de las cuotas mensuales y te da la seguridad de que tu información sensible nunca saldrá de tu propio hardware.
Apasionado de la tecnología desde pequeñito. Me encanta estar a la última en el sector y sobre todo, comunicarlo. Por eso me dedico a la comunicación en webs de tecnología y videojuegos desde hace ya muchos años. Podrás encontrarme escribiendo sobre Android, Windows, MacOS, iOS, Nintendo o cualquier otro tema relacionado que se te pase por la cabeza.
