Ya instalaste GPT4All y ahora te gustaría integrarla en tus aplicaciones y flujos de trabajo sin tener que usar su interfaz gráfica. ¡Enhorabuena! Esta versátil herramienta también permite exponer modelos locales como un servicio accesible mediante solicitudes HTTP. En esta entrada te explicamos cómo utilizar el servidor API de GPT4All: funcionamiento, instalación, configuración e integración en proyectos reales.
¿Qué es el servidor API de GPT4All?

Utilizar el servidor API de GPT4All es una solución muy simple para conseguir que aplicaciones externas utilicen modelos de IA local. En esencia, es un servidor web ligero que se activa desde la aplicación de escritorio de GPT4All. Una vez encendido, expone una serie de endpoints HTTP a los que pueden apuntar cualquier app o servicio externo.
En otras palabras, al activar el servidor API de GPT4All, conviertes tu ordenador en un mini proveedor de IA. Así, es capaz de responder preguntas, generar texto, resumir documentos o ejecutar funciones de razonamiento, todo sin conexión a internet. Este servidor local replica el funcionamiento de la API de OpenAI, así que cualquier app o servicio diseñado para trabajar con esa API puede servirse de él con un simple cambio en la URL base.
Puedes, por ejemplo, conectar scripts en Python, agentes de LangChain, extensiones de editores o aplicaciones web locales de forma directa, local y offline. Sin duda, una maravilla. Utilizar el servidor API de GPT4All es especialmente útil para aquellas aplicaciones que requieren de privacidad total. A continuación, veamos el procedimiento para activar esta función y empezar a aprovecharla al máximo.
Cómo activar y utilizar el servidor API de GPT4All

Naturalmente, antes de configurar la API es necesario contar con la aplicación de escritorio de GPT4All en tu sistema. El entorno es multiplataforma y soporta Windows, macOS y distribuciones de Linux, como Ubuntu. Damos por sentado que ya lo tienes instalado, pero, si no, puedes descargar el ejecutable desde la página de Nomic AI.
Cuando inicias la aplicación por primera ver, puedes seleccionar y descargar al menos un modelo conversacional. También puedes importar modelos descargados manualmente para usarlos desde la app GPT4All. La rapidez de respuesta dependerá en buena medida del hardware instalado, principalmente RAM y CPU.
Por defecto, la interfaz gráfica de GPT4All funciona únicamente como una aplicación de chat, similar a ChatGPT. Para permitir que aplicaciones externas realicen peticiones de inferencia, tienes que habilitar el servidor HTTP que viene incorporado. El proceso es muy sencillo e intuitivo:
- Abre la aplicación GPT4All en tu ordenador.
- Navega hasta el menú de Configuración.
- En el menú de la izquierda, haz clic en Aplicación.
- Desplázate hacia abajo hasta encontrar la sección Avanzado.
- Busca y marca la casilla Habilitar el servidor API local. Al hacerlo, la aplicación empezará a escuchar peticiones en el puerto que se especifica en el campo inferior, que por defecto es el 4891.
Una vez activado, el servidor se ejecutará en segundo plano mientras la aplicación de escritorio esté abierta. Un detalle importante es que el servidor solo escucha en localhost (127.0.0.1) y utiliza el protocolo HTTP, no HTTPS. Esto es ideal para entornos de desarrollo local, pero si necesitas exponerlo a otros dispositivos en tu red, deberías considerar usar un proxy inverso.
Endpoints principales

Con el servidor en marcha, ya puedes interactuar con él. Para utilizar el servidor API de GPT4All es esencial conocer los principales endpoints disponibles. La URL base de la API será http://localhost:4891/v1, y los demás puntos de acceso son:
- GET /v1/models: Devuelve una lista con todos los modelos que tienes disponibles en tu instalación de GPT4All. Es muy útil para verificar que el servidor está funcionando y para saber el nombre exacto que debes usar en tus peticiones.
- POST /v1/completions: El endpoint clásico para generar texto a partir de un prompt simple. Se utiliza principalmente para modelos de completado.
- POST /v1/chat/completions: El endpoint moderno y más versátil. Está diseñado para el formato de «chat», donde se envían listas de mensajes con roles (system, user, assistant). Es el que debes usar en la gran mayoría de los casos, ya que la mayoría de los modelos actuales se entrenan con este formato.
Utilizar el servidor API de GPT4All: Ejemplos prácticos de uso
Vamos a ver un par de ejemplos prácticos de cómo utilizar el servidor API de GPT4all. La forma más rápida de probarla es utilizando cURL desde tu terminal. El servidor acepta solicitudes POST con un cuerpo JSON. Copia y pega el siguiente comando simple:
curl -X POST http://localhost:4891/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "DeepSeek-R1-Distill-Llama-8B-abliterated.Q2_K.gguf",
"messages": [
{"role": "user", "content": "¿Cuál es la capital de Francia?"}
],
"max_tokens": 100,
"temperature": 0.7
}'
En este comando, especificamos el modelo y su formato, que es DeepSeek-R1 en formato GGUF. Antes de ejecutar el comando, asegúrate de anotar el nombre completo del modelo que tengas instalado en GPT4All. Para saberlo, ver a http://localhots:4891/v1/models, copia el ID del modelo y reemplázalo. Por último, ejecuta el comando y el servidor procesará la petición y devolverá una respuesta en formato JSON.
Ejemplo con la librería OpenAI de Python
Si ya estás familiarizado con el ecosistema de OpenAI, adaptar tu código a GPT4All es pan comido. La clave está en cambiar el base_URL. Mira el siguiente ejemplo:
from openai import OpenAI
# Creamos el cliente apuntando a nuestro servidor local
client = OpenAI(
base_url="http://localhost:4891/v1",
# La API key no es necesaria, pero se puede dejar un valor dummy
api_key="not-needed",
)
# Realizamos una petición de chat
chat_completion = client.chat.completions.create(
model="DeepSeek-R1-Distill-Llama-8B-abliterated.Q2_K.gguf",
messages=[
{"role": "system", "content": "Eres un asistente útil y conciso."},
{"role": "user", "content": "Explícame qué es la inteligencia artificial."}
],
max_tokens=200,
temperature=0.2,
)
# Imprimimos la respuesta
print(chat_completion.choices[0].message.content)
Como puedes ver, el código es idéntico a como lo harías con la API de OpenAI. Esto facilita mucho la migración de aplicaciones enteras a un entorno local y privado. También, la API del servidor GPT4All utiliza parámetros similares a los de OpenAI, como model (nombre del modelo), messages (listas de mensajes estilo ChatGPT), temperature (controla la creatividad), max_tokens (límite de tokens generados) y stream (habilita streaming de respuestas).
¡Y ya está! De esta manera puedes activar y utilizar el servidor API de GPT4All para conectar otras apps y servicios. Está claro que se trata de una herramienta poderosa para integrar modelos de lenguaje locales en todo tipo de proyectos. Es fácil de usar, compatible con los estándares conocidos y, lo mejor, 100% privada. ¡Ya puedes empezar a experimentar!
Desde muy joven he sentido una gran curiosidad por todo lo relacionado con los avances científicos y tecnológicos, en especial aquellos que nos hacen la vida más fácil y entretenida. Me encanta estar al tanto de las últimas novedades y tendencias, y compartir mis experiencias, opiniones y consejos sobre los equipos y gadgets que uso. Esto me llevó a convertirme en redactor web hace poco más de cinco años, enfocado principalmente a los dispositivos Android y sistemas operativos Windows. He aprendido a explicar con palabras simples aquello que resulta complicado para que mis lectores puedan entenderlo fácilmente.
