Guía Completa para Personalizar el Prompt del Sistema en Ollama

Última actualización: 14/08/2026

  • Uso de Modelfiles para definir comportamientos persistentes y personalidades únicas en los LLM.
  • Gestión de parámetros técnicos como la temperatura y la ventana de contexto para optimizar respuestas.
  • Implementación de prompts de sistema a través de la CLI, la API REST y capas de compatibilidad.
  • Importación de modelos externos en formatos GGUF y Safetensors para ampliar las capacidades locales.

Representación conceptual de inteligencia artificial con un robot humanoide de rostro digital, ideal para ilustrar la esencia de los modelos de lenguaje en Ollama.

¿Cómo cambiar el prompt del sistema de un modelo en Ollama? Si te has sumergido en el mundo de la inteligencia artificial local, probablemente ya sepas que Ollama es la herramienta estrella para levantar modelos de lenguaje sin depender de la nube. Pero llega un momento en que el comportamiento estándar del modelo no es suficiente y necesitas que la IA actúe de una forma muy concreta, ya sea como un experto en ciberseguridad, un guía turístico o un programador meticuloso. Aquí es donde entra en juego el prompt del sistema, esa instrucción maestra que define la personalidad y las reglas de juego del modelo antes de que el usuario escriba la primera palabra.

Configurar estas directrices puede parecer un lío al principio, pero en realidad Ollama ofrece varias rutas para lograrlo, desde ajustes rápidos en la terminal hasta la creación de modelos personalizados mediante archivos de configuración. En este artículo vamos a desgranar cada una de estas opciones para que puedas dejar tu LLM niquelado y adaptado exactamente a lo que necesitas, aprovechando al máximo el hardware de tu máquina y evitando que la IA se vaya por las ramas.

Personalización mediante Modelfiles: La receta del modelo

La forma más robusta de cambiar el prompt del sistema es utilizando un Modelfile. Imaginalo como un Dockerfile pero para modelos de IA; es un archivo de texto donde defines la base, los parámetros y el comportamiento. La instrucción clave aquí es SYSTEM, donde escribes la directriz que el modelo debe seguir a rajatabla. Por ejemplo, puedes decirle que sea un asistente conciso que nunca use jerga técnica.

Contenido exclusivo - Clic Aquí  Cómo Escribir en una Imagen en Word 2016

Para crear uno, primero usas un editor como nano y defines la instrucción FROM para elegir el modelo base, como Llama 3.2 o Mistral. Después, añades la línea SYSTEM \»Tu instrucción aquí\». Una vez guardado, ejecutas el comando ollama create nombre-modelo -f ./Modelfile. De esta manera, habrás generado una variante del modelo original que ya viene con esa personalidad integrada, evitándote tener que repetir el prompt en cada sesión.

Además del sistema, el Modelfile permite ajustar el TEMPLATE, que es la estructura que usa Ollama para organizar los mensajes del sistema, el usuario y el asistente. Esto es vital porque cada modelo está entrenado con etiquetas específicas (como <|im_start>) y, si la plantilla es incorrecta, el modelo podría perder la coherencia o ignorar tus instrucciones.

Primer plano de una terminal de comandos retro con iluminación vívida, representando el uso de la CLI y comandos como /set system en Ollama.

Ajustes rápidos desde la CLI y el modo interactivo

Si no quieres crear un modelo nuevo cada vez que cambies de tarea, puedes hacer ajustes sobre la marcha mientras chateas. Dentro de la sesión de ollama run, existe un comando especial: /set system. Al escribir esto seguido de tu instrucción, cambias el comportamiento del modelo al instante para esa sesión específica. Si ves que el resultado es bueno y quieres conservarlo, puedes usar /save nombre-sesion para guardar esa configuración como un nuevo modelo.

Otra opción para quienes prefieren no entrar en el modo interactivo es usar la bandera -p o –parameters al lanzar el modelo. Aunque esto sirve más para ajustes técnicos, es una vía rápida para modificar la experiencia. También es posible redirigir archivos de texto hacia el modelo usando el operador <, lo que permite pasar un contexto enorme (como un documento técnico) y pedirle al modelo que lo resuma o analice basándose en el prompt del sistema activo.

Código de programación colorido en un monitor, perfecto para ilustrar la creación y edición de Modelfiles para personalizar el comportamiento de la IA.

Control técnico: Parámetros que afectan al prompt

El prompt del sistema no vive solo; su eficacia depende de ciertos parámetros internos. El más crítico es el num_ctx, que define la ventana de contexto. Si estableces un prompt de sistema muy largo y además pasas muchos documentos, podrías saturar la memoria del modelo, haciendo que olvide las instrucciones iniciales. Ajustar este valor mediante PARAMETER num_ctx en el Modelfile es fundamental para mantener la coherencia en chats extensos.

Contenido exclusivo - Clic Aquí  Bitly añade una página de vista previa en enlaces gratuitos: todo lo que debes saber

También tenemos la temperature, que controla la creatividad. Para un prompt de sistema que exige rigor factual (como un asistente legal), conviene bajar la temperatura a 0.2. Si buscas algo más disruptivo o creativo, subirla a 0.8 o más hará que la IA sea más impredecible. Otros ajustes como top_p y top_k ayudan a filtrar las palabras más probables, refinando la precisión de la respuesta según la personalidad que hayas definido.

Racks de servidores en un centro de datos, simbolizando la infraestructura local y la gestión de recursos de hardware necesaria para ejecutar LLMs.

Integración programática vía API y compatibilidad con OpenAI

Para los desarrolladores, la API REST de Ollama es el camino más eficiente. El endpoint /api/chat permite enviar una lista de mensajes donde puedes definir explícitamente un objeto con el role: \»system\». Esta es la forma más limpia de gestionar prompts dinámicos que cambian según el usuario o la aplicación, sin necesidad de crear cientos de modelos en el disco.

Además, Ollama incluye una capa de compatibilidad con la API de OpenAI en la ruta /v1/. Esto significa que cualquier librería diseñada para GPT-4 puede funcionar con tu modelo local simplemente cambiando la base_url a http://localhost:11434/v1/. Así, puedes usar el cliente de Python de OpenAI para enviar mensajes de sistema a un Llama 3 local, simplificando la migración de proyectos de la nube al entorno local.

Ingeniera utilizando un portátil frente a servidores, representando la configuración técnica y la optimización de VRAM y GPU para Ollama.

Importación de modelos externos y cuantización

No todo ocurre dentro de la biblioteca oficial de Ollama. Puedes importar modelos en formato GGUF o Safetensors desde Hugging Face. Para ello, creas un Modelfile donde la instrucción FROM apunte a la ruta del archivo .gguf. Es aquí donde el prompt del sistema es más crítico, ya que debes asegurarte de que la plantilla de prompt (TEMPLATE) coincida exactamente con la que el creador del modelo utilizó durante el entrenamiento.

Contenido exclusivo - Clic Aquí  Cómo deshabilitar la copia de seguridad de WhatsApp

Si el modelo que importas es demasiado pesado, Ollama permite la cuantización durante la creación usando la bandera -q. Al reducir la precisión de los pesos (por ejemplo, a q4_K_M), el modelo ocupa menos VRAM y responde más rápido, aunque debes vigilar que esta compresión no degrade la capacidad del modelo para seguir instrucciones complejas del sistema.

Gestión de recursos y optimización de GPU

Para que el prompt del sistema se ejecute con fluidez, el modelo debe estar cargado preferiblemente en la VRAM de la GPU. Puedes comprobar esto con el comando ollama ps. Si ves que una parte del modelo se ha desplazado a la CPU, la velocidad de inferencia caerá drásticamente. En sistemas multi-GPU, puedes usar variables de entorno como CUDA_VISIBLE_DEVICES para elegir qué tarjeta procesará la carga.

Para evitar que el modelo consuma recursos cuando no lo usas, puedes jugar con la variable OLLAMA_KEEP_ALIVE. Si la pones en 0, el modelo se descargará de la memoria inmediatamente después de responder. Por el contrario, ponerla en -1 mantendrá la IA siempre lista, eliminando el tiempo de carga inicial pero acaparando la memoria de video de tu tarjeta gráfica.

Dominar la configuración de Ollama implica saber equilibrar la potencia del hardware con la precisión de las instrucciones. Desde la sencillez de un comando /set system hasta la complejidad de un Modelfile con adaptadores LoRA y cuantización, tienes todas las herramientas para transformar un LLM genérico en una herramienta especializada. La clave está en experimentar con la temperatura y la ventana de contexto para que el prompt del sistema se ejecute sin errores y con la máxima naturalidad posible.