Ejecuta Hermes con modelos locales: sin API key, sin cuenta, funciona sin conexión

Es viernes por la tarde, vas en tren con el portátil abierto y quieres pasarle a Hermes un código que has ojeado durante el día — pero descubres que tu cuota de API se ha agotado, mientras la GPU dedicada que llevas en la bolsa no ha hecho otra cosa que jugar. O estás revisando un contrato que todavía no es público y no quieres que ni un solo carácter pase por el servidor de la nube de nadie, ni siquiera en tránsito. Desde principios de septiembre de 2026, Hermes ha convertido «ejecutar modelos grandes en local» de un hobby endiablado en un interruptor de un clic: descarga y mantiene por ti el motor de inferencia llama.cpp, elige la compilación adecuada de cada modelo para tu hardware y gestiona la memoria de la GPU de principio a fin. Sin cuenta, sin API key — y, una vez descargado el modelo, funciona totalmente sin conexión.
Por qué montar modelos locales por tu cuenta era un suplicio
Si alguna vez has intentado ejecutar un modelo abierto en tu propia máquina, conoces el calvario. Primero instalas un motor de inferencia (llama.cpp, Ollama o similar). Luego vas a la caza de un archivo GGUF — el formato de empaquetado estándar de la comunidad que mete los pesos y la arquitectura de un modelo en un único archivo. Pero eso solo es el principio: descargas interrumpidas que tienes que repetir a mano; errores de falta de VRAM que te obligan a averiguar qué capas volcar a la RAM del sistema y en qué orden; una ventana de contexto que arranca demasiado pequeña; y decisiones de cuantización (comprimir los pesos a menor precisión para ahorrar memoria — ¿Q4 u Q8?) que parecen decididas a cara o cruz.
Herramientas como Ollama resolvieron parte de eso. Hermes va más lejos y asume toda la cadena — motor, descargas y colocación de la memoria — dejándote con tres clics.
El proceso de escritorio en tres pasos
En una compilación actual de Hermes Desktop, abre Configuración → Proveedores → Modelos locales. En macOS y Windows esta entrada ahora es visible por defecto. Después:
- Haz clic en «Instalar runtime». Hermes descarga la compilación oficial de llama.cpp para tu hardware (unos cientos de MB), la verifica y la mantiene actualizada en futuras versiones. llama.cpp es el motor de código abierto que ejecuta el modelo en tu GPU o CPU.
- Elige un modelo del catálogo y haz clic en «Descargar».
- Haz clic en «Usar». Los chats nuevos se ejecutan a partir de entonces en el modelo local.
El servidor se inicia y se detiene junto con Hermes y sobrevive a los reinicios de la aplicación. Volver a un proveedor en la nube es un clic en el selector de modelos.
Qué hay en el catálogo — y si tu GPU puede ejecutarlo
El catálogo seleccionado contiene actualmente cuatro modelos, del tamaño de uso diario a la clase frontier:
| Modelo | Perfil | Requisito de hardware |
|---|---|---|
| Qwen3.8 27B | Modelo agente polivalente; admite visión; el contexto largo sigue siendo rápido | GPU de 16GB+: lo ejecuta con alta calidad |
| Qwen3.6 35B-A3B | Modelo de mezcla de expertos más grande, con predicción multitoken | GPU de 16GB+; con más margen, más estable |
| Qwen3.8 Flash Next | Modelo de escala frontier | Exige una GPU muy grande |
| DeepSeek V4 Flash | Modelo de clase frontier | Máquinas con 128GB+ de memoria |
Antes de descargar nada, cada fila se contrasta con tu máquina: ajuste de memoria (verde = se ejecuta por completo en la memoria de la GPU, ámbar = se desborda a la RAM del sistema y va más lento, rojo = esta máquina no puede ejecutarlo), ventana de contexto y tamaño de la descarga. Hermes elige la compilación de mayor calidad que cabe entera en tu GPU — y nunca ofrece nada por debajo de cuantización de 4 bits, porque por debajo de eso la pérdida de calidad es demasiado grave. Una máquina que no puede albergar la versión de 4 bits simplemente no puede ejecutar ese modelo, y te lo dice sin rodeos.
El catálogo es un punto de partida seleccionado, no una frontera. Buscar más modelos en la misma página rastrea todo Hugging Face, con una comprobación de ajuste por archivo dimensionada para tu máquina antes de descargar. ¿Ya tienes un .gguf en disco? Añadir archivo de modelo lo enlaza en tu biblioteca sin copiarlo, listo para usar al instante.
Gestión de memoria: el trabajo sucio, resuelto
Los modelos locales viven o mueren según dónde se coloque la memoria, así que Hermes la gestiona de principio a fin y no expone ningún mando:
- La ventana de contexto arranca con un tamaño que cabe por completo en tu GPU y crece hacia el máximo nativo del modelo según la conversación va necesitando más espacio. Si ves «Ventana de contexto ampliada» en el feed de estado durante sesiones largas, eso es la ventana expandiéndose — no un error.
- Todo modelo recomendado recibe al menos una ventana de contexto de 64K. Cuando un modelo es más grande que la memoria de tu GPU, Hermes coloca deliberadamente el excedente en la RAM del sistema en el orden que menos perjudica (primero los pesos de los expertos, nunca la caché de atención) — sacrificando algo de velocidad para proteger la garantía de contexto.
- La compresión solo entra en acción al llegar a la ventana máxima del modelo. El crecimiento siempre va primero; tu historial no se resume de forma preventiva.
- Los modelos inactivos se descargan a los 15 minutos para liberar memoria de la GPU y se recargan automáticamente con el siguiente mensaje.
¿Quieres verlo en acción? Haz clic con el botón derecho en la barra de estado y activa Recursos del sistema para ver la utilización de la GPU, la memoria de la GPU y la RAM en directo. El medidor de contexto refleja siempre la ventana con la que el modelo se está ejecutando realmente.
Privacidad y modo sin conexión: una vez descargado, nada sale de la máquina
Este es el sentido de los modelos locales, dicho sin rodeos: sin cuenta, sin API key y sin acceso a la red una vez descargado el modelo. Los prompts, las llamadas a herramientas, el código — todo se queda local. Para código sin publicar, contratos o datos médicos, eso no es «algo más tranquilizador»: es una categoría distinta. La solicitud nunca sale de tu ordenador.
Hermes también respeta los entornos que ya ejecutan la inferencia en otro sitio:
- Si ya hay un llama-server en marcha en tu máquina, Hermes lo detecta y lo usa en lugar de lanzar el suyo propio.
- Para un control manual total, apunta
model.providera cualquier servidor compatible con OpenAI. - Con Ollama, MLX o compilaciones personalizadas, la documentación oficial incluye guías dedicadas de configuración de Ollama y de ejecución en Mac.
Configuración: CLI y máquinas headless
La interfaz de escritorio escribe la configuración por ti, pero las claves están abiertas para la CLI y las máquinas headless. El runtime gestionado se controla desde la sección local_runtime de config.yaml:
local_runtime:
enabled: true # true = arranca el servidor gestionado junto con Hermes
backend: auto # auto | cuda | metal | vulkan | hip | cpu
# auto = CUDA en NVIDIA, Metal en macOS, Vulkan en otras GPU; si no, CPU
Los modelos y las compilaciones del runtime viven en el directorio de inicio de Hermes (models/ y runtimes/llamacpp/). Convertir un modelo local en tu modelo principal usa los ajustes estándar model.provider: llamacpp + model.default — la misma forma que cualquier otro proveedor, seleccionable de forma interactiva con hermes model.
Requisitos y estado del lanzamiento
- Windows y Linux: GPU NVIDIA (CUDA) o CPU. macOS: Apple Silicon (Metal). Las compilaciones Vulkan dan servicio a las GPU AMD.
- Una GPU con 8GB+ ejecuta con comodidad los modelos más pequeños del catálogo; con 16GB+ los modelos de 27–35B corren con alta calidad.
- Las descargas se verifican byte a byte contra el catálogo; una descarga incompleta se elimina y se notifica, nunca se usa a medias. (Los archivos zip del motor del runtime se verifican con SHA-256.)
Una advertencia honesta: esta capacidad llegó vía PR #100667 (el runtime gestionado en sí, fusionado el 1 de septiembre) y PR #101823 (punto de entrada activado por defecto en macOS/Windows, fusionado el 3 de septiembre). Ahora mismo vive en main y todavía no ha salido en ninguna versión publicada — es más reciente que v0.21.0. Para probarlo hoy, actualiza Hermes a la última main; en el escritorio, asegúrate de que la compilación incluya ambas fusiones. Para contexto sobre hacia dónde se dirige el producto, mira las notas de la versión v0.21.0 Pantheon y nuestra guía para elegir modelos.
Resumen: de «¿podrá ejecutarlo?» a «un clic»
El avance real de los modelos locales no es que un modelo se haya vuelto más potente — es que la barrera ha desaparecido: el motor se instala solo, la compilación se elige sola, la memoria se gestiona sola y los modelos inactivos se descargan solos. Lo que antes te costaba una tarde entera leyendo tutoriales ahora son tres clics en Configuración. La próxima vez que estés en un sitio sin conexión — o delante de un material que no quieres entregar a la nube — recuerda que hay un agente que ha vivido en tu máquina todo este tiempo. Solo necesitaba que alguien lo despertara. Empieza por la guía de instalación y busca después la entrada de modelos locales en el selector de modelos (referencia del comando hermes model).